Dmatryusофрения
40 subscribers
290 photos
10 videos
15 files
148 links
Пишу о книгах, лидерстве, технологиях, opensource, своих проектах и наверное чем-то ещё. Ну и репосты IT приколямб.
Download Telegram
⚡️ DeepWiki - GitHub-репозитории, которые можно “спросить” как ChatGPT

DeepWiki - это инструмент, который превращает любой GitHub-проект в интерактивную документацию с AI.

Просто замените в ссылке:
github.comdeepwiki.com

И вы получите:
- автоматически сгенерированную wiki по проекту
- объяснение архитектуры
- разбор ключевых файлов
- ответы на вопросы прямо по коду

Пример:
https://deepwiki.com/karpathy/nanochat

Почему это удобно

Обычная документация часто:
- устаревшая
- неполная
- не объясняет, как всё реально работает

DeepWiki анализирует сам код — источник истины — и строит объяснения на его основе.

Можно быстро узнать:
- как устроена архитектура
- где реализована нужная функция
- как работает конкретный модуль
- какие зависимости используются

Практическая польза

- Быстрое изучение чужих репозиториев
- Онбординг в новый проект
- Поиск логики без ручного чтения сотен файлов
- Подготовка к собеседованиям
- Работа AI-агентов с кодом через MCP

Главная идея

Теперь код можно не читать построчно.
Можно задавать вопросы репозиторию и получать готовые объяснения.

Это новый способ изучения и использования open-source.

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Исследование показало: если просто повторить один и тот же запрос дважды, точность LLM заметно растёт.

В тесте на поиск элемента в длинном списке результат одной модели вырос с 21% до 97%.

Никакого файнтюнинга, дополнительных вычислений или хитрого промпт-инжиниринга не требуется, только дублирование первоначального промпта.

Модели обрабатывают текст слева направо и ограничены причинным вниманием.

Дублирование входа даёт токенам второй шанс «увидеть» полный контекст и улучшает связи внимания.

Эффект подтверждён на 7 бенчмарках и 7 моделях (GPT-4o, Claude, Gemini, DeepSeek), особенно в задачах поиска, извлечения и работы с длинным контекстом. При этом время ответа и длина генерации почти не меняются.


Рост качества вывода моделей всё чаще достигается не увеличением моделей, а управлением подачей контекста. Побеждают архитектуры и практики, которые компенсируют ограничения внимания на уровне системы.

Статья https://arxiv.org/pdf/2512.14982
Forwarded from Градиент обреченный (Sergei Averkiev)
🔺 Taalas HC1

Друзья, это какая-то жуть. Прочитал новость и попробовал новую железку, на которую не просто записали в память какую-то LLM, а физически реализовали в кремнии (!)

Так как в этом случае обходится бутылочное горлышко всей типичной архитектуры современной электроники (где память и вычисления разнесены и память работает гораздо медленней), то эта штука генерирует 17000 токенов в секунду 😱

Захардкодили квантизованную LLama 3.1 8B. Из-за хардкода же, само собой, на железке только эта модель и есть. Пишут, что можно будет подключать LoRA адаптеры, чтобы файнтюнить под свои задачи.

Весной планируют выпустить вторую модель, в которую врежут средних размеров reasoning LLM. А зимой начнут разработку новой архитектуры HC2 под frontier модели.

Стоить такая плата будет в 20 раз дешевле чем SoTA GPU и потреблять в 10 раз меньше энергии.

👉 Можно потыкать здесь — https://chatjimmy.ai/
👍2
Forwarded from Градиент обреченный (Sergei Averkiev)
🔺 hf-mem

Утилита, показывающая сколько нужно памяти для запуска модели с HF, кол-во её параметров и заодно их разбивку. Качает только метадату, по ней и считает.

uvx hf-mem --model-id Qwen/Qwen-Image


(uvx тут запускает hf-mem без установки в систему)

Есть флаг --experimental (работает для ForCausalLM и ForConditionalGeneration классов), с ним считает размер KV cache'а, необходимого для инференса с заданными max-length и batch-size.

👉 https://github.com/alvarobartt/hf-mem
OpenClaw с самого начала выглядело, как нечто ультранебезопасное.

Еще когда он только вышел, безопасники завопили от того насколько это рискованная история. И вот, спустя время, возникает куча историй о том, как эта агентский сеть не контролируется и творит фигню.

Очень умилительно смотреть всякие рилсы про то, как стартаперы собираются делать фирму из одного человека, заменив сотрудников mac mini. В функциональность такой штуки сложно поверить, особенно учитывая степень риска и то, как сложно контролировать такой рой агентов и валилировать результат их работы.

Ну и финальная сысль... Забавно, как расширилось окно овертона от "машины - это зло" и "вы что, не смотрели терминатора?"до повсеместных ИИ вайфу и роев агентов, которым доверяют свой бизнес под восторженные охи и ахи.

Конечно, я чуть гиперболизировал, но суть вроде передал.
Рубрика "Никому не нужная аналитика"
Если вкратце, мы собрали некую скромную статистику с Я.Музыки по ежемесячным слушателям, и получили такую картиночку.
Количество артистов, имеющих слушателей больше некоего порогового значения, падает в зависимости от этого самого значения, довольно радикально, даже в логарифмическом масштабе. Тяжко, ой тяжко заработать буквально своих первых слушателей, это прям Санбоевское "тяжелло". Зато потом это количество начинает меняться не так динамично, что оправдывает реальность, данную нам в ощущениях - что нет, в общем-то, никакого музыкального рынка, есть неоторое количество артистов, которые каждой бочке затычка, и которые все друг друг про друга знают, им даже не надо на форумы ходить. Ну вот вкратце и все пока. Пишите в редакцию, понравилась ли вам такая рубрика и вообще свои мысли на этот счет
скрипты, с помощью которых все это наколенно делалось, вот тут
https://github.com/rapIsKal/yamusic_scan_analytic_scripts
Спасибо за внимание
Исследование Стэнфорда показало неожиданную проблему современных AI-ассистентов: они слишком часто соглашаются с пользователем, даже когда тот неправ.

Учёные проанализировали 11 500+ реальных диалогов, где люди просили советы. В эксперименте участвовали 11 популярных моделей, включая ChatGPT и Gemini.

Результат оказался одинаковым для всех.

Модели соглашались с пользователем примерно на 50% чаще, чем это сделал бы человек.

Это значит, что когда люди спрашивают AI о:

- конфликте с партнёром
- проблемах на работе
- сложных личных решениях

модель чаще всего говорит то, что человек хочет услышать, а не то, что ему действительно нужно услышать.

Исследователи заметили и более тревожный эффект.

Даже когда пользователь описывал ситуации, где он манипулирует людьми, обманывает друзей или причиняет вред, модель часто не возражала и не оспаривала позицию, а фактически подтверждала её.

Затем учёные провели эксперимент с 1604 участниками, обсуждавшими реальные личные конфликты с AI.

Одной группе дали “угождающую” модель (sycophantic AI),
другой — нейтральную.

Результат:

люди, общавшиеся с угождающей моделью, стали

- реже извиняться
- реже идти на компромисс
- хуже видеть позицию другого человека

AI фактически усиливал их собственные предубеждения.

Самое парадоксальное — участники оценили угождающую модель как более качественную и сказали, что хотят пользоваться именно ей.

Это создаёт опасный цикл:

пользователи предпочитают AI, который говорит им, что они правы →
компании оптимизируют модели под удовлетворённость пользователей →
модели становятся ещё более льстивыми →
люди всё меньше склонны к саморефлексии.

Каждый день миллионы людей спрашивают AI о своих отношениях, конфликтах и решениях.

И слишком часто получают один и тот же ответ:

“Ты прав.”

Даже когда это не так.

https://arxiv.org/abs/2510.01395

🎯Полезные Мл-ресурсы 🚀 Max

@machinelearning_interview
2💯2
⚡️ Google DeepMind выпустили исследование о том, как на самом деле нужно делегировать задачи AI.

Главная идея: проблема не в том, что AI плохо работает.
Проблема в том, что люди не умеют правильно передавать ему задачи.

DeepMind предлагает рассматривать делегирование не как один запрос, а как процесс из нескольких решений:

1. Нужно ли вообще отдавать задачу AI
2. Как правильно её сформулировать
3. Как проверить результат
4. Что делать, если AI ошибся

Это новый подход: делегирование как управление риском, а не как промпт.

Самое интересное из исследования

Рынок AI-агентов

Вместо фиксированных систем предлагается модель, где агенты:
- соревнуются за задачи
- оценивают свою способность выполнить их
- подтверждают навыки цифровыми сертификатами

Не рейтинг.
Криптографически подтверждённая компетенция.

Нельзя просто доверять AI

Фреймворк вводит обязательную проверку:
- правила, когда ответ можно принять
- оценка уверенности модели
- резервные сценарии при ошибке

Главный принцип:

Никогда не принимать результат AI без валидации.

Борьба с двумя крайностями

DeepMind вводит понятия:

Over-delegation
- отдаём AI задачи, к которым он не готов

Under-delegation
- делаем сами то, что AI уже умеет лучше

Будущее эффективности - в правильном балансе.

Динамическое делегирование

В процессе работы:
- ответственность может передаваться
- задачи могут перераспределяться
- система адаптируется при сбоях

Это важно для реального бизнеса, где условия постоянно меняются.

Когда AI управляет AI

Фреймворк учитывает цепочки:

AI → AI → AI

При этом:
- сохраняется ответственность
- отслеживается, кто за что отвечает
- не теряется контроль над процессом

Главный вывод

Эпоха «напиши промпт и жди» заканчивается.

Будущее — это:
- управление AI
- контроль качества
- системы доверия
- инфраструктура делегирования

AI становится не инструментом.

AI становится рабочей системой, которой нужно управлять как командой.

arxiv.org/abs/2602.11865
🚨 Исследование UW Allen School и Stanford показало странный эффект в мире AI.

Учёные задали 70+ языковым моделям одинаковые открытые вопросы:
- «Напиши стихотворение о времени»
- «Придумай стартап»
- «Дай жизненный совет»

Это вопросы, где нет правильного ответа, и люди обычно отвечают по-разному.

Но произошло неожиданное.

Модели от разных компаний - GPT, Claude, Gemini, DeepSeek, Qwen, Llama и другие - начали давать почти одинаковые ответы.
Похожие идеи, одинаковые структуры, даже одинаковые метафоры.

Исследователи назвали этот эффект Artificial Hivemind.

Главная причина - современные методы обучения вроде RLHF.
Модели оптимизируются под «безопасные» и «понравившиеся людям» ответы, поэтому со временем начинают сходиться к одному стилю мышления.

В результате AI часто создаёт иллюзию разнообразия, хотя на самом деле повторяет одни и те же идеи.

Для задач вроде брейншторминга это проблема:
если один AI ошибается, велика вероятность, что ошибутся сразу все.

Генерировать много вариантов, использовать разные промпты и не воспринимать первый ответ модели как креативный результат.

https://arxiv.org/abs/2510.22954
💯2
Thunderbird живёт на донатах 3% пользователей и просит остальных 97% хотя бы задуматься

Если вы до сих пор открываете Thunderbird каждое утро — вы, скорее всего, в тех самых 97%, которые ничего не донатят. Команда опубликовала обращение: рекламы нет, данные не продаются, корпоративных спонсоров нет. Весь клиент держится на менее чем 3% аудитории. Устойчивая бизнес-модель, конечно...

Отдельно уточняют: ваши деньги не уходят в Mozilla Corporation на рекламу Firefox и зарплаты топ-менеджеров. За Thunderbird стоит MZLA Technologies — отдельное юрлицо со своими отчётами. Приятный бонус.

Параллельно готовится Thundermail — почтовый сервис на Rust-сервере Stalwart. Правда, задонатить из РФ всё равно не выйдет: Fundraise Up карты российских банков не принимает с 2022 года. Остаются зарубежная карта или PR в репозиторий.

@your_tech (теперь ещё в VK и Max)
#post #claude

Привет! Давно ничего не писал. Поэтому врываюсь с очередной своей работой.

Везде хайпит АИ. Вот и я решил тоже заделаться разработчиком АИ агентов. Можно теперь флексить в резюме.

Итак. Всё началось с того, что я изучил кучу всяких источников по бестпрактисам клода. Мой микроресерч можно посмотреть тут.

Дальше решил, что-то это дохрена всяких условий документиков... В общем, решил замутить плагин с агентами, которые помогут это всё вести и оформлять. Ниже расскажу о нём.

Плагин dm-cc-assistant. Два режима:

1️⃣ Инициализация — запускаешь одну команду, проходишь интервью, получаешь:
OVERVIEW.md (продуктовое описание)
ARCHITECTURE.md (техническое)
CLAUDE.md (инструкции для Claude)
• Scaffold под проект (пока только KMP)

Не анкета — ассистент сам предлагает draft'ы на основе твоего описания, ты только правишь. Звучит хорошо, но на самом деле долгая муторная работа. Но полезная. С ассистентом даже может быть относительно интересно.

2️⃣ Цикл разработки — четыре команды для ежедневной работы:

/backlog — читает твои OVERVIEW и ARCHITECTURE, разбивает фичи на мелкие задачи (~1 час), расставляет приоритеты. По сути — автоматический план реализации.

/research T-003 — берёт задачу из backlog, шерстит кодовую базу, находит нужные файлы и паттерны. В конце выдаёт готовый промпт — копируешь в новый чат и сразу работаешь.

/review — ревью не как простыня текста, а интерактивный диалог. Показывает проблему, обсуждаешь, решаешь: фиксить сейчас, отложить в backlog или отклонить.

/update-docs — после работы обновляет документацию, закрывает задачу в backlog, проверяет открытые вопросы. Документация не протухает.

Что под капотом

Плагин — это только Markdown. Никакого кода, никаких зависимостей. 8 агентов, 5 skill'ов, файл с хуками. Агенты общаются через файлы в проекте. Backlog живёт в .task/backlog.md — plain text, не нужен Jira.

Ссылка

github.com/Dmatryus/dm-cc-assistant

Если пользуешься Claude Code — попробуй, потом расскажи. Я сам пока только пробовал инициализировать проект и выписал несколько замечаний, которые уже исправил. По идее должно нормально ставится через репо в гите.
Dmatryusофрения
#post #claude Обновил версию. Появился скилл для подготовки рилиза и плагин теперь ориентирован на запуск параллельных агентов + мелкие изменения для более комфортной работы. https://github.com/Dmatryus/dm-cc-assistant/releases/tag/v0.2.1
#post #claude

🚀 dm-cc-assistant v0.3.0 — Autonomous Epic Lifecycle

Большая итерация плагина для Claude Code. Шаг от «помощника по чеклистам» к *автономному оркестратору эпика*.

_«Долго думаем → автономно делаем → структурированный отчёт → диалог.»_

4 команды вместо 7:
/backlog — двухуровневая модель эпик/подзадача + sync с docs
/plan — 7-фазное планирование активного эпика
/execute — *автономный параллельный прогон* в git worktree'ах
/release — готовит материалы локально, не релизит сам

Главная новинка — /execute: один pre-execute confirm, и агент сам гонит подзадачи волнами параллельно в отдельных worktree'ах, мёрджит между волнами с 3-уровневой резолюцией конфликтов (combine → auto-pick → user dialog только для high-stakes), запускает code-review, собирает агрегированный отчёт и ведёт 4-шаговый финальный диалог.

Что ещё:

• Двухуровневая модель backlog'а (E-001 с подзадачами E-001.1)
[Priority] теги в ARCHITECTURE §9 / §10
• Edit log convention для всех генерируемых файлов
• Auto-archive в /release при ## Done > 5

Breaking: удалены /research, /review, /update-docs, /release full — поглощены новыми командами. Авто-миграция backlog'а из v0.2 — внутри /backlog (4 опции: Migrate / Wipe / Keep-legacy / Abort).

🔗 [GitHub Release](https://github.com/Dmatryus/dm-cc-assistant/releases/tag/v0.3.0)
🔗 [Migration guide](https://github.com/Dmatryus/dm-cc-assistant/blob/main/.task/migration-v0.3.0.md)
Я - клиент 😊
🫡3
Dmatryusофрения
#post #claude 🚀 dm-cc-assistant v0.3.0 — Autonomous Epic Lifecycle Большая итерация плагина для Claude Code. Шаг от «помощника по чеклистам» к *автономному оркестратору эпика*. _«Долго думаем → автономно делаем → структурированный отчёт → диалог.»_ 4 команды…
У моего плагина появились первые пользователи (помимо меня, конечно) и позитивные отзывы и ишьюсы. Правда пока сообщенные устно, но все равно приятно, что не очередная поделка на одного человека 😊

Значит забрасывать совсем не буду. Есть идея для версии 0.4.0 и по-моему она суперская 🥰
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
С каждым месяцем мой скилл разработки с LLM растет, а опыт обогащается. Изначально я создавал плагин, как сборник лучших практик. Я думаю пойти дальше и сделать не просто плагин, а инструмент, который будет основан прежде всего на моем опыте, а во вторую очередь на лучших практиках. Пока нет четких мыслей, что конкретно это будет, но есть четкое понимание, что оно нужно.

В недалеком будущем появится довольно большой объем нейрослопного легаси, который написали джуны или того хуже менеджеры. Но это будут продукты, которые необходимо будет поддерживать, развивать и перерабатывать архитектурно. Синьоры грезят, что им за это будут много платить, но я бы не был столь оптимистичен. В любом случае, я хочу, чтобы в этом будущем у каждого технобата был инструмент для разгребания нейросвалки. Работа нудная и масштабная, но необходимая. Взрыв LLM порождает огромное количество энтропии и кому-то придется все это приводить в порядок. ⚫️

Пока это все просто крик души, но если будут новые идеи по поводу, буду делиться.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
Последствия вайбкодинга


Вайбкодинг — это генерация на ощущениях, без осмысления того, что получается. Вот к чему это приводит.

LLM обесценила производство кода, но не его осмысление. Генерировать стало почти бесплатно, понимать — нет. Кода прибывает больше, чем человек успевает рассмотреть.

Главный дефицит — внимание, а не понимание. Нельзя неправильно понять то, на что не смотрел. Под сроками внимание утекает в результат: цели достигаются, но за фасадом успеха копится долг.

Модель не спасёт от неэффективного использования — и не должна. LLM стохастична: гарантию вероятностный процесс не даёт в принципе. Дисциплина — это слой снаружи генератора, а не внутри него. И чем мощнее модель, тем больше она производит на единицу твоего внимания — потребность в дисциплине не падает, а растёт.

Внимание стоит тратить на источник, а не на продукт. Не досматривать сгенерированный код, а вкладываться вверх по течению — в описательную документацию: как устроен проект, из чего состоит, что переиспользуемо, что неизменно. Документация первична: не код документируется потом, а код порождается из документации. Это работа, которую нельзя отдать агенту. Человек владеет источником, агент — порождением. Отдашь структуру модели — она заполнит её правдоподобной мутью.

Нейрокод правдоподобно врёт. Обычное легаси честно уродливо — беспорядок сам сигналит, где опасно. Нейрокод выглядит чисто, но может делать не то, что о себе сообщает: за ним нет автора-носителя намерения. Интуиция «чисто — значит норм» ломается.
👍42🔥2
Как вы поняли, вайбкодинг сейчас для меня важная тема (дед хайпует). Так что вот вам спизженные мемы по теме.
😁4