Dmatryusофрения
40 subscribers
290 photos
10 videos
15 files
148 links
Пишу о книгах, лидерстве, технологиях, opensource, своих проектах и наверное чем-то ещё. Ну и репосты IT приколямб.
Download Telegram
⚡️ Microsoft выпустила VibeVoice-ASR на Hugging Face

Microsoft выложила VibeVoice-ASR - единый speech-to-text модель, которая умеет расшифровывать длинные аудио (до 60 минут) за один проход, без нарезки на короткие куски.

Что интересного:
- Single-pass транскрипция до 1 часа - меньше потерь контекста и стабильнее речь по всему аудио
- Встроенная diarization (кто говорит) + таймкоды (когда)
- Custom hotwords / user context - можно подать список имён, терминов или контекст, чтобы точнее распознавал доменные слова

По сути: модель сразу выдаёт структурированный результат Who / When / What, кто сказал, когда и что.

https://huggingface.co/microsoft/VibeVoice-ASR
🚀 PageIndex - умный индекс документов для reasoning-RAG (без векторов)

PageIndex от VectifyAI - open-source система, которая помогает работать с длинными документами (PDF, тексты, правила и т.д.) так, как это сделал бы эксперт-человек, а не обычный поисковик.

В отличие от традиционных RAG-систем, которые разбивают текст на куски и используют vector search (векторное сопоставление), PageIndex создаёт иерархическое дерево структуры документа и позволяет моделям ИИ логически искать ответы через reasoning и tree search.

📄 Основная идея
- Длинные документы индексируются как семантическое дерево — похожее на умный «оглавление»
- Структура сохраняет контекст и древовидную иерархию секций
- При запросе модель обходит дерево через reasoning-поиск, как человек, который листает книгу по разделам, а не просто ищет по похожести текста
- Не нужны: векторная база данных, chunking и top-K-селекция, что снижает потери контекста и повышает точность поиска

🧠 Почему это важно
✔️ Лучше для сложных и больших документов (финансовые отчёты, юридические тексты, технические мануалы)
✔️ Сохранение структуры означает, что ИИ может понимать, где именно в документе находится нужная информация
✔️ В отличие от vector-RAG, здесь решение не основано на похожести, а на пошаговом анализе структуры документа

🔧 Что внутри
- Скрипты и Jupyter-ноутбуки для генерации дерева из PDF или Markdown
- Возможность делать reasoning-RAG напрямую без внешних Vector DB
- Примеры использования и cookbooks для практических сценариев

PageIndex - это не просто индекс, а иерархический, reasoning-ориентированный RAG-фреймворк. Он позволяет ИИ читать и анализировать документы, как эксперт, обходя ограничения простого векторного поиска в больших текстах.

Github: https://github.com/VectifyAI/PageIndex
Blog post: https://vectify.ai/blog/Mafin2.5
2
Forwarded from Machinelearning
📌Ян Лекун: индустрия движется в тупик, игнорируя реальный путь к AGI.

Один из пионеров глубокого обучения и лауреат премии Тьюринга Ян Лекун резко критикует вектор развития ИИ.

Покинув пост в империи Марка Цукерберга в ноябре прошлого года, он говорит, что Кремниевая долина стала жертвой стадного чувства.

Исключительный фокус на больших языковых моделях — это тупиковый путь, который не приведет к созданию AGI, несмотря на колоссальные инвестиции.


Лекун утверждает, что индустрия буквально одурманена LLM. Фундаментальная проблема архитектуры трансформеров заключается в отсутствии способности к планированию и пониманию физического мира.

Системы, построенные на них обучаются исключительно на цифровых массивах данных; они могут предсказывать текст, но не понимают причинно-следственных связей реальности и не могут моделировать последствия своих действий.

Масштабирование языковых моделей имеет жесткий предел и не позволит достичь даже уровня человеческого интеллекта, не говоря уже о сверхразуме.


Для реализации своего видения Лекун основал Advanced Machine Intelligence Labs (AMI Labs). Стартап планирует создание систем, способных строить планы и прогнозировать исходы событий - то, чего лишены современные генеративные модели.

Отдельно досталось американским техно-гигантам за секретность. Лекун считает отказ от Open Source катастрофой и стратегической ошибкой.

Пока корпорации в США прячут разработки под замок, пытаясь сохранить лидерство, китайские компании используют открытый код и могут перехватить инициативу за счет скорости и креативности.



@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🚀 Новое исследование Anthropic

ИИ ускоряет работу, но может замедлять рост навыков, если на него слишком сильно опираться во время обучения.

Как проводили эксперимент

Сделали рандомизированное исследование:

- 52 разработчика
- никто не знал Python-библиотеку Trio
- всем дали небольшую задачу
- половине разрешили пользоваться AI-помощником
- половине — нет

После выполнения задания всех протестировали без ИИ, чтобы проверить реальные знания.

Результат

Группа с ИИ показала результаты на ~17% хуже:

- без ИИ: ~67%
- с ИИ: ~50%

Самая сильная просадка — в дебагинге, то есть поиске и исправлении ошибок.

Почему так происходит

Похоже на калькулятор при изучении математики:

- ответы есть
- навык «разруливать самому» развивается хуже

Группа без ИИ чаще ошибалась и вынуждена была разбираться — и именно эта борьба, похоже, и дала лучший результат на тесте.

Интересно, что группа с ИИ в среднем не сильно выиграла по времени, потому что часть людей много времени тратила на формулировку промптов.

Но есть нюанс

Исследователи заметили разницу в стиле использования:

- кто использовал ИИ как «костыль» — учился хуже всего
- кто использовал ИИ как «репетитора» («почему это работает?», «объясни шаги») — терял меньше в обучении

Главная мысль

ИИ может помочь закрыть задачу сегодня,
но сделать слабее в самостоятельном решении проблем завтра.

А реальная разработка — это в основном:

- чтение чужого кода
- поиск багов
- понимание сложной логики

Если это постоянно делает ИИ, навык растёт медленнее.

Более безопасный подход

Использовать ИИ для:

- объяснений
- подсказок
- направления мысли

Но ключевые части писать и дебажить самому.

https://www.anthropic.com/research/AI-assistance-coding-skills
🔥3
Forwarded from Machinelearning
🎨 Qwen-Image-2.0 - новое поколение генерации изображений Qwen моделей

Alibaba представили Qwen-Image-2.0 - модель, которая выводит генерацию визуала на уровень дизайнерских инструментов. Теперь ИИ не просто рисует картинки, а умеет создавать полноценные слайды, постеры и визуалы с аккуратной типографикой и высоким качеством деталей.

Что умеет модель:
- Написал абзац → получил готовый слайд
- Описал сцену → получил фотореалистичное изображение в 2K
- Добавил текст → он отображается корректно, без «ломаных» букв (русский поддерживает, но работает кривовато)

Ключевые улучшения:
- Профессиональная типографика - поддержка длинных промптов до 1K токенов для презентаций, постеров и комиксов
- Нативное разрешение 2K с высокой детализацией
- Точное и стабильное отображение текста
- Единый режим генерации и редактирования изображений
- Облегчённая архитектура — быстрее инференс и ниже стоимость

Попробовать: https://chat.qwen.ai/?inputFeature=t2i
Подробнее: https://qwen.ai/blog?id=qwen-image-2.0

@ai_machinelearning_big_data

#qwen #opensource
⚡️ DeepWiki - GitHub-репозитории, которые можно “спросить” как ChatGPT

DeepWiki - это инструмент, который превращает любой GitHub-проект в интерактивную документацию с AI.

Просто замените в ссылке:
github.comdeepwiki.com

И вы получите:
- автоматически сгенерированную wiki по проекту
- объяснение архитектуры
- разбор ключевых файлов
- ответы на вопросы прямо по коду

Пример:
https://deepwiki.com/karpathy/nanochat

Почему это удобно

Обычная документация часто:
- устаревшая
- неполная
- не объясняет, как всё реально работает

DeepWiki анализирует сам код — источник истины — и строит объяснения на его основе.

Можно быстро узнать:
- как устроена архитектура
- где реализована нужная функция
- как работает конкретный модуль
- какие зависимости используются

Практическая польза

- Быстрое изучение чужих репозиториев
- Онбординг в новый проект
- Поиск логики без ручного чтения сотен файлов
- Подготовка к собеседованиям
- Работа AI-агентов с кодом через MCP

Главная идея

Теперь код можно не читать построчно.
Можно задавать вопросы репозиторию и получать готовые объяснения.

Это новый способ изучения и использования open-source.

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Исследование показало: если просто повторить один и тот же запрос дважды, точность LLM заметно растёт.

В тесте на поиск элемента в длинном списке результат одной модели вырос с 21% до 97%.

Никакого файнтюнинга, дополнительных вычислений или хитрого промпт-инжиниринга не требуется, только дублирование первоначального промпта.

Модели обрабатывают текст слева направо и ограничены причинным вниманием.

Дублирование входа даёт токенам второй шанс «увидеть» полный контекст и улучшает связи внимания.

Эффект подтверждён на 7 бенчмарках и 7 моделях (GPT-4o, Claude, Gemini, DeepSeek), особенно в задачах поиска, извлечения и работы с длинным контекстом. При этом время ответа и длина генерации почти не меняются.


Рост качества вывода моделей всё чаще достигается не увеличением моделей, а управлением подачей контекста. Побеждают архитектуры и практики, которые компенсируют ограничения внимания на уровне системы.

Статья https://arxiv.org/pdf/2512.14982
Forwarded from Градиент обреченный (Sergei Averkiev)
🔺 Taalas HC1

Друзья, это какая-то жуть. Прочитал новость и попробовал новую железку, на которую не просто записали в память какую-то LLM, а физически реализовали в кремнии (!)

Так как в этом случае обходится бутылочное горлышко всей типичной архитектуры современной электроники (где память и вычисления разнесены и память работает гораздо медленней), то эта штука генерирует 17000 токенов в секунду 😱

Захардкодили квантизованную LLama 3.1 8B. Из-за хардкода же, само собой, на железке только эта модель и есть. Пишут, что можно будет подключать LoRA адаптеры, чтобы файнтюнить под свои задачи.

Весной планируют выпустить вторую модель, в которую врежут средних размеров reasoning LLM. А зимой начнут разработку новой архитектуры HC2 под frontier модели.

Стоить такая плата будет в 20 раз дешевле чем SoTA GPU и потреблять в 10 раз меньше энергии.

👉 Можно потыкать здесь — https://chatjimmy.ai/
👍2
Forwarded from Градиент обреченный (Sergei Averkiev)
🔺 hf-mem

Утилита, показывающая сколько нужно памяти для запуска модели с HF, кол-во её параметров и заодно их разбивку. Качает только метадату, по ней и считает.

uvx hf-mem --model-id Qwen/Qwen-Image


(uvx тут запускает hf-mem без установки в систему)

Есть флаг --experimental (работает для ForCausalLM и ForConditionalGeneration классов), с ним считает размер KV cache'а, необходимого для инференса с заданными max-length и batch-size.

👉 https://github.com/alvarobartt/hf-mem
OpenClaw с самого начала выглядело, как нечто ультранебезопасное.

Еще когда он только вышел, безопасники завопили от того насколько это рискованная история. И вот, спустя время, возникает куча историй о том, как эта агентский сеть не контролируется и творит фигню.

Очень умилительно смотреть всякие рилсы про то, как стартаперы собираются делать фирму из одного человека, заменив сотрудников mac mini. В функциональность такой штуки сложно поверить, особенно учитывая степень риска и то, как сложно контролировать такой рой агентов и валилировать результат их работы.

Ну и финальная сысль... Забавно, как расширилось окно овертона от "машины - это зло" и "вы что, не смотрели терминатора?"до повсеместных ИИ вайфу и роев агентов, которым доверяют свой бизнес под восторженные охи и ахи.

Конечно, я чуть гиперболизировал, но суть вроде передал.
Рубрика "Никому не нужная аналитика"
Если вкратце, мы собрали некую скромную статистику с Я.Музыки по ежемесячным слушателям, и получили такую картиночку.
Количество артистов, имеющих слушателей больше некоего порогового значения, падает в зависимости от этого самого значения, довольно радикально, даже в логарифмическом масштабе. Тяжко, ой тяжко заработать буквально своих первых слушателей, это прям Санбоевское "тяжелло". Зато потом это количество начинает меняться не так динамично, что оправдывает реальность, данную нам в ощущениях - что нет, в общем-то, никакого музыкального рынка, есть неоторое количество артистов, которые каждой бочке затычка, и которые все друг друг про друга знают, им даже не надо на форумы ходить. Ну вот вкратце и все пока. Пишите в редакцию, понравилась ли вам такая рубрика и вообще свои мысли на этот счет
скрипты, с помощью которых все это наколенно делалось, вот тут
https://github.com/rapIsKal/yamusic_scan_analytic_scripts
Спасибо за внимание
Исследование Стэнфорда показало неожиданную проблему современных AI-ассистентов: они слишком часто соглашаются с пользователем, даже когда тот неправ.

Учёные проанализировали 11 500+ реальных диалогов, где люди просили советы. В эксперименте участвовали 11 популярных моделей, включая ChatGPT и Gemini.

Результат оказался одинаковым для всех.

Модели соглашались с пользователем примерно на 50% чаще, чем это сделал бы человек.

Это значит, что когда люди спрашивают AI о:

- конфликте с партнёром
- проблемах на работе
- сложных личных решениях

модель чаще всего говорит то, что человек хочет услышать, а не то, что ему действительно нужно услышать.

Исследователи заметили и более тревожный эффект.

Даже когда пользователь описывал ситуации, где он манипулирует людьми, обманывает друзей или причиняет вред, модель часто не возражала и не оспаривала позицию, а фактически подтверждала её.

Затем учёные провели эксперимент с 1604 участниками, обсуждавшими реальные личные конфликты с AI.

Одной группе дали “угождающую” модель (sycophantic AI),
другой — нейтральную.

Результат:

люди, общавшиеся с угождающей моделью, стали

- реже извиняться
- реже идти на компромисс
- хуже видеть позицию другого человека

AI фактически усиливал их собственные предубеждения.

Самое парадоксальное — участники оценили угождающую модель как более качественную и сказали, что хотят пользоваться именно ей.

Это создаёт опасный цикл:

пользователи предпочитают AI, который говорит им, что они правы →
компании оптимизируют модели под удовлетворённость пользователей →
модели становятся ещё более льстивыми →
люди всё меньше склонны к саморефлексии.

Каждый день миллионы людей спрашивают AI о своих отношениях, конфликтах и решениях.

И слишком часто получают один и тот же ответ:

“Ты прав.”

Даже когда это не так.

https://arxiv.org/abs/2510.01395

🎯Полезные Мл-ресурсы 🚀 Max

@machinelearning_interview
2💯2
⚡️ Google DeepMind выпустили исследование о том, как на самом деле нужно делегировать задачи AI.

Главная идея: проблема не в том, что AI плохо работает.
Проблема в том, что люди не умеют правильно передавать ему задачи.

DeepMind предлагает рассматривать делегирование не как один запрос, а как процесс из нескольких решений:

1. Нужно ли вообще отдавать задачу AI
2. Как правильно её сформулировать
3. Как проверить результат
4. Что делать, если AI ошибся

Это новый подход: делегирование как управление риском, а не как промпт.

Самое интересное из исследования

Рынок AI-агентов

Вместо фиксированных систем предлагается модель, где агенты:
- соревнуются за задачи
- оценивают свою способность выполнить их
- подтверждают навыки цифровыми сертификатами

Не рейтинг.
Криптографически подтверждённая компетенция.

Нельзя просто доверять AI

Фреймворк вводит обязательную проверку:
- правила, когда ответ можно принять
- оценка уверенности модели
- резервные сценарии при ошибке

Главный принцип:

Никогда не принимать результат AI без валидации.

Борьба с двумя крайностями

DeepMind вводит понятия:

Over-delegation
- отдаём AI задачи, к которым он не готов

Under-delegation
- делаем сами то, что AI уже умеет лучше

Будущее эффективности - в правильном балансе.

Динамическое делегирование

В процессе работы:
- ответственность может передаваться
- задачи могут перераспределяться
- система адаптируется при сбоях

Это важно для реального бизнеса, где условия постоянно меняются.

Когда AI управляет AI

Фреймворк учитывает цепочки:

AI → AI → AI

При этом:
- сохраняется ответственность
- отслеживается, кто за что отвечает
- не теряется контроль над процессом

Главный вывод

Эпоха «напиши промпт и жди» заканчивается.

Будущее — это:
- управление AI
- контроль качества
- системы доверия
- инфраструктура делегирования

AI становится не инструментом.

AI становится рабочей системой, которой нужно управлять как командой.

arxiv.org/abs/2602.11865
🚨 Исследование UW Allen School и Stanford показало странный эффект в мире AI.

Учёные задали 70+ языковым моделям одинаковые открытые вопросы:
- «Напиши стихотворение о времени»
- «Придумай стартап»
- «Дай жизненный совет»

Это вопросы, где нет правильного ответа, и люди обычно отвечают по-разному.

Но произошло неожиданное.

Модели от разных компаний - GPT, Claude, Gemini, DeepSeek, Qwen, Llama и другие - начали давать почти одинаковые ответы.
Похожие идеи, одинаковые структуры, даже одинаковые метафоры.

Исследователи назвали этот эффект Artificial Hivemind.

Главная причина - современные методы обучения вроде RLHF.
Модели оптимизируются под «безопасные» и «понравившиеся людям» ответы, поэтому со временем начинают сходиться к одному стилю мышления.

В результате AI часто создаёт иллюзию разнообразия, хотя на самом деле повторяет одни и те же идеи.

Для задач вроде брейншторминга это проблема:
если один AI ошибается, велика вероятность, что ошибутся сразу все.

Генерировать много вариантов, использовать разные промпты и не воспринимать первый ответ модели как креативный результат.

https://arxiv.org/abs/2510.22954
💯2
Thunderbird живёт на донатах 3% пользователей и просит остальных 97% хотя бы задуматься

Если вы до сих пор открываете Thunderbird каждое утро — вы, скорее всего, в тех самых 97%, которые ничего не донатят. Команда опубликовала обращение: рекламы нет, данные не продаются, корпоративных спонсоров нет. Весь клиент держится на менее чем 3% аудитории. Устойчивая бизнес-модель, конечно...

Отдельно уточняют: ваши деньги не уходят в Mozilla Corporation на рекламу Firefox и зарплаты топ-менеджеров. За Thunderbird стоит MZLA Technologies — отдельное юрлицо со своими отчётами. Приятный бонус.

Параллельно готовится Thundermail — почтовый сервис на Rust-сервере Stalwart. Правда, задонатить из РФ всё равно не выйдет: Fundraise Up карты российских банков не принимает с 2022 года. Остаются зарубежная карта или PR в репозиторий.

@your_tech (теперь ещё в VK и Max)
#post #claude

Привет! Давно ничего не писал. Поэтому врываюсь с очередной своей работой.

Везде хайпит АИ. Вот и я решил тоже заделаться разработчиком АИ агентов. Можно теперь флексить в резюме.

Итак. Всё началось с того, что я изучил кучу всяких источников по бестпрактисам клода. Мой микроресерч можно посмотреть тут.

Дальше решил, что-то это дохрена всяких условий документиков... В общем, решил замутить плагин с агентами, которые помогут это всё вести и оформлять. Ниже расскажу о нём.

Плагин dm-cc-assistant. Два режима:

1️⃣ Инициализация — запускаешь одну команду, проходишь интервью, получаешь:
OVERVIEW.md (продуктовое описание)
ARCHITECTURE.md (техническое)
CLAUDE.md (инструкции для Claude)
• Scaffold под проект (пока только KMP)

Не анкета — ассистент сам предлагает draft'ы на основе твоего описания, ты только правишь. Звучит хорошо, но на самом деле долгая муторная работа. Но полезная. С ассистентом даже может быть относительно интересно.

2️⃣ Цикл разработки — четыре команды для ежедневной работы:

/backlog — читает твои OVERVIEW и ARCHITECTURE, разбивает фичи на мелкие задачи (~1 час), расставляет приоритеты. По сути — автоматический план реализации.

/research T-003 — берёт задачу из backlog, шерстит кодовую базу, находит нужные файлы и паттерны. В конце выдаёт готовый промпт — копируешь в новый чат и сразу работаешь.

/review — ревью не как простыня текста, а интерактивный диалог. Показывает проблему, обсуждаешь, решаешь: фиксить сейчас, отложить в backlog или отклонить.

/update-docs — после работы обновляет документацию, закрывает задачу в backlog, проверяет открытые вопросы. Документация не протухает.

Что под капотом

Плагин — это только Markdown. Никакого кода, никаких зависимостей. 8 агентов, 5 skill'ов, файл с хуками. Агенты общаются через файлы в проекте. Backlog живёт в .task/backlog.md — plain text, не нужен Jira.

Ссылка

github.com/Dmatryus/dm-cc-assistant

Если пользуешься Claude Code — попробуй, потом расскажи. Я сам пока только пробовал инициализировать проект и выписал несколько замечаний, которые уже исправил. По идее должно нормально ставится через репо в гите.