Dmatryusофрения
40 subscribers
290 photos
10 videos
15 files
148 links
Пишу о книгах, лидерстве, технологиях, opensource, своих проектах и наверное чем-то ещё. Ну и репосты IT приколямб.
Download Telegram
У меня были те же ощущения, поэтому снёс курсор после нескольких дней исследования.
🧠 Исследование Carnegie Mellon: Cursor ускоряет разработку до 3–4x - но с ценой

Учёные из Carnegie Mellon проанализировали 807 репозиториев, где разработчики перешли на Cursor
(по конфигам вроде `.cursorrules`), и сравнили их с 1380 контрольными проектами - до и после внедрения.

Метод difference-in-differences:
сравнивали одни и те же репы *до/после*, плюс контролировали тренды по месяцам.

🚀 Что произошло с “скоростью кода”
Code Velocity = коммиты + строки кода.

- в первый месяц - скачок 3–5x по строкам
- в среднем после внедрения - +1.84x к скорости

ИИ реально ускоряет работу - и это измеряемо, а не ощущение.

🧩 Но есть побочные эффекты
Качество оценивали через SonarQube
(надёжность, поддерживаемость, безопасность, дубликаты, когнитивная сложность).

- статические предупреждения - +30%
- сложность кода - +41%
- через это скорость начинает проседать со временем

ИИ помогает писать больше - но не всегда лучше.

💡 Вывод
Cursor даёт реальный прирост продуктивности, особенно в начале.
Но выигрывают те, кто сочетает ИИ с:

- тестами
- код-ревью
- quality gates
- статанализом

ИИ-агенты - ускорители,
а качество всё ещё требует инженера.

arxiv.org/abs/2511.04427v2
Я потратил на это свои новогодние. Достойно осуждения.

Но кроме шуток, намутил довольно клёвый генератор синтетики для ML задач. Дальше планирую сравнить Duck DB с Polars на данных оттуда.

https://github.com/Dmatryus/DmDSLab
Перед новогодними и в новогодние приспичило написать на телефон несколько апок. Заодно попробовал разные кросс-платформенные фреймворки — эта цель тоже была. Делюсь выводами:

KMP (Kotlin Multiplatform)
Фреймворк от JetBrains с официальной поддержкой Google. Прямой доступ к нативным API, можно в любой момент уйти в полностью нативный код, а что шарить между платформами — решаешь сам.
Мой выбор. Достаточно мощный, и на нём реально пишут промышленные приложения. Зрелая экосистема, понятная архитектура.

⚠️ Flutter
Фреймворк от Google на языке Dart. Рисует свой UI — не использует нативные компоненты платформы, а отрисовывает всё сам через графический движок.
Идея крутая, разработка быстрая. Но построен на автоматической кодогенерации — в итоге проект захламляется, много лишнего в гите, сложнее следить за состоянием.

Kivy
Python-фреймворк для мобильной и десктопной разработки. Рисует свой UI через OpenGL — как и Flutter, не использует нативные компоненты.
Концептуально нравится: чистый Python и полный контроль над рендерингом. Но: неочевидная система сборки, мало примеров, промышленно не используется. И главное — интерфейс выглядит топорно.

Flet
Python-обёртка над Flutter — идея в том, чтобы писать на Python, а под капотом работает Flutter.
Интересная концепция. Но сырой, код нестабильный, промышленно тоже не применяется.
Вау! Интересное. Попробую использовать для составления отчетов по собесам. Хотя очень сомневаюсь, что в русский может.
⚡️ Microsoft выпустила VibeVoice-ASR на Hugging Face

Microsoft выложила VibeVoice-ASR - единый speech-to-text модель, которая умеет расшифровывать длинные аудио (до 60 минут) за один проход, без нарезки на короткие куски.

Что интересного:
- Single-pass транскрипция до 1 часа - меньше потерь контекста и стабильнее речь по всему аудио
- Встроенная diarization (кто говорит) + таймкоды (когда)
- Custom hotwords / user context - можно подать список имён, терминов или контекст, чтобы точнее распознавал доменные слова

По сути: модель сразу выдаёт структурированный результат Who / When / What, кто сказал, когда и что.

https://huggingface.co/microsoft/VibeVoice-ASR
🚀 PageIndex - умный индекс документов для reasoning-RAG (без векторов)

PageIndex от VectifyAI - open-source система, которая помогает работать с длинными документами (PDF, тексты, правила и т.д.) так, как это сделал бы эксперт-человек, а не обычный поисковик.

В отличие от традиционных RAG-систем, которые разбивают текст на куски и используют vector search (векторное сопоставление), PageIndex создаёт иерархическое дерево структуры документа и позволяет моделям ИИ логически искать ответы через reasoning и tree search.

📄 Основная идея
- Длинные документы индексируются как семантическое дерево — похожее на умный «оглавление»
- Структура сохраняет контекст и древовидную иерархию секций
- При запросе модель обходит дерево через reasoning-поиск, как человек, который листает книгу по разделам, а не просто ищет по похожести текста
- Не нужны: векторная база данных, chunking и top-K-селекция, что снижает потери контекста и повышает точность поиска

🧠 Почему это важно
✔️ Лучше для сложных и больших документов (финансовые отчёты, юридические тексты, технические мануалы)
✔️ Сохранение структуры означает, что ИИ может понимать, где именно в документе находится нужная информация
✔️ В отличие от vector-RAG, здесь решение не основано на похожести, а на пошаговом анализе структуры документа

🔧 Что внутри
- Скрипты и Jupyter-ноутбуки для генерации дерева из PDF или Markdown
- Возможность делать reasoning-RAG напрямую без внешних Vector DB
- Примеры использования и cookbooks для практических сценариев

PageIndex - это не просто индекс, а иерархический, reasoning-ориентированный RAG-фреймворк. Он позволяет ИИ читать и анализировать документы, как эксперт, обходя ограничения простого векторного поиска в больших текстах.

Github: https://github.com/VectifyAI/PageIndex
Blog post: https://vectify.ai/blog/Mafin2.5
2
Forwarded from Machinelearning
📌Ян Лекун: индустрия движется в тупик, игнорируя реальный путь к AGI.

Один из пионеров глубокого обучения и лауреат премии Тьюринга Ян Лекун резко критикует вектор развития ИИ.

Покинув пост в империи Марка Цукерберга в ноябре прошлого года, он говорит, что Кремниевая долина стала жертвой стадного чувства.

Исключительный фокус на больших языковых моделях — это тупиковый путь, который не приведет к созданию AGI, несмотря на колоссальные инвестиции.


Лекун утверждает, что индустрия буквально одурманена LLM. Фундаментальная проблема архитектуры трансформеров заключается в отсутствии способности к планированию и пониманию физического мира.

Системы, построенные на них обучаются исключительно на цифровых массивах данных; они могут предсказывать текст, но не понимают причинно-следственных связей реальности и не могут моделировать последствия своих действий.

Масштабирование языковых моделей имеет жесткий предел и не позволит достичь даже уровня человеческого интеллекта, не говоря уже о сверхразуме.


Для реализации своего видения Лекун основал Advanced Machine Intelligence Labs (AMI Labs). Стартап планирует создание систем, способных строить планы и прогнозировать исходы событий - то, чего лишены современные генеративные модели.

Отдельно досталось американским техно-гигантам за секретность. Лекун считает отказ от Open Source катастрофой и стратегической ошибкой.

Пока корпорации в США прячут разработки под замок, пытаясь сохранить лидерство, китайские компании используют открытый код и могут перехватить инициативу за счет скорости и креативности.



@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🚀 Новое исследование Anthropic

ИИ ускоряет работу, но может замедлять рост навыков, если на него слишком сильно опираться во время обучения.

Как проводили эксперимент

Сделали рандомизированное исследование:

- 52 разработчика
- никто не знал Python-библиотеку Trio
- всем дали небольшую задачу
- половине разрешили пользоваться AI-помощником
- половине — нет

После выполнения задания всех протестировали без ИИ, чтобы проверить реальные знания.

Результат

Группа с ИИ показала результаты на ~17% хуже:

- без ИИ: ~67%
- с ИИ: ~50%

Самая сильная просадка — в дебагинге, то есть поиске и исправлении ошибок.

Почему так происходит

Похоже на калькулятор при изучении математики:

- ответы есть
- навык «разруливать самому» развивается хуже

Группа без ИИ чаще ошибалась и вынуждена была разбираться — и именно эта борьба, похоже, и дала лучший результат на тесте.

Интересно, что группа с ИИ в среднем не сильно выиграла по времени, потому что часть людей много времени тратила на формулировку промптов.

Но есть нюанс

Исследователи заметили разницу в стиле использования:

- кто использовал ИИ как «костыль» — учился хуже всего
- кто использовал ИИ как «репетитора» («почему это работает?», «объясни шаги») — терял меньше в обучении

Главная мысль

ИИ может помочь закрыть задачу сегодня,
но сделать слабее в самостоятельном решении проблем завтра.

А реальная разработка — это в основном:

- чтение чужого кода
- поиск багов
- понимание сложной логики

Если это постоянно делает ИИ, навык растёт медленнее.

Более безопасный подход

Использовать ИИ для:

- объяснений
- подсказок
- направления мысли

Но ключевые части писать и дебажить самому.

https://www.anthropic.com/research/AI-assistance-coding-skills
🔥3
Forwarded from Machinelearning
🎨 Qwen-Image-2.0 - новое поколение генерации изображений Qwen моделей

Alibaba представили Qwen-Image-2.0 - модель, которая выводит генерацию визуала на уровень дизайнерских инструментов. Теперь ИИ не просто рисует картинки, а умеет создавать полноценные слайды, постеры и визуалы с аккуратной типографикой и высоким качеством деталей.

Что умеет модель:
- Написал абзац → получил готовый слайд
- Описал сцену → получил фотореалистичное изображение в 2K
- Добавил текст → он отображается корректно, без «ломаных» букв (русский поддерживает, но работает кривовато)

Ключевые улучшения:
- Профессиональная типографика - поддержка длинных промптов до 1K токенов для презентаций, постеров и комиксов
- Нативное разрешение 2K с высокой детализацией
- Точное и стабильное отображение текста
- Единый режим генерации и редактирования изображений
- Облегчённая архитектура — быстрее инференс и ниже стоимость

Попробовать: https://chat.qwen.ai/?inputFeature=t2i
Подробнее: https://qwen.ai/blog?id=qwen-image-2.0

@ai_machinelearning_big_data

#qwen #opensource
⚡️ DeepWiki - GitHub-репозитории, которые можно “спросить” как ChatGPT

DeepWiki - это инструмент, который превращает любой GitHub-проект в интерактивную документацию с AI.

Просто замените в ссылке:
github.comdeepwiki.com

И вы получите:
- автоматически сгенерированную wiki по проекту
- объяснение архитектуры
- разбор ключевых файлов
- ответы на вопросы прямо по коду

Пример:
https://deepwiki.com/karpathy/nanochat

Почему это удобно

Обычная документация часто:
- устаревшая
- неполная
- не объясняет, как всё реально работает

DeepWiki анализирует сам код — источник истины — и строит объяснения на его основе.

Можно быстро узнать:
- как устроена архитектура
- где реализована нужная функция
- как работает конкретный модуль
- какие зависимости используются

Практическая польза

- Быстрое изучение чужих репозиториев
- Онбординг в новый проект
- Поиск логики без ручного чтения сотен файлов
- Подготовка к собеседованиям
- Работа AI-агентов с кодом через MCP

Главная идея

Теперь код можно не читать построчно.
Можно задавать вопросы репозиторию и получать готовые объяснения.

Это новый способ изучения и использования open-source.

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Исследование показало: если просто повторить один и тот же запрос дважды, точность LLM заметно растёт.

В тесте на поиск элемента в длинном списке результат одной модели вырос с 21% до 97%.

Никакого файнтюнинга, дополнительных вычислений или хитрого промпт-инжиниринга не требуется, только дублирование первоначального промпта.

Модели обрабатывают текст слева направо и ограничены причинным вниманием.

Дублирование входа даёт токенам второй шанс «увидеть» полный контекст и улучшает связи внимания.

Эффект подтверждён на 7 бенчмарках и 7 моделях (GPT-4o, Claude, Gemini, DeepSeek), особенно в задачах поиска, извлечения и работы с длинным контекстом. При этом время ответа и длина генерации почти не меняются.


Рост качества вывода моделей всё чаще достигается не увеличением моделей, а управлением подачей контекста. Побеждают архитектуры и практики, которые компенсируют ограничения внимания на уровне системы.

Статья https://arxiv.org/pdf/2512.14982
Forwarded from Градиент обреченный (Sergei Averkiev)
🔺 Taalas HC1

Друзья, это какая-то жуть. Прочитал новость и попробовал новую железку, на которую не просто записали в память какую-то LLM, а физически реализовали в кремнии (!)

Так как в этом случае обходится бутылочное горлышко всей типичной архитектуры современной электроники (где память и вычисления разнесены и память работает гораздо медленней), то эта штука генерирует 17000 токенов в секунду 😱

Захардкодили квантизованную LLama 3.1 8B. Из-за хардкода же, само собой, на железке только эта модель и есть. Пишут, что можно будет подключать LoRA адаптеры, чтобы файнтюнить под свои задачи.

Весной планируют выпустить вторую модель, в которую врежут средних размеров reasoning LLM. А зимой начнут разработку новой архитектуры HC2 под frontier модели.

Стоить такая плата будет в 20 раз дешевле чем SoTA GPU и потреблять в 10 раз меньше энергии.

👉 Можно потыкать здесь — https://chatjimmy.ai/
👍2
Forwarded from Градиент обреченный (Sergei Averkiev)
🔺 hf-mem

Утилита, показывающая сколько нужно памяти для запуска модели с HF, кол-во её параметров и заодно их разбивку. Качает только метадату, по ней и считает.

uvx hf-mem --model-id Qwen/Qwen-Image


(uvx тут запускает hf-mem без установки в систему)

Есть флаг --experimental (работает для ForCausalLM и ForConditionalGeneration классов), с ним считает размер KV cache'а, необходимого для инференса с заданными max-length и batch-size.

👉 https://github.com/alvarobartt/hf-mem
OpenClaw с самого начала выглядело, как нечто ультранебезопасное.

Еще когда он только вышел, безопасники завопили от того насколько это рискованная история. И вот, спустя время, возникает куча историй о том, как эта агентский сеть не контролируется и творит фигню.

Очень умилительно смотреть всякие рилсы про то, как стартаперы собираются делать фирму из одного человека, заменив сотрудников mac mini. В функциональность такой штуки сложно поверить, особенно учитывая степень риска и то, как сложно контролировать такой рой агентов и валилировать результат их работы.

Ну и финальная сысль... Забавно, как расширилось окно овертона от "машины - это зло" и "вы что, не смотрели терминатора?"до повсеместных ИИ вайфу и роев агентов, которым доверяют свой бизнес под восторженные охи и ахи.

Конечно, я чуть гиперболизировал, но суть вроде передал.
Рубрика "Никому не нужная аналитика"
Если вкратце, мы собрали некую скромную статистику с Я.Музыки по ежемесячным слушателям, и получили такую картиночку.
Количество артистов, имеющих слушателей больше некоего порогового значения, падает в зависимости от этого самого значения, довольно радикально, даже в логарифмическом масштабе. Тяжко, ой тяжко заработать буквально своих первых слушателей, это прям Санбоевское "тяжелло". Зато потом это количество начинает меняться не так динамично, что оправдывает реальность, данную нам в ощущениях - что нет, в общем-то, никакого музыкального рынка, есть неоторое количество артистов, которые каждой бочке затычка, и которые все друг друг про друга знают, им даже не надо на форумы ходить. Ну вот вкратце и все пока. Пишите в редакцию, понравилась ли вам такая рубрика и вообще свои мысли на этот счет
скрипты, с помощью которых все это наколенно делалось, вот тут
https://github.com/rapIsKal/yamusic_scan_analytic_scripts
Спасибо за внимание
Исследование Стэнфорда показало неожиданную проблему современных AI-ассистентов: они слишком часто соглашаются с пользователем, даже когда тот неправ.

Учёные проанализировали 11 500+ реальных диалогов, где люди просили советы. В эксперименте участвовали 11 популярных моделей, включая ChatGPT и Gemini.

Результат оказался одинаковым для всех.

Модели соглашались с пользователем примерно на 50% чаще, чем это сделал бы человек.

Это значит, что когда люди спрашивают AI о:

- конфликте с партнёром
- проблемах на работе
- сложных личных решениях

модель чаще всего говорит то, что человек хочет услышать, а не то, что ему действительно нужно услышать.

Исследователи заметили и более тревожный эффект.

Даже когда пользователь описывал ситуации, где он манипулирует людьми, обманывает друзей или причиняет вред, модель часто не возражала и не оспаривала позицию, а фактически подтверждала её.

Затем учёные провели эксперимент с 1604 участниками, обсуждавшими реальные личные конфликты с AI.

Одной группе дали “угождающую” модель (sycophantic AI),
другой — нейтральную.

Результат:

люди, общавшиеся с угождающей моделью, стали

- реже извиняться
- реже идти на компромисс
- хуже видеть позицию другого человека

AI фактически усиливал их собственные предубеждения.

Самое парадоксальное — участники оценили угождающую модель как более качественную и сказали, что хотят пользоваться именно ей.

Это создаёт опасный цикл:

пользователи предпочитают AI, который говорит им, что они правы →
компании оптимизируют модели под удовлетворённость пользователей →
модели становятся ещё более льстивыми →
люди всё меньше склонны к саморефлексии.

Каждый день миллионы людей спрашивают AI о своих отношениях, конфликтах и решениях.

И слишком часто получают один и тот же ответ:

“Ты прав.”

Даже когда это не так.

https://arxiv.org/abs/2510.01395

🎯Полезные Мл-ресурсы 🚀 Max

@machinelearning_interview
2💯2