Forwarded from Сиолошная
Вчера обновился лидерборд SWE-ReBench, с добавлением 51 свежей задачи за октябрь. Для тех кто не следит, напомню, что ребята берут свежие PR из Python-репозиториев, подходящих под некоторые критерии, и прогоняют на них простого агента с разными моделями под капотом.
Первенство остаётся за Sonnet 4.5, который слегка отрывается от GPT-5-medium / Codex в доле решаемых с первого раза задач, но существенно отрывается, если моделям давать по 5 независимых попыток и выбирать лучшую: 57% против 49 и 47% у моделей OpenAI. И даже от Sonnet 4 отрыв тоже 10%.
При этом авторы гоняют бенчмарк на Sonnet 4.5 без рассуждений... но модель всё равно тратит больше токенов чем gpt-5 medium / high. Мне кажется это результат того, что используемый агент (инструменты + промпты) чуть больше отличаются для естественных у моделей OpenAI, чем у Anthropic: OpenAI рекомендует использовать модели так, чтобы им были доступны предыдущие рассуждения в рамках цепочки вызова инструментов, и сейчас на бенчмарке это выбрасывается.
Очень жду, что авторы добавят хотя бы два агента, Claude Code и Codex, и протестируют с ними релевантные модели — было бы интересно увидеть гэп. Он точно есть, см. вот этот бенчмарк от Vercel (там агент авторов даёт 32% для Claude Sonnet 4 / 4.5, но 42% с Claude Code). Вангую, что и тут у моделей обеих компаний качество ощутимо подскочит, но какая будет лучше — хз, наверное, Anthropic.
К другим инсайтам:
— MiniMax M2 «самая экономически эффективная открытая модель из топа», но это на бумаге. Формально она стоит $0.255 / $1.02 против $1.25 / $10.00 за GPT-5 / Codex. Но OpenAI имеют кэширование промптов, которое предназначено как раз для длинных агентских сессий, состоящих из большого количества последовательных шагов. Вы платите на 90% меньше за входные токены, если они уже были обработаны. И по итогу цена за одно решение у M2 $0.44, а у Codex — $0.51. А разница в качестве 25%🎃 При этом вместе с добавлением GPT-5.1 в API вчера OpenAI расширили кэш с 5-10 минут до 24 часов (за ту же цену, правда будет чуть медленее), так что вообще шик.
— Если брать срез в 100 последних задач, то GPT-OSS 120b хоть и существенно отстаёт от фронтира (26.1% vs 44.4%), но... умудряется обгонять: DeepSeek-V3.1, Qwen3-235B, gpt-4.1, o4-mini, gemini-2.5-pro, и это при том, что она стоит 4 цента за задачу — самая дешёвая из всех, от некоторых из указанных моделей отрывается на порядок. Хорошая агентская модель для бейзлайна, получается. Grok Code Fast 1 мог с ней потягаться, за сентябрь у него была такая же цена и +- качество), но авторы не замерили модели xAI в октябре.
Первенство остаётся за Sonnet 4.5, который слегка отрывается от GPT-5-medium / Codex в доле решаемых с первого раза задач, но существенно отрывается, если моделям давать по 5 независимых попыток и выбирать лучшую: 57% против 49 и 47% у моделей OpenAI. И даже от Sonnet 4 отрыв тоже 10%.
При этом авторы гоняют бенчмарк на Sonnet 4.5 без рассуждений... но модель всё равно тратит больше токенов чем gpt-5 medium / high. Мне кажется это результат того, что используемый агент (инструменты + промпты) чуть больше отличаются для естественных у моделей OpenAI, чем у Anthropic: OpenAI рекомендует использовать модели так, чтобы им были доступны предыдущие рассуждения в рамках цепочки вызова инструментов, и сейчас на бенчмарке это выбрасывается.
Очень жду, что авторы добавят хотя бы два агента, Claude Code и Codex, и протестируют с ними релевантные модели — было бы интересно увидеть гэп. Он точно есть, см. вот этот бенчмарк от Vercel (там агент авторов даёт 32% для Claude Sonnet 4 / 4.5, но 42% с Claude Code). Вангую, что и тут у моделей обеих компаний качество ощутимо подскочит, но какая будет лучше — хз, наверное, Anthropic.
К другим инсайтам:
— MiniMax M2 «самая экономически эффективная открытая модель из топа», но это на бумаге. Формально она стоит $0.255 / $1.02 против $1.25 / $10.00 за GPT-5 / Codex. Но OpenAI имеют кэширование промптов, которое предназначено как раз для длинных агентских сессий, состоящих из большого количества последовательных шагов. Вы платите на 90% меньше за входные токены, если они уже были обработаны. И по итогу цена за одно решение у M2 $0.44, а у Codex — $0.51. А разница в качестве 25%
— Если брать срез в 100 последних задач, то GPT-OSS 120b хоть и существенно отстаёт от фронтира (26.1% vs 44.4%), но... умудряется обгонять: DeepSeek-V3.1, Qwen3-235B, gpt-4.1, o4-mini, gemini-2.5-pro, и это при том, что она стоит 4 цента за задачу — самая дешёвая из всех, от некоторых из указанных моделей отрывается на порядок. Хорошая агентская модель для бейзлайна, получается. Grok Code Fast 1 мог с ней потягаться, за сентябрь у него была такая же цена и +- качество), но авторы не замерили модели xAI в октябре.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Love. Death. Transformers.
Vqvae - это вообще-то главная часть в генеративке. Он решает, будет ли модель творить магию или кряхтеть как старый пылесос. Если он плохой - всё плохо.
В Сбере сделали сразу два токенизатора, и оба не просто хорошие - оба обгоняют открытый SOTA и по реконструкции, и по генерации.
2D-KVAE - для изображений, работает чище и аккуратнее нынешних открытых подходов.
3D-KVAE - для видео, и тут та же история: быстрее, точнее и в реконструкции, и в генерации.
Короче, два решения, которые уверенно обходят доступные аналоги.
На Хабре ребята открыто рассказывают, какая это боль - сделать хороший токенизатор, где споткнулись, какие хаки понадобились и почему это вообще важнее, чем кажется. Плюс сравнение с нынешним SOTA, чтобы видеть разницу не на словах.
И вишенка: всё это скоро станет open source.
люди делают не ресерч ради ресерча, а реально что-то серьёзное.
В Сбере сделали сразу два токенизатора, и оба не просто хорошие - оба обгоняют открытый SOTA и по реконструкции, и по генерации.
2D-KVAE - для изображений, работает чище и аккуратнее нынешних открытых подходов.
3D-KVAE - для видео, и тут та же история: быстрее, точнее и в реконструкции, и в генерации.
Короче, два решения, которые уверенно обходят доступные аналоги.
На Хабре ребята открыто рассказывают, какая это боль - сделать хороший токенизатор, где споткнулись, какие хаки понадобились и почему это вообще важнее, чем кажется. Плюс сравнение с нынешним SOTA, чтобы видеть разницу не на словах.
И вишенка: всё это скоро станет open source.
люди делают не ресерч ради ресерча, а реально что-то серьёзное.
Forwarded from Анализ данных (Data analysis)
⚙️ Китайский “невозможный чип” меняет правила игры
В Китае представили разработку, которая может переписать будущее технологий. Речь о новом аналоговом чипе, который не просто обгоняет Nvidia и AMD — он выносит их за счётами.
Что известно:
- до 1000 раз быстрее современных топ-процессоров
- до 100 раз энергоэффективнее
- работает не в логике 1 и 0, а как мозг — обрабатывает непрерывные сигналы прямо в памяти
- никаких задержек, минимум потерь энергии, максимальный интеллект
Учёные заявляют, что решили проблему, над которой бились больше века: добились цифровой точности на аналоговом железе с минимальным потреблением. В тестах новый чип обошёл Nvidia H100 и AMD Vega 20 до 1000x по пропускной способности.
Если технология масштабируется, это может перевернуть всё — от ИИ и дата-центров до связи и робототехники. Начало новой техноэры может наступить намного раньше, чем кто-то ожидал.
https://www.livescience.com/technology/computing/china-solves-century-old-problem-with-new-analog-chip-that-is-1-000-times-faster-than-high-end-nvidia-gpus
В Китае представили разработку, которая может переписать будущее технологий. Речь о новом аналоговом чипе, который не просто обгоняет Nvidia и AMD — он выносит их за счётами.
Что известно:
- до 1000 раз быстрее современных топ-процессоров
- до 100 раз энергоэффективнее
- работает не в логике 1 и 0, а как мозг — обрабатывает непрерывные сигналы прямо в памяти
- никаких задержек, минимум потерь энергии, максимальный интеллект
Учёные заявляют, что решили проблему, над которой бились больше века: добились цифровой точности на аналоговом железе с минимальным потреблением. В тестах новый чип обошёл Nvidia H100 и AMD Vega 20 до 1000x по пропускной способности.
Если технология масштабируется, это может перевернуть всё — от ИИ и дата-центров до связи и робототехники. Начало новой техноэры может наступить намного раньше, чем кто-то ожидал.
https://www.livescience.com/technology/computing/china-solves-century-old-problem-with-new-analog-chip-that-is-1-000-times-faster-than-high-end-nvidia-gpus
Qwen выпустил апдейты DeepResearch и Qwen Code. Кстати, еще и Google раскатал Gemini deep research в мобильном приложении
GitHub
GitHub - QwenLM/qwen-code: An open-source AI coding agent that lives in your terminal.
An open-source AI coding agent that lives in your terminal. - QwenLM/qwen-code
Forwarded from Анализ данных (Data analysis)
🚀 Grok 4.1 - новая фронтир-модель, которая поднимает планку разговорного интеллекта, эмоционального понимания и практической полезности в реальных сценариях.
Grok 4.1 доступен бесплатно на:
• grok.com
• grok.x.com
• мобильных приложениях.
Первое место в LMArena Text Leaderboard (привет старому другу “quasar”) и в EQ-Bench (и даже превосходит Kimi k2).
Модель стала лучше понимать контекст, тон, эмоции и намерения собеседника, а также выдавать более точные и прикладные ответы. Это делает Grok 4.1 одним из наиболее продвинутых решений в своей категории.
https://x.ai/news/grok-4-1
Grok 4.1 доступен бесплатно на:
• grok.com
• grok.x.com
• мобильных приложениях.
Первое место в LMArena Text Leaderboard (привет старому другу “quasar”) и в EQ-Bench (и даже превосходит Kimi k2).
Модель стала лучше понимать контекст, тон, эмоции и намерения собеседника, а также выдавать более точные и прикладные ответы. Это делает Grok 4.1 одним из наиболее продвинутых решений в своей категории.
https://x.ai/news/grok-4-1
🔥1
Forwarded from Refat Talks: Tech & AI
Великий
Делаем агента для европейской маркетинговой компании. Они год мучались с RAG - индексировали, чанкали, перебирали эмбединги, то лагает, то галлюцинирует, то не находит нужное.
Предложил радикально другой подход: выкинуть RAG, вместо этого - Claude Agent SDK + обычная файловая система и MCP как интерфейс. Сделал им прототип - результат настолько лучше, что сначала не поверили. Сравнить можно +/- с тем, насколько Claude Code лучше чем обычный AI чат в кодинге. Поиск по гигабайтам PDF, DOCX, PPTX - доли секунды. Залетает новый файл - агент сразу готов его учитывать. Никакого чанкинга, никакой индексации. По сути - это то же самое что Claude Code или Codex CLI делают с кодовой базой, только тут вместо code base у нас knowledge base.
Но есть нюанс, и даже несколько. Вообще, планирую серию постов на эту тему, начну с проблемы синхронизации файлов и ее решения.
Итак, проблема. Основной источник знаний в их случае - Google Drive. Там все: презентации клиентам, стратегии, исследования. Но делать квери туда - слишком долго и мы ограничены только встроенным поиском драйва - не пойдет. Нам нужно чтобы Claude Code (Agent SDK) шустро шуршал по файлам.
Решение - rclone
Rclone - это как rsync для облачных хранилищ. Поддерживает Google Drive, OneDrive, Dropbox и десятки других. Крутая штука: умеет автоматически экспортировать форматы. Google Docs превращается в .docx, Sheets в .xlsx, презентации в .pptx и тд.
Файлы летят на сервер, конвертируются, агент работает с ними как с обычными файлами.
Почему file-first лучше
Storage дешевый и быстрый. Иногда (особенно для использования внутри компании) куда проще загрузить все на диск и работать с файлами напрямую, чем городить удаленный инджестинг с векторными базами и пайплайн индексации.
Современные CLI агенты прекрасно справляются с файловым поиском. "Найди все упоминания проекта X за последние 3 месяца" - делает за секунды через обычные файловые операции. Когда нужно читает файлы по частям или целиком. А еще на лету пишет скрипты для работы с ними если надо (!), собственно эту концепцию сейчас и продвигают Антропик со своими Skills.
В общем, если строите агента для работы с документами:
- Посмотрите на file-first подход. Может быть быстрее и надежнее RAG.
- Используйте rclone для синхронизации облачных хранилищ.
- Дайте агенту доступ к файловой системе и нормальным тулам поиска - часто лучше наивного RAG.
---
Этот проект оказался интереснее чем я ожидал. Куча нюансов, неочевидных решений и инсайтов, которыми буду делиться дальше. Продолжение следует.
rclone (или иногда агенту нужны просто файлы)Делаем агента для европейской маркетинговой компании. Они год мучались с RAG - индексировали, чанкали, перебирали эмбединги, то лагает, то галлюцинирует, то не находит нужное.
Предложил радикально другой подход: выкинуть RAG, вместо этого - Claude Agent SDK + обычная файловая система и MCP как интерфейс. Сделал им прототип - результат настолько лучше, что сначала не поверили. Сравнить можно +/- с тем, насколько Claude Code лучше чем обычный AI чат в кодинге. Поиск по гигабайтам PDF, DOCX, PPTX - доли секунды. Залетает новый файл - агент сразу готов его учитывать. Никакого чанкинга, никакой индексации. По сути - это то же самое что Claude Code или Codex CLI делают с кодовой базой, только тут вместо code base у нас knowledge base.
Но есть нюанс, и даже несколько. Вообще, планирую серию постов на эту тему, начну с проблемы синхронизации файлов и ее решения.
Итак, проблема. Основной источник знаний в их случае - Google Drive. Там все: презентации клиентам, стратегии, исследования. Но делать квери туда - слишком долго и мы ограничены только встроенным поиском драйва - не пойдет. Нам нужно чтобы Claude Code (Agent SDK) шустро шуршал по файлам.
Решение - rclone
Rclone - это как rsync для облачных хранилищ. Поддерживает Google Drive, OneDrive, Dropbox и десятки других. Крутая штука: умеет автоматически экспортировать форматы. Google Docs превращается в .docx, Sheets в .xlsx, презентации в .pptx и тд.
rclone sync "gdrive:/" "/local/path" --drive-export-formats docx,xlsx,pptx
Файлы летят на сервер, конвертируются, агент работает с ними как с обычными файлами.
Почему file-first лучше
Storage дешевый и быстрый. Иногда (особенно для использования внутри компании) куда проще загрузить все на диск и работать с файлами напрямую, чем городить удаленный инджестинг с векторными базами и пайплайн индексации.
Современные CLI агенты прекрасно справляются с файловым поиском. "Найди все упоминания проекта X за последние 3 месяца" - делает за секунды через обычные файловые операции. Когда нужно читает файлы по частям или целиком. А еще на лету пишет скрипты для работы с ними если надо (!), собственно эту концепцию сейчас и продвигают Антропик со своими Skills.
В общем, если строите агента для работы с документами:
- Посмотрите на file-first подход. Может быть быстрее и надежнее RAG.
- Используйте rclone для синхронизации облачных хранилищ.
- Дайте агенту доступ к файловой системе и нормальным тулам поиска - часто лучше наивного RAG.
---
Этот проект оказался интереснее чем я ожидал. Куча нюансов, неочевидных решений и инсайтов, которыми буду делиться дальше. Продолжение следует.
Forwarded from Refat Talks: Tech & AI
Продолжаю про file-first подход к агентам для работы с базами знаний. В прошлом посте рассказал про общий концепт и rclone. В этом посте как и обещал расскажу про поиск по бинарным (не-текстовым) файлам.
Напомню что общая идея - использовать всю мощь передовых кодинг-агентов (в данном случае Claude Code) для задачи работы с базами знаний.
Итак, синхронизация настроена, имеем на быстром диске файлы, но большинство из них в формате Word, PDF, Excel, PowerPoint. По дефолту Claude Code (а точнее в его обертке под названием Agent SDK) доступны все инструменты для поиска по текстовым файлам (grep, ripgrep и тд), но эти файлы не текстовые.
Первая мысль была: ок, давай конвертнем все в plain text (есть же docling, markitdown и тд). Но хотелось чего-то проще, не хотелось строить пайплайн индексации: это и время, и дублирование источника истины, и проблема инвалидации - файлы-то постоянно обновляются. Хотелось найти решение которое работает напрямую с Office файлами.
Эксперименты
Создал тестовое окружение: 150 документов в разных форматах и сравнивал такой шортлист, который мне подкинул deep research:
- ripgrep c расширенными настройками (на самом деле их было больше) - почти сразу отпал
- pdfgrep - прекрасно ищет по PDF файлам
- ugrep - хоть и ищет по всем файлам, но по-началу давал средние результаты, например был хуже pdfgrep для pdf и плохо искал по презентациям, но потом я открыл его суперсилу - фильтры!
Фильтры ugrep - вот где магия
ugrep умеет на лету конвертить файлы через внешние тулы перед поиском. Для этого используется флаг
Пример:
Или еще проще:
Самое крутое - ugrep уже идет с набором преднастроенных фильтров для популярных форматов. В итоге pdfgrep и другие специализированные тулы оказались не нужны -
ugrep еще умеет искать в архивах (zip, tar, gz) без распаковки, поддерживает fuzzy-поиск и regex с Unicode, может выдавать контекст вокруг найденного текста с подсветкой и все это можно конфигурировать через .ugrep конфиг-файл. Короче, швейцарский нож для поиска.
По скорости. На деле с быстрым диском поиск по тысячам документам занимает доли секунды и не является узким местом в агентных сценариях. Но если база огромная и нужна реальная скорость - у ugrep есть встроенная система индексирования через
Далее, чтобы это эффективно работало было несколько раундов работы с промптом агента. Одна из лучших идей оказалась - инструктировать агента сначала запускать команду
Почему file-first - это кайф
Мне нравится работать в file-first экосистеме. Linux - это filesystem-first операционка и в этом мире много сильных инженеров и очень развитый опенсорс. Поражаешься как много эффективных и производительных тулов доступны, они просто работают. Плюс это же все текстовые интерфейсы - CLI + stdin/stdout - кодинговые агенты (считай LLM) с ними на ты. Никаких API оберток, никаких дополнительных слоев абстракции. Просто композиция мощных Unix-тулов.
В будущих постах по этой теме планирую покрыть:
- Другие челленджи: чтение и понимание содержимого нетекстовых файлов
- Когда все-таки нужны индексы или "шпаргалки" (или навигаторы) для таких агентов
- Опыт с Remote MCP и вопросы авторизации
- Подходы к разграничению прав доступа
- Вопросы изоляции (безопасность)
🔥 ➕ 🔁поддержите если хотите больше на эту тему
Напомню что общая идея - использовать всю мощь передовых кодинг-агентов (в данном случае Claude Code) для задачи работы с базами знаний.
Итак, синхронизация настроена, имеем на быстром диске файлы, но большинство из них в формате Word, PDF, Excel, PowerPoint. По дефолту Claude Code (а точнее в его обертке под названием Agent SDK) доступны все инструменты для поиска по текстовым файлам (grep, ripgrep и тд), но эти файлы не текстовые.
Первая мысль была: ок, давай конвертнем все в plain text (есть же docling, markitdown и тд). Но хотелось чего-то проще, не хотелось строить пайплайн индексации: это и время, и дублирование источника истины, и проблема инвалидации - файлы-то постоянно обновляются. Хотелось найти решение которое работает напрямую с Office файлами.
Эксперименты
Создал тестовое окружение: 150 документов в разных форматах и сравнивал такой шортлист, который мне подкинул deep research:
- ripgrep c расширенными настройками (на самом деле их было больше) - почти сразу отпал
- pdfgrep - прекрасно ищет по PDF файлам
- ugrep - хоть и ищет по всем файлам, но по-началу давал средние результаты, например был хуже pdfgrep для pdf и плохо искал по презентациям, но потом я открыл его суперсилу - фильтры!
Фильтры ugrep - вот где магия
ugrep умеет на лету конвертить файлы через внешние тулы перед поиском. Для этого используется флаг
--filter или его алиас `ug+`. Работает просто: ты говоришь "для файлов .docx юзай pandoc, для .pdf юзай pdftotext" и все.Пример:
ugrep --filter="docx:pandoc %f -t plain" --filter="pdf:pdftotext % -" "искомая фраза"
Или еще проще:
ug+ "искомая фраза"
Самое крутое - ugrep уже идет с набором преднастроенных фильтров для популярных форматов. В итоге pdfgrep и другие специализированные тулы оказались не нужны -
ugrep is all you need.ugrep еще умеет искать в архивах (zip, tar, gz) без распаковки, поддерживает fuzzy-поиск и regex с Unicode, может выдавать контекст вокруг найденного текста с подсветкой и все это можно конфигурировать через .ugrep конфиг-файл. Короче, швейцарский нож для поиска.
По скорости. На деле с быстрым диском поиск по тысячам документам занимает доли секунды и не является узким местом в агентных сценариях. Но если база огромная и нужна реальная скорость - у ugrep есть встроенная система индексирования через
ugrep-indexer, которая может дать ускорение в разы.Далее, чтобы это эффективно работало было несколько раундов работы с промптом агента. Одна из лучших идей оказалась - инструктировать агента сначала запускать команду
tree чтобы понять структуру директорий, а потом уже делать таргетированные запросы. Это хорошо фокусирует поиск и помогает агенту лучше ориентироваться в контексте.Почему file-first - это кайф
Мне нравится работать в file-first экосистеме. Linux - это filesystem-first операционка и в этом мире много сильных инженеров и очень развитый опенсорс. Поражаешься как много эффективных и производительных тулов доступны, они просто работают. Плюс это же все текстовые интерфейсы - CLI + stdin/stdout - кодинговые агенты (считай LLM) с ними на ты. Никаких API оберток, никаких дополнительных слоев абстракции. Просто композиция мощных Unix-тулов.
В будущих постах по этой теме планирую покрыть:
- Другие челленджи: чтение и понимание содержимого нетекстовых файлов
- Когда все-таки нужны индексы или "шпаргалки" (или навигаторы) для таких агентов
- Опыт с Remote MCP и вопросы авторизации
- Подходы к разграничению прав доступа
- Вопросы изоляции (безопасность)
🔥 ➕ 🔁
Forwarded from Институт AIRI
Учёные Института AIRI создали открытую платформу VLA Arena, чтобы исследователи, инженеры и даже любители могли сравнивать и оценивать современные модели управления роботами ⤵️
VLA Arena поддерживает компактные манипуляторы, доступные для самостоятельной сборки или в готовом виде, которые используются в образовательных и исследовательских целях.
На платформе можно:
⚫️ Тестировать модели в симуляции и на реальных роботах
⚫️ Следить за объективной таблицей лидеров с оценками пользователей
⚫️ Поддерживать модели с открытым исходным кодом, включая адаптированные для русского языка версии
⚫️ Найти датасеты и инструменты для обучения собственных моделей
Первый запуск платформы продлится три месяца.
📎 VLA Arena доступна по ссылке.
VLA Arena поддерживает компактные манипуляторы, доступные для самостоятельной сборки или в готовом виде, которые используются в образовательных и исследовательских целях.
На платформе можно:
Первый запуск платформы продлится три месяца.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
Heretic — автоматическое снятие цензуры с LLM
В прошлом году несколько исследователей решило разобраться как именно работает механизм отказов в языковых моделях, когда они блокируют "вредные" запросы. Оказалось что за отказ LLM выполнять запрос отвечает одно единственное направление в пространстве активаций. А вот сейчас на основе этого ресёрча сделали софт для автоматического снятия цензуры.
Heretic вычисляет "направления отказа" как разницу средних активаций между вредными и безвредными промптами, затем ортогонализирует веса аттеншна и MLP проекций для удаления этого направления. Оптимизатор автоматически подбирает параметры подавления, минимизируя одновременно количество отказов и KL-divergence от оригинальной модели.
Работает полностью автоматически — просто запускаешь на любой поддерживаемой модели и через 45 минут получаешь версию без цензуры. Поддерживает большинство популярных архитектур включая Llama, Qwen, Gemma и даже некоторые мультимодальные модели. Той же gpt-oss снятие цензуры точно не помешает.
https://github.com/p-e-w/heretic
@ai_newz
В прошлом году несколько исследователей решило разобраться как именно работает механизм отказов в языковых моделях, когда они блокируют "вредные" запросы. Оказалось что за отказ LLM выполнять запрос отвечает одно единственное направление в пространстве активаций. А вот сейчас на основе этого ресёрча сделали софт для автоматического снятия цензуры.
Heretic вычисляет "направления отказа" как разницу средних активаций между вредными и безвредными промптами, затем ортогонализирует веса аттеншна и MLP проекций для удаления этого направления. Оптимизатор автоматически подбирает параметры подавления, минимизируя одновременно количество отказов и KL-divergence от оригинальной модели.
Работает полностью автоматически — просто запускаешь на любой поддерживаемой модели и через 45 минут получаешь версию без цензуры. Поддерживает большинство популярных архитектур включая Llama, Qwen, Gemma и даже некоторые мультимодальные модели. Той же gpt-oss снятие цензуры точно не помешает.
https://github.com/p-e-w/heretic
@ai_newz
Все ждут выхода Gemini 3 буквально сегодня. На крайняк - до конца недели..
Тестирую Gemini 3 )) пока тяжело сказать, чем отличается от 2.5, буду судить по ошибкам..
Пытаюсь поставить также Gemini Antigravity - IDE от Google, пока с этим что-то сбоит
Пытаюсь поставить также Gemini Antigravity - IDE от Google, пока с этим что-то сбоит
Не Gemini 3 единым. Сейчас работаю с несколькими модельками, которые помещаются на компе - для OCR. Если все получится, расскажу подробнее.
Поэтому появление новых маленьких умных моделек, как минимум, интересно. Хотя таким бенчам все-таки тяжело.
Подробнее, что крутого в этой модельке, здесь
Поэтому появление новых маленьких умных моделек, как минимум, интересно. Хотя таким бенчам все-таки тяжело.
Подробнее, что крутого в этой модельке, здесь
huggingface.co
rl-research/DR-Tulu-8B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
По ссылке в сообщении ниже - полезная информация от разработчиков Gemini. Вообще, у Google какая безумная куча всевозможных фишек, настроек, плавунов и пр. - разобраться в этом чрезвычайно тяжело. Тяжело и получить базовые простые апи, токены и пр. (хотя стало легче, чем раньше). Но зато у компании самый широкий спектр моделей, в целом омнимодальность - не удивлен, что Баффет вложился именно в Гугл.
Из того, на что стоит обратить внимание - можно пользоваться последними моделями бесплатно, с очень щедрыми лимитами, но Гугл будет использовать ваши данные. Имейте это ввиду. Антропия и чат ОпенЭйАй тоже пытаются сделать что-то такое, но только у них бесплатного кот наплакал. А Гугл может себе это позволить, понимая, что самое ценное сейчас - данные. Если хочется прайваси, видимо тоже надо заплатить за платную подписку
https://t.me/machinelearning_interview/2335
Из того, на что стоит обратить внимание - можно пользоваться последними моделями бесплатно, с очень щедрыми лимитами, но Гугл будет использовать ваши данные. Имейте это ввиду. Антропия и чат ОпенЭйАй тоже пытаются сделать что-то такое, но только у них бесплатного кот наплакал. А Гугл может себе это позволить, понимая, что самое ценное сейчас - данные. Если хочется прайваси, видимо тоже надо заплатить за платную подписку
https://t.me/machinelearning_interview/2335
Telegram
Machine learning Interview
⚡️ Вышел подробный гайд по Gemini 3 - новой флагманской модели Google DeepMind, которая в ряде задач уже опережает другие топовые решения.
Внутри разбор возможностей модели, примеры создания реальных приложений, рекомендации по настройке промтов и системных…
Внутри разбор возможностей модели, примеры создания реальных приложений, рекомендации по настройке промтов и системных…
Очень интересная модель SAM-3 от Meta, которая выделяет что-то на картинке и следит за этим на видео. Пригодится нам для анализа видео с птицами на полигонах ))
И да, опен-сорс!
И да, опен-сорс!
Meta AI
SAM 3.1: Faster and More Accessible Real-Time Video Detection and Tracking With Multiplexing and Global Reasoning
А в то же время лидером по скачиванию на Hugging Face становится VibeThinker-1.5B, крошечная модель, которая размышляет на уровне got-oss-20B. Можно ставить буквально на любом компе
huggingface.co
Qwen/Qwen2.5-1.5B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Data Secrets
Видимо, они хотят хотя бы немного перебить хайп вокруг Gemini. Вот что в релизе действительно интересного:
Также для Windows появился Agent mode, с помощью которого агент может работать в терминале автономно (доступы можно настраивать).
«Претрейн и test-time не уперлись в стену» – написал Ноам Браун про релиз. Это он намекает, что масштабирование продолжается.
При этом благодаря новой фишке – «компакции» – Codex теперь может работать с огромными контекстами. Это как бы аналог краткосрочной и долгосрочной памяти. Когда лимит токенов контекстного окна близок, модель сжимает самую старую информацию, а затем вместе с этой выжимкой + последней актуальной информацией переходит в новое контекстное окно. Процесс может повторяться много раз.
Уже доступно в IDE и Codex CLI, в API завезут «soon»
openai.com/index/gpt-5-1-codex-max/
Please open Telegram to view this post
VIEW IN TELEGRAM
Говорят, Сбер раскатал GigaChat3 на базе DeepSeek, плюс выкатил еще кучу моделей
https://t.me/lovedeathtransformers/10018
https://t.me/lovedeathtransformers/10018
Telegram
Love. Death. Transformers.
Сбер выпустил новую линейку генеративных моделей Kandinsky 5.0 в open source — с кодом, весами и под лицензией MIT
Линейку представили на международной конференции Сбера - AI Journey. В нее вошли нейросети:
– Video Pro - превосходит Wan2.2-A14B и работает…
Линейку представили на международной конференции Сбера - AI Journey. В нее вошли нейросети:
– Video Pro - превосходит Wan2.2-A14B и работает…
Forwarded from Анализ данных (Data analysis)
Media is too big
VIEW IN TELEGRAM
Построенная на архитектуре DiT, модель поднимает планку по качеству и доступности.
Что важно:
⚡️ Всего 8.3B параметров - модель можно запускать даже на потребительских GPU с 14GB VRAM
🖥️ Качество: генерирует 5–10 секунд видео в 480p/720p, а через суперразрешение —ё- до 1080p с киношной детализацией
SOTA-качество с очень низкими требованиями к железу.
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Вообще, на этой неделе Сбер и AIRI прекрасно выступили, запустив кучу русскоязычных опенсорсных моделей. Обязательно буду их пробовать