This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Astra прошла все 48 уровней игры «Я не робот»
https://neal.fun/not-a-robot/
Наконец-то можно будет делегировать поиск чёртовых гидрантов😂
@ai_for_devs
https://neal.fun/not-a-robot/
Наконец-то можно будет делегировать поиск чёртовых гидрантов
@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
2😁200🔥40👍22🤯15❤8💯1
⚡️ Модель OpenAI следующего поколения решила задачу тысячелетия
Пока мы осваиваем GPT-6 Astra, OpenAI рассказали о следующей внутренней модели. По их словам, она значительно сильнее, а обучение ещё продолжается. Заодно с её помощью, как утверждают в компании, решили математическую проблему, которая оставалась открытой около 90 лет.
На графике результаты на подборке нерешённых математических задач. При сопоставимых затратах вычислений новая модель решает примерно в 2,5 раза больше задач, чем GPT-6 Astra.
Интересно посмотреть, какой прирост будет в кодинге(центрировать div это тебе не хухры-мухры) .
Кстати, на призовой миллион долларов OpenAI претендовать не собираются. Косят под Перельмана)
@ai_for_devs
Пока мы осваиваем GPT-6 Astra, OpenAI рассказали о следующей внутренней модели. По их словам, она значительно сильнее, а обучение ещё продолжается. Заодно с её помощью, как утверждают в компании, решили математическую проблему, которая оставалась открытой около 90 лет.
На графике результаты на подборке нерешённых математических задач. При сопоставимых затратах вычислений новая модель решает примерно в 2,5 раза больше задач, чем GPT-6 Astra.
Для решения проблемы Навье — Стокса собрали 10 тысяч AI-агентов, которые за 88 часов нашли решение. Если совсем просто: есть уравнения, описывающие движение воды и воздуха.
Вопрос: могут ли они из нормального начального состояния прийти к ситуации, где скорость жидкости становится бесконечной?
OpenAI утверждают, что нашли такой сценарий: вихрь сжимается, вытягивается и всё сильнее разгоняется. Опубликовали доказательство и его формальную запись.
Интересно посмотреть, какой прирост будет в кодинге
Кстати, на призовой миллион долларов OpenAI претендовать не собираются. Косят под Перельмана)
@ai_for_devs
1🤯71👍25😁25❤11🔥5
⚡️ DeepSeek V4.1 Flash: почти вдвое больше параметров и на 57% дешевле кэш
DeepSeek выпустили новую Flash. Количество параметров почти удвоили: с 284 до 552 млрд.
По замерам DeepSeek, на Terminal-Bench 4.0 результат вырос с 7% до 31,2%. Для сравнения: у GPT-6 Astra — 57,9%, у Fable 5.1 — 55,8%.
Цены API за миллион токенов — вне пика / в пик:
- Вход: $0,15 / $0,30
- Выход: $0,60 / $1,20
- Чтение из кэша: $0,003 / $0,006
В OpenCode модель уже доступна на подписке за $10 в месяц. Веса модели опубликовали на Hugging Face.
@ai_for_devs
DeepSeek выпустили новую Flash. Количество параметров почти удвоили: с 284 до 552 млрд.
По замерам DeepSeek, на Terminal-Bench 4.0 результат вырос с 7% до 31,2%. Для сравнения: у GPT-6 Astra — 57,9%, у Fable 5.1 — 55,8%.
Основной акцент сделали на экономии кэша, что ощутимо на длинных сессиях, где агент постоянно отправляет уже знакомый модели код и историю работы.
Августовское подорожание кэша почти отыграли назад: вне пика цена вернулась к прежней, в пик осталась вдвое выше.
Цены API за миллион токенов — вне пика / в пик:
- Вход: $0,15 / $0,30
- Выход: $0,60 / $1,20
- Чтение из кэша: $0,003 / $0,006
В OpenCode модель уже доступна на подписке за $10 в месяц. Веса модели опубликовали на Hugging Face.
@ai_for_devs
1👍52🔥17⚡5❤4🤩1
⚡️ Извини, я не могу помочь приготовить нар🐈и
Недавно писали про GLM-5.3 Flash без цензуры и похожие версии Qwen и Gemma. Но как вообще создают такие «анархичные» модели? Что в них меняют, чтобы вместо «извините, я не могу...», всё же получить ответ?
Поэтому за припиской Uncensored могут стоять разные методы и их комбинации.
Откуда берутся отказы, пять способов снять ограничения и примеры «безотказных» моделей — в новой статье на Хабре.
@ai_for_devs
Недавно писали про GLM-5.3 Flash без цензуры и похожие версии Qwen и Gemma. Но как вообще создают такие «анархичные» модели? Что в них меняют, чтобы вместо «извините, я не могу...», всё же получить ответ?
Иногда для этого даже не требуется дообучение, отказы можно сильно ослабить точечной правкой весов.
Когда LLM обучают быть помощником, ей показывают в том числе примеры отказов и поощряют безопасные ответы. Это поведение закрепляется в весах: на определённые запросы модель привыкает отвечать «не могу помочь».
Её можно переучить на примерах прямых ответов. Или изначально обучать базовую модель диалогу на данных без отказов.
Но есть и более любопытный способ, который получил название abliteration.
Работает этот способ следующим образом:
1. Сначала сравнивают внутренние состояния модели на обычных запросах и запросах, вызывающих отказ
2. Затем находят направление, связанное с этим поведением, и правят веса так, чтобы подавить его влияние
3. После этого модель отказывается заметно реже, хотя заново её никто не обучал
Но отказ может исходить не только от самой модели. Ограничения могут быть в разных частях харнесса: системный промпт запрещает определённые действия, входной фильтр блокирует подозрительный запрос, проверка прав не даёт агенту вызвать инструмент, а выходной фильтр скрывает уже готовый ответ. Даже если сама модель готова помочь, её может остановить любой из этих механизмов.
Поэтому за припиской Uncensored могут стоять разные методы и их комбинации.
Откуда берутся отказы, пять способов снять ограничения и примеры «безотказных» моделей — в новой статье на Хабре.
@ai_for_devs
1🔥30👍28😁17❤6👏1
Hugging Face обновили док безопасности на своем сайте после атаки от агентов OpenAI.
https://huggingface.co/security.txt
Теперь ИИ-агентов просят идти на бенчмарк CyberGym вместо попыток взломать сайт🧠
@ai_for_devs
https://huggingface.co/security.txt
Теперь ИИ-агентов просят идти на бенчмарк CyberGym вместо попыток взломать сайт
@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁158👍23🔥12❤5🤯4👏1
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Claude Mods: Anthropic переизобрели хуки на TypeScript
Anthropic открыли ранний доступ к Claude Mods. Это плагины с хуками на TypeScript, которые меняют поведение и интерфейс Claude Code: перехватывают вызовы инструментов, обрабатывают результаты, добавляют панели и кнопки. Вот полный список того, что и как можно перехватывать.
Например, этот хук (мод) замеряет время вызова Bash и показывает его в интерфейсе:
Конечно, можно делать и более полезные вещи. Например, Anthropic показали в демо мод, который скрывает чувствительные данные и раскрывает их при наведении (видео).
Из готовых модов уже есть cc-pr-tracker, который показывает статусы PR прямо в Claude Code, и cctop с расходом токенов и заполнением контекста.
Сейчас это early access, моды ставятся через обычную систему плагинов, но для запуска нужен флаг
P.S. Конечно, сообщество сразу занялось самым важным: встроило тетрис прямо над строкой ввода, дыхательную гимнастику, ну и, куда же без Doom!
Anthropic открыли ранний доступ к Claude Mods. Это плагины с хуками на TypeScript, которые меняют поведение и интерфейс Claude Code: перехватывают вызовы инструментов, обрабатывают результаты, добавляют панели и кнопки. Вот полный список того, что и как можно перехватывать.
Например, этот хук (мод) замеряет время вызова Bash и показывает его в интерфейсе:
on("tool.call", { tool: "Bash" }, async ($, e, next) => {
const start = $.clock.now();
const result = await next(e); // передаём вызов дальше
$.ui.toast(`Bash: ${$.clock.now() - start} мс`);
return result;
});
Конечно, можно делать и более полезные вещи. Например, Anthropic показали в демо мод, который скрывает чувствительные данные и раскрывает их при наведении (видео).
Из готовых модов уже есть cc-pr-tracker, который показывает статусы PR прямо в Claude Code, и cctop с расходом токенов и заполнением контекста.
Сейчас это early access, моды ставятся через обычную систему плагинов, но для запуска нужен флаг
CLAUDE_CODE_ENABLE_FUNCTION_HOOKS=1. P.S. Конечно, сообщество сразу занялось самым важным: встроило тетрис прямо над строкой ввода, дыхательную гимнастику, ну и, куда же без Doom!
3🔥45👍26❤9🤩2
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Yandex Scale 2026: ИИ-агенты, Agentic OS и LLM-платформы
24 сентября Yandex Cloud проведёт в Москве Yandex Scale 2026.
На докладах разберут, куда движутся платформы для ИИ-агентов и что такое Agentic OS. Ещё покажут создание голосового агента с подключением к телефонии и подключением к телефонии с полноценным диалогом.
Офлайн ожидают больше 2000 участников. Можно будет пообщаться с инженерами Yandex Cloud и другими разработчиками ИИ-продуктов.
Участие бесплатное, главное зарегистрироваться. Программа и регистрация на сайте конференции.
24 сентября Yandex Cloud проведёт в Москве Yandex Scale 2026.
На докладах разберут, куда движутся платформы для ИИ-агентов и что такое Agentic OS. Ещё покажут создание голосового агента с подключением к телефонии и подключением к телефонии с полноценным диалогом.
На воркшопах можно будет:
• Собрать кодинг-агента для анализа данных на базе Yandex AI Studio
• Собрать агента без кода и опубликовать его в пользовательских приложениях
• Разобраться, как Нейроаналитик в DataLens работает с чартами и дашбордами и подключается к внешним LLM через MCP
• Настроить аналитику коммуникаций в SpeechSense — от шаблонов до тегов и отчётов
Кроме AI, будут треки Data, Security и Hybrid Infrastructure & DevOps. Для тех, кому хочется глубже в технологии, отдельный DeepTech, он пройдёт только онлайн.
Офлайн ожидают больше 2000 участников. Можно будет пообщаться с инженерами Yandex Cloud и другими разработчиками ИИ-продуктов.
Участие бесплатное, главное зарегистрироваться. Программа и регистрация на сайте конференции.
3👍34❤16🔥14🤯5💯2👏1
⚡️ Бывший разработчик ChatGPT представил модель для быстрых решений AI-агентов
Когда LLM работает с Blender, JetBrains IDE, DaVinci Resolve (или даже играет в Minecraft!) ей постоянно приходится выбирать следующий инструмент или действие. Для такого выбора часто достаточно одного значения, но обычная LLM всё равно генерирует ответ токен за токеном. Отсюда часть пауз между командами.
Диого Алмейда, соавтор InstructGPT, и команда TypeSafe представили Jev. Модель, которой передаёшь контекст и допустимые варианты, а в ответ получаешь её выбор и вероятности. Дальше она обрабатывает вопросы параллельно, без генерации текста.
Стоит работа такой модели $0,042 за миллион входных токенов и $0 за выход. Практически бесплатно)
Зацените демки с Doom и Wikipedia: примерно так всё и должно было работать, прежде чем мы привыкли смотреть на "Thinking…"🙂
@ai_for_devs
Когда LLM работает с Blender, JetBrains IDE, DaVinci Resolve (или даже играет в Minecraft!) ей постоянно приходится выбирать следующий инструмент или действие. Для такого выбора часто достаточно одного значения, но обычная LLM всё равно генерирует ответ токен за токеном. Отсюда часть пауз между командами.
Диого Алмейда, соавтор InstructGPT, и команда TypeSafe представили Jev. Модель, которой передаёшь контекст и допустимые варианты, а в ответ получаешь её выбор и вероятности. Дальше она обрабатывает вопросы параллельно, без генерации текста.
Jev можно поручить выбор из готовых действий, а написание кода и сложное планирование оставить "основной" LLM. По собственным тестам TypeSafe, качество таких решений близко к привычным нам моделям, зато среднее время в десятки раз меньше.
Стоит работа такой модели $0,042 за миллион входных токенов и $0 за выход. Практически бесплатно)
Зацените демки с Doom и Wikipedia: примерно так всё и должно было работать, прежде чем мы привыкли смотреть на "Thinking…"
@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍55🔥36🤯11❤4⚡1
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Anthropic объединяют Chat и Cowork
Обновление для тех, кто иногда покидает режим Claude Code в десктопной версии.
Обновление раскатают на всех пользователей в ближайшие несколько недель.
Ушла целая эпоха старого доброго чата образца 2023-го)
🤡 — сначала разделили, теперь объединяют
@ai_for_devs
Обновление для тех, кто иногда покидает режим Claude Code в десктопной версии.
Вручную выбирать между чатом и Cowork больше не потребуется. Туда же встраивают Claude Docs, Slides и Design.
Обновление раскатают на всех пользователей в ближайшие несколько недель.
Ушла целая эпоха старого доброго чата образца 2023-го)
@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤡82👍44🔥15😁7❤6
⚡️ Moonshot представили Kimi Code Desktop
Официального анонса пока что не было, но на сайте уже появились сборки для Windows и macOS.
https://www.kimi.com/en/products/download
Из доступных моделей Kimi K3, K2.8 Preview и K2.7 Code HighSpeed. Также можно подключать сторонние модели через API-ключ.
P.S. Скриншоты на китайском, но интерфейс на английском тоже есть🤩
@ai_for_devs
Официального анонса пока что не было, но на сайте уже появились сборки для Windows и macOS.
https://www.kimi.com/en/products/download
В первую версию вошли:
• Plan: всем уже знакомый режим планирования
• Goal: работа над длительной задачей с несколькими шагами и проверками
• Swarm: распределение независимых подзадач между агентами
• Встроенный браузер: можно отметить элемент страницы и сразу передать его агенту
• Remote control: для управления с телефона
Также есть просмотр файлов, Git-диффов и встроенный терминал.
Из доступных моделей Kimi K3, K2.8 Preview и K2.7 Code HighSpeed. Также можно подключать сторонние модели через API-ключ.
P.S. Скриншоты на китайском, но интерфейс на английском тоже есть
@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥50👍28🤯8⚡3❤3😁2
⚡️ Российский стартап Kodacode обновил свою флагманскую модель
Команда KodaCode опубликовала сравнение моделей в своём агентном харнессе. Свежая Koda Pro набрала 54,3%, DeepSeek V4 Flash Max — 52,2%, GLM 5.3 Flash Max — 49,2%, GLM 5.2 High — 49,0%.
Все тестируемые модели гоняли внутри их харнесса. Также сравнили работу DeepSeek в Claude Code, OpenCode, KiloCode и Koda (результаты).
Затестить можно бесплатно, дают 500 запросов к Koda Pro на месяц: https://download.kodacode.ru
@ai_for_devs
Команда KodaCode опубликовала сравнение моделей в своём агентном харнессе. Свежая Koda Pro набрала 54,3%, DeepSeek V4 Flash Max — 52,2%, GLM 5.3 Flash Max — 49,2%, GLM 5.2 High — 49,0%.
Тестировали на бенчмарке собраном из задач популярных бенчей:
— Разработка: SWE-bench Verified, SWE-bench Multilingual для Java, Go и JS/TS
— Проектирование ПО: SWE-bench Pro, NL2RepoBench и ProgramBench
— Анализ данных: SpreadsheetBench и DA-Code
Все тестируемые модели гоняли внутри их харнесса. Также сравнили работу DeepSeek в Claude Code, OpenCode, KiloCode и Koda (результаты).
Затестить можно бесплатно, дают 500 запросов к Koda Pro на месяц: https://download.kodacode.ru
@ai_for_devs
1🔥52👍26❤9🤯8⚡1👌1
⚡️ MWS AI обновили платформу для создания AI-агентов
Агенты теперь могут писать и выполнять код в изолированной песочнице с собственными файлами и вычислительными ресурсами.
Среда создаётся под конкретную задачу и удаляется после завершения.
MWS AI рассчитывают использовать эти фичи для создания связки агентов, в которых один получает общую цель, разбивает её на задачи, запускает других агентов для их выполнения и корректирует план по результатам проверки.
Подробнее — Ведомости
Агенты теперь могут писать и выполнять код в изолированной песочнице с собственными файлами и вычислительными ресурсами.
Среда создаётся под конкретную задачу и удаляется после завершения.
MWS AI отмечает, что код генерируется и выполняется на инфраструктуре заказчика без доступа во внешние сервисы.
Что ещё добавили:
• Запуск по расписанию
• Долгосрочную память
• Конструктор интерфейсов
• Автоматические проверки
MWS AI рассчитывают использовать эти фичи для создания связки агентов, в которых один получает общую цель, разбивает её на задачи, запускает других агентов для их выполнения и корректирует план по результатам проверки.
Подробнее — Ведомости
1👍27❤14🔥7👌2🤩1💯1