Сегодня про браузеры - мы очень быстро придем к тому, что браузеры будут особенно и не нужны в том виде, как мы их используем сейчас - будем просто спрашивать своих агентов, что нужно.
https://t.me/vibecoding_tg/3582
https://t.me/vibecoding_tg/3582
Telegram
Вайб-кодинг
А что, так можно было: существует браузер для ИИ-агентов и веб-скрейпинга, который не тащит за собой полноценный Chrome.
Пока обычный headless Chrome всё равно поднимает огромный браузерный стек ради страницы, которую никто не увидит, Lightpanda этот слой…
Пока обычный headless Chrome всё равно поднимает огромный браузерный стек ради страницы, которую никто не увидит, Lightpanda этот слой…
Ну и правда, то ли у нас SOTA для запуска на локальных машинках, то ли бенчмарки хакнули..
https://t.me/machinelearning_interview/2910
https://t.me/machinelearning_interview/2910
Telegram
Machine learning Interview
KAT-Coder-V2.5-Dev: 35B параметров, но активны только 3B
KwaiAI открыла KAT-Coder-V2.5-Dev - MoE-модель для агентной разработки на базе Qwen3.6-35B-A3B.
На каждом токене используется около 3 млрд параметров, при этом результаты выглядят серьёзно:
- 69…
KwaiAI открыла KAT-Coder-V2.5-Dev - MoE-модель для агентной разработки на базе Qwen3.6-35B-A3B.
На каждом токене используется около 3 млрд параметров, при этом результаты выглядят серьёзно:
- 69…
Forwarded from Denis Sexy IT 🤖
В выходные потестировал еще один популярный скилл, который называется ponytail –
он пытается сделать из кодинг агента, такого душного чувака с хвостиком, который с самым большим ЧСВ на свете программирует бекенд какой-то корпорации за 300кк в секунду
И на удивление, оказалось, что если этот скилл подключить через хук (ну то есть, чтобы он вызывался всегда а не по настроению агента) – скилл правда экономит ~10% токенов, и даже больше иногда
Тут все детали:
https://blog.jetbrains.com/ai/2026/07/ponytail-skill-claude-tested/
(последний час теста, я анимировал хвостик на аватарке)
💎
🌝
он пытается сделать из кодинг агента, такого душного чувака с хвостиком, который с самым большим ЧСВ на свете программирует бекенд какой-то корпорации за 300кк в секунду
И на удивление, оказалось, что если этот скилл подключить через хук (ну то есть, чтобы он вызывался всегда а не по настроению агента) – скилл правда экономит ~10% токенов, и даже больше иногда
Тут все детали:
https://blog.jetbrains.com/ai/2026/07/ponytail-skill-claude-tested/
(последний час теста, я анимировал хвостик на аватарке)
Please open Telegram to view this post
VIEW IN TELEGRAM
The JetBrains Blog
Ponytail Skill for Claude Code: Does It Really Cut Tokens
Part 3 of a series where we take public "token saver" add-ons for coding agents and run the same paired A/B benchmark against each of them. Part 1 was the caveman skill (advertised −65%, measured −8.5
OpenAI сделали специальную программу для поиска проблем с безопасностью. Опенсорс. Ну что, отлично, не помешает..
https://github.com/openai/codex-security
https://github.com/openai/codex-security
GitHub
GitHub - openai/codex-security: OpenAI's Codex Security CLI and TypeScript SDK for finding, validating, and fixing security vulnerabilities.…
OpenAI's Codex Security CLI and TypeScript SDK for finding, validating, and fixing security vulnerabilities. npm: https://www.npmjs.com/package/@openai/codex-security - openai/codex-security
Очень впечатляющая история - своего рода первая ласточка. В Америке сейчас в связи с этим проходят конкурсы открытых писем и большой срач между конторами.
Ну и на этом фоне интересно, что проект Ильи Суцкевера по безопасным моделям не умер, а получил еще 5 ярдов от NVIDIA. Видимо, тема актуальна как никогда.
Да, есть ощущение, что и на рынке крипты как никогда много успешных атак. Очевидные жертвы
Ну и на этом фоне интересно, что проект Ильи Суцкевера по безопасным моделям не умер, а получил еще 5 ярдов от NVIDIA. Видимо, тема актуальна как никогда.
Да, есть ощущение, что и на рынке крипты как никогда много успешных атак. Очевидные жертвы
Telegram
Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Forwarded from эйай ньюз
OpenAI сбросили цены на GPT 5.6
Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.
@ai_newz
Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.
@ai_newz
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
WTF: Этот CLI вытаскивает дизайн-систему из любого сайта
Просто передаёте URL, а он достаёт цвета, типографику, отступы, границы, тени, компоненты, брейкпоинты, моушен-токены и даже генерирует
Фронтендеры, вайбкодеры и дизайнеры теперь могут закрыть DevTools. И открыть терминал.✋
https://dembrandt.com
Просто передаёте URL, а он достаёт цвета, типографику, отступы, границы, тени, компоненты, брейкпоинты, моушен-токены и даже генерирует
DESIGN.md.Фронтендеры, вайбкодеры и дизайнеры теперь могут закрыть DevTools. И открыть терминал.
https://dembrandt.com
Please open Telegram to view this post
VIEW IN TELEGRAM
River AI: как обучить собственную GLM-5.2 без GPU
River AI — новый сервис для дообучения open-source моделей через LoRA и reinforcement learning. Можно взять базовую Qwen, Kimi или GLM-5.2 и получить специализированный checkpoint под конкретную задачу.
Создатель и CEO River — Игорь Бабушкин. Ранее он работал над ИИ в DeepMind, OpenAI и xAI; River позиционирует себя как инфраструктуру для персонального, контролируемого пользователем ИИ.
Что даёт сервис:
— дообучение модели на своих примерах;
— RL с собственной функцией награды;
— хранение checkpoint;
— инференс через OpenAI-совместимый API без своих GPU.
Цены для GLM-5.2 с контекстом 32k:
— обучение: $4,40 за 1 млн токенов;
— вход при инференсе: $1,46 / 1M;
— выход: $3,67 / 1M;
— хранение: $0,10/ГБ в месяц.
Пример: запрос с 5 тыс. токенов входа и ответом на 1 тыс. токенов будет стоить примерно $0,011.
Но актуальные знания и документы лучше оставлять в RAG. Дообучение полезнее для устойчивых вещей — формата ответа, стиля, классификации, последовательности действий и проверки результата.
За стиль простите, лень переписывать за кло..
River AI — новый сервис для дообучения open-source моделей через LoRA и reinforcement learning. Можно взять базовую Qwen, Kimi или GLM-5.2 и получить специализированный checkpoint под конкретную задачу.
Создатель и CEO River — Игорь Бабушкин. Ранее он работал над ИИ в DeepMind, OpenAI и xAI; River позиционирует себя как инфраструктуру для персонального, контролируемого пользователем ИИ.
Что даёт сервис:
— дообучение модели на своих примерах;
— RL с собственной функцией награды;
— хранение checkpoint;
— инференс через OpenAI-совместимый API без своих GPU.
Цены для GLM-5.2 с контекстом 32k:
— обучение: $4,40 за 1 млн токенов;
— вход при инференсе: $1,46 / 1M;
— выход: $3,67 / 1M;
— хранение: $0,10/ГБ в месяц.
Пример: запрос с 5 тыс. токенов входа и ответом на 1 тыс. токенов будет стоить примерно $0,011.
Но актуальные знания и документы лучше оставлять в RAG. Дообучение полезнее для устойчивых вещей — формата ответа, стиля, классификации, последовательности действий и проверки результата.
За стиль простите, лень переписывать за кло..
Ну, кстати, цены на Luna действительно интересные, чтобы пробовать модель даже по апи…
https://t.me/vibecoding_tg/3597
https://t.me/vibecoding_tg/3597
Telegram
Вайб-кодинг
OpenAI бросила вызов дешёвому интеллекту из Китая:
OpenAI снизила цену GPT-5.6 Luna на 80% — до $0,20 за миллион входных токенов и $1,20 за миллион выходных.
Terra подешевела на 20% — до $2/$12 соответственно. Теперь Luna в 25 раз дешевле Sol.
Изменения…
OpenAI снизила цену GPT-5.6 Luna на 80% — до $0,20 за миллион входных токенов и $1,20 за миллион выходных.
Terra подешевела на 20% — до $2/$12 соответственно. Теперь Luna в 25 раз дешевле Sol.
Изменения…
Я эту модель в прошлом исполнении использовал для отдельных задач - это было выгодное предложение. А текущая модель по бенчам так и вообще сильнее старшей версии. Если нужна модель по апи - однозначно, один из лучших вариантов
https://t.me/data_analysis_ml/5531
https://t.me/data_analysis_ml/5531
Telegram
Анализ данных (Data analysis)
DeepSeek запустила официальный API модели V4-Flash и заметно улучшила её работу в агентных сценариях.
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности…
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности…
Forwarded from AbstractDL
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1👏1🎉1
В таких харнесах, правда, есть проблема - их надо подключать по апи. Но можно использовать с GLM или DeepSeek, например.
У chatGPT в настройках для Luna есть уровень Max, который по умолчанию недоступен. Говорят, что моделька на этом уровне выступает очень даже сильно, при том, что стоит в разы дешевле Terra и Sol. Попробуйте
На просторах интернета нашел программку, которая переводит экран браузера в темную тему - после того, как начал пользоваться терминалом, постепенно перешел на черный цвет везде..
Dark Reader
Dark Reader — dark theme for every website
Dark mode for every website. Take care of your eyes, use dark theme for night and daily browsing. For Chrome and Firefox, Edge and Safari.
Вышел Qwen-3.8 Max на 2.4Т параметров. Теперь это - не опенсорс. Но, может, хотя бы маленькие модели откроют.
PS. Алибаба написала, что все-таки веса откроют. Заодно и метрики подоспели
PS. Алибаба написала, что все-таки веса откроют. Заодно и метрики подоспели
X (formerly Twitter)
Qwen (@Alibaba_Qwen) on X
Meet Qwen3.8-Max: A New Bar for Coding and Cowork.
very vibe coding
У chatGPT в настройках для Luna есть уровень Max, который по умолчанию недоступен. Говорят, что моделька на этом уровне выступает очень даже сильно, при том, что стоит в разы дешевле Terra и Sol. Попробуйте
Совет использовать Luna для агентской работы был ошибкой - об этом говорят и разработчики из OpenAI. Нужно подниматься до Терры.
X (formerly Twitter)
eric provencher (@pvncher) on X
I understand there's a lot of desire to get Luna used as a sub agent.
I do not recommend messing with your model catalog to force capabilities that are not natively exposed.
Multi agents v2 requires proactive inter agent communication, which only Sol and…
I do not recommend messing with your model catalog to force capabilities that are not natively exposed.
Multi agents v2 requires proactive inter agent communication, which only Sol and…
Forwarded from Анализ данных (Data analysis)
⚡️ DeepSeek V4 Flash теперь можно запустить локально на одном Mac
На Hugging Face появилась специальная GGUF-сборка DeepSeek-V4-Flash-0731 для компьютеров Apple Silicon со 128 ГБ объединённой памяти.
Официальная модель содержит 304 млрд параметров и поддерживает контекст до 1 млн токенов. После смешанной 2- и 4-битной квантизации файл занимает 97,6 ГБ.
Чувствительные слои, attention и общие эксперты сохранены в повышенной точности, а основная часть MoE-экспертов сжата агрессивнее.
Для запуска используется специализированный движок ds4 / DwarfStar:
Это нестандартный GGUF. Он не загрузится в Ollama, LM Studio или llama.cpp из-за особой структуры тензоров и схемы квантизации.
Модель уровня крупного серверного кластера удалось целиком уместить в память одного мощного Mac. Медленно и требовательно к железу, зато полностью локально .
Модель:
https://huggingface.co/ox-ox/DeepSeek-V4-Flash-0731-gguf-ds4
На Hugging Face появилась специальная GGUF-сборка DeepSeek-V4-Flash-0731 для компьютеров Apple Silicon со 128 ГБ объединённой памяти.
Официальная модель содержит 304 млрд параметров и поддерживает контекст до 1 млн токенов. После смешанной 2- и 4-битной квантизации файл занимает 97,6 ГБ.
Чувствительные слои, attention и общие эксперты сохранены в повышенной точности, а основная часть MoE-экспертов сжата агрессивнее.
Для запуска используется специализированный движок ds4 / DwarfStar:
git clone https://github.com/antirez/ds4
cd ds4
make
./ds4 -m gguf/DeepSeek-V4-Flash-0731-....gguf \
-p "Напиши распределённый кеш на Go"
Это нестандартный GGUF. Он не загрузится в Ollama, LM Studio или llama.cpp из-за особой структуры тензоров и схемы квантизации.
Модель уровня крупного серверного кластера удалось целиком уместить в память одного мощного Mac. Медленно и требовательно к железу, зато полностью локально .
Модель:
https://huggingface.co/ox-ox/DeepSeek-V4-Flash-0731-gguf-ds4
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Andrew Ng собрал открытый проект альтернативы Cowork, который берёт рабочую задачу и возвращает готовый результат - документ, разобранный почтовый ящик, обновлённый календарь, ответ в Slack с нужными цифрами.
Пользователь формулирует, что хочет получить, агент сам делит работу на шаги и обращается к файлам, терминалу и подключённым сервисам.
В описании проекта их больше 25, включая GitHub, Jira, Notion, Gmail, Google Calendar, Outlook и HubSpot.
Andrew Ng - одна из самых узнаваемых фигур в ML.
Он основал и возглавил команду Google Brain, затем работал главным научным сотрудником Baidu, где руководил ИИ-подразделением на 1300 человек. До этого он был директором лаборатории ИИ Стэнфорда, сейчас преподаёт там как профессор.
В 2012 году его курс по машинному обучению вырос в платформу Coursera, а позже он запустил образовательный проект DeepLearningAI. Курсы Andrew Ng прослушали больше 8 млн человек.
Проект не привязан к конкретному поставщику модели. Можно подать ключ OpenAI, Anthropic, Google, DeepSeek, Qwen, Mistral, GLM, Kimi, Grok и других, либо подключиться локально через Ollama.
OpenWorker в открытой бете. Сборка для macOS подписана и обновляется сама, а вот версия для Windows пока не подписана, поэтому фильтр SmartScreen выдаёт предупреждение при запуске (подпись оформляется и будет позже).
Объявляя о запуске в X, Andrew написал, что его цель - дать рынку открытый вариант ИИ-коллеги, не зависящий от вендора.
@ai_machinelearning_big_data
#AI #ML #Agent #OpenWorker #AndrewNg
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machine learning Interview
DeepSeek начался не с архитектуры модели. Возможно, он начался с поездки в Тибет.
В 2011 году 26-летний Лян Вэньфэн отправился на старом Fiat в одиночное путешествие. Спутник улетел домой из Лхасы, а Лян продолжил путь на запад - к Гималаям и в безлюдные районы Али.
Он проехал сотни километров вглубь плато, фотографируя пейзажи на Nikon D50. Ради одного удачного кадра мог ждать света половину дня.
Затем он пропал почти на неделю.
Позже в его предположительном аккаунте появилось сообщение: Лян выбрался, но Fiat остался на бескрайнем высокогорном плато.
That's the END.
Через 12 лет он основал DeepSeek.
И в этой истории легко увидеть будущий стиль компании.
Пока другие спешили к быстрой коммерциализации, DeepSeek сосредоточилась на фундаментальных моделях. Пока конкуренты компенсировали проблемы вычислительными бюджетами, команда пыталась выжать максимум эффективности. А вместо громкой публичности и закрытых релизов выбрала низкие цены и открытые модели.
Конечно, путешествие не объясняет технический успех DeepSeek. Но оно хорошо показывает характер человека, стоящего за компанией:
• ехать дальше остальных, терпеливо ждать результата, рисковать ресурсами и спокойно оставлять потерянное позади.
Иногда стратегия бизнеса рождается не в презентации для инвесторов.
Иногда она становится продолжением личности основателя.
В 2011 году 26-летний Лян Вэньфэн отправился на старом Fiat в одиночное путешествие. Спутник улетел домой из Лхасы, а Лян продолжил путь на запад - к Гималаям и в безлюдные районы Али.
Он проехал сотни километров вглубь плато, фотографируя пейзажи на Nikon D50. Ради одного удачного кадра мог ждать света половину дня.
Затем он пропал почти на неделю.
Позже в его предположительном аккаунте появилось сообщение: Лян выбрался, но Fiat остался на бескрайнем высокогорном плато.
That's the END.
Через 12 лет он основал DeepSeek.
И в этой истории легко увидеть будущий стиль компании.
Пока другие спешили к быстрой коммерциализации, DeepSeek сосредоточилась на фундаментальных моделях. Пока конкуренты компенсировали проблемы вычислительными бюджетами, команда пыталась выжать максимум эффективности. А вместо громкой публичности и закрытых релизов выбрала низкие цены и открытые модели.
Конечно, путешествие не объясняет технический успех DeepSeek. Но оно хорошо показывает характер человека, стоящего за компанией:
• ехать дальше остальных, терпеливо ждать результата, рисковать ресурсами и спокойно оставлять потерянное позади.
Иногда стратегия бизнеса рождается не в презентации для инвесторов.
Иногда она становится продолжением личности основателя.