Forwarded from e/acc
Промт инжиниринг circa 2026.
Вы не поверите, но элитный промтинг от триллионных компаний выглядит именно так. Попробуйте сами с фейблом. Чем меньше деталей, тем лучше результат.
Это примерно как если мы 4-летний ребенок объяснял родителям как именно нужно забронировать и организовать отдых на море. Чем меньше деталей, тем лучше все будет сделано.
Поскольку модели уже лучше нас в большинстве чисто технических задач, им нужно говорить видение, а не способ исполнения. Когда Клод смотрит как я пытаюсь кодить руками — это примерно как мем про обезьяну, пытающуюся забить гвозди.
Вы не поверите, но элитный промтинг от триллионных компаний выглядит именно так. Попробуйте сами с фейблом. Чем меньше деталей, тем лучше результат.
Это примерно как если мы 4-летний ребенок объяснял родителям как именно нужно забронировать и организовать отдых на море. Чем меньше деталей, тем лучше все будет сделано.
Поскольку модели уже лучше нас в большинстве чисто технических задач, им нужно говорить видение, а не способ исполнения. Когда Клод смотрит как я пытаюсь кодить руками — это примерно как мем про обезьяну, пытающуюся забить гвозди.
🔥11✍4😁3💯3
Forwarded from Data Secrets
Anthropic значимо обновили MCP
Апдейт назвали крупнейшим с момента запуска. Сейчас расскажем, что изменилось.
Раньше MCP работал как двусторонняя связь с сохранением состояния сессии. То есть при подключении сервер открывал долгоживущее соединение, и весь контекст между запросами жил в оперативке одного запущенного процесса. Это требовало, чтобы был постоянно работающий инстанс, который висит и ждет, существуя все время, пока идет сессия.
В новой версии MCP стал stateless, то есть теперь каждый запрос самодостаточный. Клиент сам присылает весь нужный контекст в запросе (ну или он лежит во внешнем хранилище), а сервер просто получил запрос, обработал, отдал ответ и все забыл.
Все Serverless-платформы (AWS Lambda, Cloudflare Workers и тд) работают именно так. До этой версии MCP нельзя было нормально запустить на такой инфраструктуре, а теперь можно: сервер разработчика может состоять просто из функции, которая просыпается на запрос и засыпает.
В двух словах: MCP только что стали намного дешевле + их стало гораздо легче масштабировать. Практически это значит, что порог входа для создания MCP-сервера резко упал, и мы можем ожидать взрывного роста числа коннекторов для самых разных приложений, даже самых небольших.
https://claude.com/blog/bringing-mcp-2026-07-28-to-claude
Апдейт назвали крупнейшим с момента запуска. Сейчас расскажем, что изменилось.
Раньше MCP работал как двусторонняя связь с сохранением состояния сессии. То есть при подключении сервер открывал долгоживущее соединение, и весь контекст между запросами жил в оперативке одного запущенного процесса. Это требовало, чтобы был постоянно работающий инстанс, который висит и ждет, существуя все время, пока идет сессия.
В новой версии MCP стал stateless, то есть теперь каждый запрос самодостаточный. Клиент сам присылает весь нужный контекст в запросе (ну или он лежит во внешнем хранилище), а сервер просто получил запрос, обработал, отдал ответ и все забыл.
Все Serverless-платформы (AWS Lambda, Cloudflare Workers и тд) работают именно так. До этой версии MCP нельзя было нормально запустить на такой инфраструктуре, а теперь можно: сервер разработчика может состоять просто из функции, которая просыпается на запрос и засыпает.
В двух словах: MCP только что стали намного дешевле + их стало гораздо легче масштабировать. Практически это значит, что порог входа для создания MCP-сервера резко упал, и мы можем ожидать взрывного роста числа коннекторов для самых разных приложений, даже самых небольших.
https://claude.com/blog/bringing-mcp-2026-07-28-to-claude
🔥17⚡4✍3🤣1🏆1
Forwarded from Уставший техдир
AI PDLC манифест от Сбера
Начинаю делиться видео с нашей первой конференции по агентной разработке!
Кирилл Меньшов, старший вице-президент Сбера, руководитель блока Технологии, представил огромную работу, описывающую как измениться жизненный цикл разработки цифровых продуктов. Огромный фундаментальный документ, который затрагивает все стадии производственного цикла: гипотезы, архитектуру, аналитику, разработку, контроль качества и cicd. Он рассказал, как поменяется управление, организацонная структура, топология команд
Главный тезис (который я вам тоже на протяжении последнего года продвигаю): Код теперь стоит дешево, исполнение больше не дифицитно. Теперь узкое место — намерение. Именно то, зачем мы делаем софт, для кого, какая у него потребность и как мы ее закрываем. Это становится узким местом.
https://www.youtube.com/watch?v=48sOgB8kkPw
Именно поэтому я писал кучу постов про A-player'ов, визионерство, продуктовых инженеров и работу с проблемами, а не кодом. Прошлое, в котором можно было получать на вход аналитику, на выход выдавать по ней код и не задумываться зачем оно все надо — прошло
П.С. Крайне рекомендую к просмотру (и это не потому что я работаю в Сбере). Я честно считаю очень правильным поднимать подобный дискурс в российском айти-комьюнити. И я рад, что наши ребята это делают, респект 🤟
Начинаю делиться видео с нашей первой конференции по агентной разработке!
Кирилл Меньшов, старший вице-президент Сбера, руководитель блока Технологии, представил огромную работу, описывающую как измениться жизненный цикл разработки цифровых продуктов. Огромный фундаментальный документ, который затрагивает все стадии производственного цикла: гипотезы, архитектуру, аналитику, разработку, контроль качества и cicd. Он рассказал, как поменяется управление, организацонная структура, топология команд
Главный тезис (который я вам тоже на протяжении последнего года продвигаю): Код теперь стоит дешево, исполнение больше не дифицитно. Теперь узкое место — намерение. Именно то, зачем мы делаем софт, для кого, какая у него потребность и как мы ее закрываем. Это становится узким местом.
https://www.youtube.com/watch?v=48sOgB8kkPw
Именно поэтому я писал кучу постов про A-player'ов, визионерство, продуктовых инженеров и работу с проблемами, а не кодом. Прошлое, в котором можно было получать на вход аналитику, на выход выдавать по ней код и не задумываться зачем оно все надо — прошло
П.С. Крайне рекомендую к просмотру (и это не потому что я работаю в Сбере). Я честно считаю очень правильным поднимать подобный дискурс в российском айти-комьюнити. И я рад, что наши ребята это делают, респект 🤟
🫡5✍4⚡4❤3🔥1🏆1🗿1
This media is not supported in your browser
VIEW IN TELEGRAM
XY от Reflex: Python-библиотека графиков на Rust, которая рендерит 10 миллиардов точек
Команда Reflex (YC W23, $5M seed от Lux Capital) выпустила XY: сверхбыструю библиотеку графиков для Python с ядром на Rust. Проект в альфе, последний релиз v0.0.4 вышел 27 июля. Установка одной командой:
⚡️ Секрет скорости в архитектуре. Большинство библиотек (Matplotlib, Plotly) создают отдельный объект на каждую точку и гонят JSON в браузер. XY держит данные в ColumnStore, обсчитывает уровень детализации в Rust и передаёт в браузер компактные бинарные буферы через WebGL2. На экран попадает ровно то, что способен показать монитор: для больших наборов строится экранно-ограниченная поверхность плотности, при приближении подгружаются точные значения. Бенчмарк: 100 млн точек рендерятся за 0,081 с, тогда как Matplotlib уходит в 13,4 с на 50 млн, а Plotly: в 9,8 с на 25 млн. Команда отрендерила весь OpenStreetMap: 10 млрд точек.
📦 API декларативный: график собирается из меток, осей и аннотаций. Экспорт 10 млн точек в интерактивный HTML весит 258 КиБ (Plotly: 259 МиБ). Доступен режим совместимости с matplotlib: замените
💡 Reflex известен своим Python-фреймворком для full-stack веб-приложений (30% Fortune 500 используют его для внутренних инструментов, больше миллиона приложений собрано). XY: логичное расширение экосистемы: графики для дашбордов, которые не тормозят. В роадмапе: свечные графики и финансовые оверлеи (SMA, Bollinger, RSI), древовидные карты, трёхмерные и объёмные визуализации.
XY не тянет полярные и 3D-графики, альфа сырая, но для 2D-визуализации больших данных аналогов по скорости в Python сейчас нет. Пока конкуренты рисуют точки, которые никто не увидит, XY считает только то, что попадает на экран 🤞
#Python #DataViz #Rust
---
@tsingular
Команда Reflex (YC W23, $5M seed от Lux Capital) выпустила XY: сверхбыструю библиотеку графиков для Python с ядром на Rust. Проект в альфе, последний релиз v0.0.4 вышел 27 июля. Установка одной командой:
pip install xy.⚡️ Секрет скорости в архитектуре. Большинство библиотек (Matplotlib, Plotly) создают отдельный объект на каждую точку и гонят JSON в браузер. XY держит данные в ColumnStore, обсчитывает уровень детализации в Rust и передаёт в браузер компактные бинарные буферы через WebGL2. На экран попадает ровно то, что способен показать монитор: для больших наборов строится экранно-ограниченная поверхность плотности, при приближении подгружаются точные значения. Бенчмарк: 100 млн точек рендерятся за 0,081 с, тогда как Matplotlib уходит в 13,4 с на 50 млн, а Plotly: в 9,8 с на 25 млн. Команда отрендерила весь OpenStreetMap: 10 млрд точек.
📦 API декларативный: график собирается из меток, осей и аннотаций. Экспорт 10 млн точек в интерактивный HTML весит 258 КиБ (Plotly: 259 МиБ). Доступен режим совместимости с matplotlib: замените
import matplotlib.pyplot as plt на import xy.pyplot as plt, и существующий код заработает. Работает в Jupyter, VS Code, Colab, Marimo и как отдельный HTML.💡 Reflex известен своим Python-фреймворком для full-stack веб-приложений (30% Fortune 500 используют его для внутренних инструментов, больше миллиона приложений собрано). XY: логичное расширение экосистемы: графики для дашбордов, которые не тормозят. В роадмапе: свечные графики и финансовые оверлеи (SMA, Bollinger, RSI), древовидные карты, трёхмерные и объёмные визуализации.
XY не тянет полярные и 3D-графики, альфа сырая, но для 2D-визуализации больших данных аналогов по скорости в Python сейчас нет. Пока конкуренты рисуют точки, которые никто не увидит, XY считает только то, что попадает на экран 🤞
#Python #DataViz #Rust
---
@tsingular
🔥6⚡3❤2👨💻2
This media is not supported in your browser
VIEW IN TELEGRAM
Hermes Agent получил wake word — «Hey Hermes»
⚡️ Hermes Agent теперь просыпается по голосу. Сказал «Hey Hermes», агент открывает свежую сессию, включает микрофон, захватывает команду через обычный голосовой пайплайн и отвечает.
Причем сама активация триггерится локально.
🔒 Детектор реализован на устройстве. Постоянный фоновый слушатель отслеживает только wake-фразу: ни один звук не покидает машину, пока вы не произнесёте команду.
По умолчанию выключен, включается командой
🧠 Три движка: openWakeWord (бесплатно, локальные ONNX-модели, «hey hermes» в комплекте), sherpa (открытый словарь, любая фраза без обучения, модель ~13 МБ), Porcupine (Picovoice, кастомные
🔄 Sherpa умеет маршрутизировать профили. Один слушатель на несколько профилей: «hey coder» переключает на профиль coder, «hey trader» на trader.
Каждый профиль с
🛠 Управление:
Выбор среды:
🍏 На macOS микрофон выдаётся отдельному процессу, Python-бэкенд должен иметь свой доступ в Системные настройки → Конфиденциальность → Микрофон.
Без него ухо показывает «слушает», но фраза не срабатывает.
⚙️ Тонкая настройка:
✍🏻 Создать профиль Гермеса Neo и будить его фразой:
"Wake up Neo!"
#HermesAgent #voice
———
@tsingular
⚡️ Hermes Agent теперь просыпается по голосу. Сказал «Hey Hermes», агент открывает свежую сессию, включает микрофон, захватывает команду через обычный голосовой пайплайн и отвечает.
Причем сама активация триггерится локально.
🔒 Детектор реализован на устройстве. Постоянный фоновый слушатель отслеживает только wake-фразу: ни один звук не покидает машину, пока вы не произнесёте команду.
По умолчанию выключен, включается командой
/wake on.🧠 Три движка: openWakeWord (бесплатно, локальные ONNX-модели, «hey hermes» в комплекте), sherpa (открытый словарь, любая фраза без обучения, модель ~13 МБ), Porcupine (Picovoice, кастомные
.ppn-ключи).🔄 Sherpa умеет маршрутизировать профили. Один слушатель на несколько профилей: «hey coder» переключает на профиль coder, «hey trader» на trader.
Каждый профиль с
wake_word.enabled: true регистрируется автоматически.🛠 Управление:
/wake on (движок нужно доустанавить), /wake status (фраза, провайдер, состояние), /wake off. Выбор среды:
surface: auto|cli|tui|gui.🍏 На macOS микрофон выдаётся отдельному процессу, Python-бэкенд должен иметь свой доступ в Системные настройки → Конфиденциальность → Микрофон.
Без него ухо показывает «слушает», но фраза не срабатывает.
/wake status диагностирует и покажет статус.⚙️ Тонкая настройка:
sensitivity (0.0–1.0, работает во всех движках), confirmation_frames (сколько кадров openWakeWord подряд должны быть выше порога, по умолчанию 3), start_new_session (свежая сессия или продолжение текущей).✍🏻 Создать профиль Гермеса Neo и будить его фразой:
"Wake up Neo!"
#HermesAgent #voice
———
@tsingular
👍22✍9🔥7😁2❤1
Media is too big
VIEW IN TELEGRAM
вайбкодинг с Opus 5 в середине 2026 года теперь умеет такое
https://snowflow-lilac.vercel.app/
WASD + пробел + кнопки 12345 для заклинаний
пишут, что заняло где-то 9 часов и 4млн токенов
Исходник: https://github.com/Noniv/snowflow_demo
полный промпт в комментарии
#gamedev #Opus
———
@tsingular
https://snowflow-lilac.vercel.app/
WASD + пробел + кнопки 12345 для заклинаний
пишут, что заняло где-то 9 часов и 4млн токенов
Исходник: https://github.com/Noniv/snowflow_demo
полный промпт в комментарии
#gamedev #Opus
———
@tsingular
🔥22🤔4🆒3😁2⚡1
NousResearch запустили на выходные конкурс для платных подписчиков с возможностью погенерить ролики на Flux3 от BlackForestLab.
Вообще у них скидки на портале по 50% и 20% на модели, стоит присмотреться.
Спонсируют по партнерке весь ассортимент OpenRouter.
https://portal.nousresearch.com/
#Nous #нейрорендер #Flux
------
@tsingular
Вообще у них скидки на портале по 50% и 20% на модели, стоит присмотреться.
Спонсируют по партнерке весь ассортимент OpenRouter.
https://portal.nousresearch.com/
#Nous #нейрорендер #Flux
------
@tsingular
🔥6❤1⚡1
Forwarded from эйай ньюз
OpenAI сбросили цены на GPT 5.6
Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.
@ai_newz
Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.
@ai_newz
✍6⚡2🔥1
DeepSeek строит 1 ГВт датацентр во Внутренней Монголии
📋 DeepSeek строит в Уланчабе, Внутренняя Монголия, дата-центр на 1 ГВт — часть своими силами, часть через аренду у сторонних операторов, первые мощности запустят к концу 2027 года.
О том, что проект вышел за рамки бумажных планов, говорит найм инженеров по обслуживанию серверов и менеджеров по доставке, открытый ещё в апреле, а чуть раньше, в феврале 2025-го, компания уже развернула модели в Хух-Хото, административном центре региона, так что Уланчаб,- логичное масштабирование.
💡 Уланчаб выбран не случайно: среднегодовая температура +4 °C решает проблему охлаждения серверов без лишних затрат, а сам город уже стал «китайской облачной долиной» с дата-центрами Huawei, Alibaba, Apple, Kuaishou и China Mobile. Рядом с DeepSeek разворачивается Z.AI (бывшая Zhipu) — тоже 1 ГВт исключительно на китайских чипах.
💼 В июне DeepSeek закрыла первый внешний раунд на ¥51 млрд (~$7,4 млрд) при оценке до $59 млрд, а среди инвесторов — Tencent, CATL, Alibaba, IDG Capital. Основатель Лян Вэньфэн вложил ¥20 млрд личных средств и готовит IPO.
📎 Bloomberg · Market Briefs · Crypto Briefing
Кстати, по ощущениям прямой API DeepSeek стал быстрее отвечать.
#DeepSeek #ЦОД
------
@tsingular
📋 DeepSeek строит в Уланчабе, Внутренняя Монголия, дата-центр на 1 ГВт — часть своими силами, часть через аренду у сторонних операторов, первые мощности запустят к концу 2027 года.
О том, что проект вышел за рамки бумажных планов, говорит найм инженеров по обслуживанию серверов и менеджеров по доставке, открытый ещё в апреле, а чуть раньше, в феврале 2025-го, компания уже развернула модели в Хух-Хото, административном центре региона, так что Уланчаб,- логичное масштабирование.
💡 Уланчаб выбран не случайно: среднегодовая температура +4 °C решает проблему охлаждения серверов без лишних затрат, а сам город уже стал «китайской облачной долиной» с дата-центрами Huawei, Alibaba, Apple, Kuaishou и China Mobile. Рядом с DeepSeek разворачивается Z.AI (бывшая Zhipu) — тоже 1 ГВт исключительно на китайских чипах.
💼 В июне DeepSeek закрыла первый внешний раунд на ¥51 млрд (~$7,4 млрд) при оценке до $59 млрд, а среди инвесторов — Tencent, CATL, Alibaba, IDG Capital. Основатель Лян Вэньфэн вложил ¥20 млрд личных средств и готовит IPO.
📎 Bloomberg · Market Briefs · Crypto Briefing
Кстати, по ощущениям прямой API DeepSeek стал быстрее отвечать.
#DeepSeek #ЦОД
------
@tsingular
🔥13⚡2 1
Forwarded from Семейка продактов (Tatiana Sushchenko)
Разработка после AI: кто теперь думает, кто пишет и кто отвечает
В пятницу, 31 июля, в 19-30 по МСК, приходите послушать и поговорить про правильное внедрение ИИ в разработку.
В продакшен, в бизнесе, а не в личных пет-проектах.
У нас звёздный состав гостей:
🔵 Денис Маколин, CTO ЦТБ Сбер;
🔵 Вадим Беркович, CTO EvoGroup.ai, автор Pipeline v3;
🔵 Владимир Проворов, Microsoft/AWS - зарубежный бигтех;
🔵 Михаил Малышев, AI-эксперт, всё про ИИ и его продакшен-внедрение.
‼️Нет гарантии, что мы выложим запись: все-таки дискуссия это живая вещь.
Зарегистрироваться 👉 @ProductsGossip_bot
В пятницу, 31 июля, в 19-30 по МСК, приходите послушать и поговорить про правильное внедрение ИИ в разработку.
В продакшен, в бизнесе, а не в личных пет-проектах.
У нас звёздный состав гостей:
‼️Нет гарантии, что мы выложим запись: все-таки дискуссия это живая вещь.
Зарегистрироваться 👉 @ProductsGossip_bot
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9❤3✍2⚡1
Forwarded from Machinelearning
DeepSeek запустила официальный API модели V4-Flash и заметно улучшила её работу в агентных сценариях.
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности для долгих агентных задач;
- добавлена нативная поддержка Responses API;
- появились параллельные вызовы инструментов;
- доступны уровни рассуждения
- контекст увеличен до 1 млн токенов;
- модель адаптирована для работы с Codex.
V4-Flash можно подключить к Codex CLI, расширению для VS Code и другим совместимым инструментам через единый конфиг.
⚠️ Примечание
🔷 DeepSeek-V4-Flash-0731 сохранила ту же архитектуру и размер модели, что и предварительная версия.
🔷 Сегодняшнее обновление касается только API DeepSeek-V4-Flash. API DeepSeek-V4-Pro, а также модели в приложении и веб-версии пока остаются без изменений.
Официальный релиз DeepSeek-V4-Pro состоится в ближайшее время.
Документация:
https://api-docs.deepseek.com/quick_start/agent_integrations/codex
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности для долгих агентных задач;
- добавлена нативная поддержка Responses API;
- появились параллельные вызовы инструментов;
- доступны уровни рассуждения
low, high и max;- контекст увеличен до 1 млн токенов;
- модель адаптирована для работы с Codex.
V4-Flash можно подключить к Codex CLI, расширению для VS Code и другим совместимым инструментам через единый конфиг.
⚠️ Примечание
🔷 DeepSeek-V4-Flash-0731 сохранила ту же архитектуру и размер модели, что и предварительная версия.
🔷 Сегодняшнее обновление касается только API DeepSeek-V4-Flash. API DeepSeek-V4-Pro, а также модели в приложении и веб-версии пока остаются без изменений.
Официальный релиз DeepSeek-V4-Pro состоится в ближайшее время.
Документация:
https://api-docs.deepseek.com/quick_start/agent_integrations/codex
❤9⚡2🔥1
Forwarded from Не баг, а фича
Claude ВЗЛОМАЛ три компании во время тестов — нейросеть от Anthropic несколько раз сбегала и получала доступ к реальной инфраструктуре.
Один раз Claude добрался до продакшен-базы с сотнями строк данных. А другой раз выгрузил вредоносный пакет на PyPI — тот был доступен онлайн около часа и успел запуститься на 15 реальных системах.
Хакерством занимались три модели: Opus 4.7, Mythos 5 и ещё не выпущенный ИИ. При этом Opus 4.7 продолжал атаки даже осознав, что делает.
Сперва ChatGPT, теперь Claude. Безопасность в мире ИИ растёт.
🙂 Не баг, а фича
Один раз Claude добрался до продакшен-базы с сотнями строк данных. А другой раз выгрузил вредоносный пакет на PyPI — тот был доступен онлайн около часа и успел запуститься на 15 реальных системах.
Хакерством занимались три модели: Opus 4.7, Mythos 5 и ещё не выпущенный ИИ. При этом Opus 4.7 продолжал атаки даже осознав, что делает.
Сперва ChatGPT, теперь Claude. Безопасность в мире ИИ растёт.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁16🤔12🤣2
Судоку от Hermes@DeepSeek4flash
Новая версия флэш,- просто огонь.
Гермес с ней стал еще точнее, а главное быстрее.
А при цене $0.28/млн можно сказать что теперь "почти AGI" еще и бесплатный.
Вот такое судоку за пару запросов и 5 минут собрал.
https://chat.tsingular.ru/sudoku.html
Исходники в комментарии
Ждем релиз Pro. Похоже тут даже Mythos устареет
#sudoku #gamedev #dev #deepseek
------
@tsingular
Новая версия флэш,- просто огонь.
Гермес с ней стал еще точнее, а главное быстрее.
А при цене $0.28/млн можно сказать что теперь "почти AGI" еще и бесплатный.
Вот такое судоку за пару запросов и 5 минут собрал.
https://chat.tsingular.ru/sudoku.html
Исходники в комментарии
Ждем релиз Pro. Похоже тут даже Mythos устареет
#sudoku #gamedev #dev #deepseek
------
@tsingular
⚡16❤3🤯2 2🔥1
А вот это реально огнище.
Deepseek v4 flash (который по метрикам рвет Opus), теперь можно запустить на 128Gb железе!
Достаём спарки, макбуки и идем изучать что там Unsloth наварил:
https://unsloth.ai/docs/models/deepseek-v4
#Unsloth
------
@tsingular
Deepseek v4 flash (который по метрикам рвет Opus), теперь можно запустить на 128Gb железе!
Достаём спарки, макбуки и идем изучать что там Unsloth наварил:
https://unsloth.ai/docs/models/deepseek-v4
#Unsloth
------
@tsingular
🔥26❤9⚡4 1
Forwarded from AI.Sorceress @ Cloud
Хайп хайпом, а мы у себя в техподдержке cloud.ru тем временем внедряем агентов-диагностов, агентов-помощников и даже агентов-сотрудников. Агенты отвечают на простые вопросы и помогают людям собирать информацию для ответов на сложные.
Для меня лично очень важно, чтобы люди видели пользу от агентов, чтобы у людей было больше времени на сложные задачи, развитие, и на общение с теми людьми, которые находятся "с другой стороны", с нашими клиентами.
Раньше на поиск информации у инженеров, особенно менее опытных, уходили десятки минут, теперь за секунды вся нужная информация у них перед глазами.
Раньше были разные, зачастую устаревшие, разрозненные статьи и заметки, теперь все живут в едином пространстве знаний.
А мне захотелось привести пример того, как это выглядит для инженера, и того, как инженер оценивает работу таких ИИ-ромозников.
Для меня лично очень важно, чтобы люди видели пользу от агентов, чтобы у людей было больше времени на сложные задачи, развитие, и на общение с теми людьми, которые находятся "с другой стороны", с нашими клиентами.
Раньше на поиск информации у инженеров, особенно менее опытных, уходили десятки минут, теперь за секунды вся нужная информация у них перед глазами.
Раньше были разные, зачастую устаревшие, разрозненные статьи и заметки, теперь все живут в едином пространстве знаний.
А мне захотелось привести пример того, как это выглядит для инженера, и того, как инженер оценивает работу таких ИИ-ромозников.
👍15❤2⚡1🗿1
Forwarded from Искусственный интеллект. Высокие технологии
🤯 GPT-5.6 Sol помогла опровергнуть математическую гипотезу, державшуюся около 150 лет
Гипотеза Максвелла утверждала: электрическое поле от (n) точечных зарядов может иметь максимум ((n-1)^2) невырожденных точек равновесия.
Для пяти зарядов предел должен был составлять 16. Однако математики Филип Аратун, Гэвин Болл и Мэтью Квалхейм построили конфигурацию сразу с 24 такими точками. Этого достаточно, чтобы гипотеза оказалась ложной.
Ключевую идею конструкции предложила GPT-5.6 Sol: три заряда размещаются в вершинах равностороннего треугольника, ещё два — рядом с его центром по перпендикулярной оси. Центральная точка равновесия при этом распадается на целое семейство новых.
Авторы самостоятельно разработали доказательство, проверили математику и изложили аргументы своими словами. Для вычислений и визуализаций также использовались Mathematica и Maple.
Пока это свежий препринт, которому ещё предстоит независимая проверка. Но роль ИИ уже зафиксирована прямо в научной работе: модель помогла найти контрпример к задаче, восходящей к трактату Максвелла 1873 года.
ИИ начинает участвовать в создании новой математики и это происходит быстрее, чем многие ожидали.
source:
https://officechai.com/ai/gpt-5-6-sol-helps-mathematicians-prove-that-150-year-old-maxwell-conjecture-is-false/
paper:
https://arxiv.org/pdf/2607.27197
Гипотеза Максвелла утверждала: электрическое поле от (n) точечных зарядов может иметь максимум ((n-1)^2) невырожденных точек равновесия.
Для пяти зарядов предел должен был составлять 16. Однако математики Филип Аратун, Гэвин Болл и Мэтью Квалхейм построили конфигурацию сразу с 24 такими точками. Этого достаточно, чтобы гипотеза оказалась ложной.
Ключевую идею конструкции предложила GPT-5.6 Sol: три заряда размещаются в вершинах равностороннего треугольника, ещё два — рядом с его центром по перпендикулярной оси. Центральная точка равновесия при этом распадается на целое семейство новых.
Авторы самостоятельно разработали доказательство, проверили математику и изложили аргументы своими словами. Для вычислений и визуализаций также использовались Mathematica и Maple.
Пока это свежий препринт, которому ещё предстоит независимая проверка. Но роль ИИ уже зафиксирована прямо в научной работе: модель помогла найти контрпример к задаче, восходящей к трактату Максвелла 1873 года.
ИИ начинает участвовать в создании новой математики и это происходит быстрее, чем многие ожидали.
source:
https://officechai.com/ai/gpt-5-6-sol-helps-mathematicians-prove-that-150-year-old-maxwell-conjecture-is-false/
paper:
https://arxiv.org/pdf/2607.27197
⚡12🔥4🏆3😁2🤯2❤1
Forwarded from Анализ данных (Data analysis)
🧠 Две настройки утроили результат GPT-5.6 Sol на ARC-AGI-3
С официальным тестовым окружением модель набрала 13,3%. После включения двух функций Responses API результат вырос до 38,3%, а расход выходных токенов сократился примерно в 6 раз.
Средний результат человека на тех же публичных заданиях OpenAI оценивает в 48%.
Что изменили:
1. Сохранили рассуждения между действиями
Раньше после каждого хода агент терял найденные закономерности и фактически заново разбирался в игре.
2. Заменили обрезание истории на compaction
Вместо удаления старых действий длинный контекст сжимался, сохраняя важные наблюдения и выбранную стратегию.
В результате агент:
- быстрее принимал решения;
- реже повторял уже проделанную работу;
- лучше учился по ходу игры;
- тратил значительно меньше токенов.
Итоговый результат зависит не только от модели. Большую роль играют API, управление контекстом, промпт и устройство тестового harness.
OpenAI рекомендует использовать Responses API, сохранять рассуждения между вызовами и включать compaction для длинных сессий.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
#OpenAI #GPT56 #Agents #ARCAGI #LLM #AIEngineering
С официальным тестовым окружением модель набрала 13,3%. После включения двух функций Responses API результат вырос до 38,3%, а расход выходных токенов сократился примерно в 6 раз.
Средний результат человека на тех же публичных заданиях OpenAI оценивает в 48%.
Что изменили:
1. Сохранили рассуждения между действиями
Раньше после каждого хода агент терял найденные закономерности и фактически заново разбирался в игре.
2. Заменили обрезание истории на compaction
Вместо удаления старых действий длинный контекст сжимался, сохраняя важные наблюдения и выбранную стратегию.
В результате агент:
- быстрее принимал решения;
- реже повторял уже проделанную работу;
- лучше учился по ходу игры;
- тратил значительно меньше токенов.
Итоговый результат зависит не только от модели. Большую роль играют API, управление контекстом, промпт и устройство тестового harness.
OpenAI рекомендует использовать Responses API, сохранять рассуждения между вызовами и включать compaction для длинных сессий.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
#OpenAI #GPT56 #Agents #ARCAGI #LLM #AIEngineering
✍6🔥5⚡1