Новая работа MIT: LLM, который видит и меняет состояние Python
В MIT предложили подход, при котором языковая модель работает не только с текстом, а напрямую с живым состоянием Python-кода - переменными, объектами в памяти и текущей точкой выполнения.
Подход называется NIGHTJAR.
Главный результат
В экспериментах NIGHTJAR сократил объем кода в среднем на 39.6% без потери корректности.
В чем была проблема
Обычная LLM:
- читает текст
- генерирует текст
- не видит реальные данные программы
Поэтому типичный пайплайн выглядит так:
- данные сериализуются в текст
- отправляются модели
- ответ парсится
- программа вручную обновляется
Много glue-кода, много мест для ошибок.
Что меняет совместное состояние
Shared state полностью меняет модель взаимодействия:
- LLM может читать и писать переменные
- изменять объекты прямо в памяти
- останавливать и пропускать циклы
- работать с текущим состоянием выполнения
Модель не «рассуждает о коде», она с ним взаимодействует.
Как это реализовано
LLM не получает прямой доступ к памяти.
Она отправляет небольшие команды:
- прочитать переменную
- записать значение
- обновить объект
- выйти из цикла
Python-обработчик выполняет эти команды.
Такой контракт авторы называют natural function interface.
Результаты
На бенчмарке SPSBench с 25 программами:
- корректность осталась на уровне ручной интеграции или выше
- код стал заметно короче
- но время выполнения иногда росло до 4.3 раза
Причина проста - каждое обращение к состоянию может требовать отдельного вызова модели.
Почему это важно
- меньше шаблонного glue-кода
- проще писать сложную логику с участием LLM
- шаг к более тесной интеграции AI и runtime
- фундамент для новых агентных и интерактивных систем
Это не про ускорение.
Это про изменение архитектуры взаимодействия между программой и моделью.
📌 Статья: arxiv.org/abs/2512.14805
#AI #LLM #Python
В MIT предложили подход, при котором языковая модель работает не только с текстом, а напрямую с живым состоянием Python-кода - переменными, объектами в памяти и текущей точкой выполнения.
Подход называется NIGHTJAR.
Главный результат
В экспериментах NIGHTJAR сократил объем кода в среднем на 39.6% без потери корректности.
В чем была проблема
Обычная LLM:
- читает текст
- генерирует текст
- не видит реальные данные программы
Поэтому типичный пайплайн выглядит так:
- данные сериализуются в текст
- отправляются модели
- ответ парсится
- программа вручную обновляется
Много glue-кода, много мест для ошибок.
Что меняет совместное состояние
Shared state полностью меняет модель взаимодействия:
- LLM может читать и писать переменные
- изменять объекты прямо в памяти
- останавливать и пропускать циклы
- работать с текущим состоянием выполнения
Модель не «рассуждает о коде», она с ним взаимодействует.
Как это реализовано
LLM не получает прямой доступ к памяти.
Она отправляет небольшие команды:
- прочитать переменную
- записать значение
- обновить объект
- выйти из цикла
Python-обработчик выполняет эти команды.
Такой контракт авторы называют natural function interface.
Результаты
На бенчмарке SPSBench с 25 программами:
- корректность осталась на уровне ручной интеграции или выше
- код стал заметно короче
- но время выполнения иногда росло до 4.3 раза
Причина проста - каждое обращение к состоянию может требовать отдельного вызова модели.
Почему это важно
- меньше шаблонного glue-кода
- проще писать сложную логику с участием LLM
- шаг к более тесной интеграции AI и runtime
- фундамент для новых агентных и интерактивных систем
Это не про ускорение.
Это про изменение архитектуры взаимодействия между программой и моделью.
📌 Статья: arxiv.org/abs/2512.14805
#AI #LLM #Python
🔥18👍6❤5
🧭 LLMRouter - умная маршрутизация запросов между LLM
UIUC (ULab) выложили LLMRouter - проект про то, что скоро станет стандартом в AI-продуктах:
не выбирать “одну лучшую модель”,
а маршрутизировать запросы между несколькими LLM так, чтобы было:
- дешевле
- быстрее
- точнее
Идея простая:
разные модели сильны в разном.
Одна лучше пишет код, другая - рассуждает, третья - дешёвая для рутины.
Но большинство продуктов до сих пор делают тупо:
“все запросы → одна LLM”.
LLMRouter делает наоборот:
- анализирует входной запрос
- оценивает сложность / тип задачи
- выбирает подходящую модель
- может учитывать цену, latency, качество, политики
В итоге:
✅ обычные вопросы идут в дешёвую модель
✅ сложные reasoning-задачи - в сильную
✅ код/инструменты - в специализированную
✅ и всё это автоматически
Почему это важно:
как только у тебя 3-5 моделей (OpenAI/Anthropic/Gemini/open-source),
маршрутизация превращается в экономию десятков тысяч долларов в месяц.
Короче: это “load balancer” для LLM, но с мозгами.
GitHub: https://github.com/ulab-uiuc/LLMRouter
#LLM #AI #Routing #Agents #MLOps
@pythonl
UIUC (ULab) выложили LLMRouter - проект про то, что скоро станет стандартом в AI-продуктах:
не выбирать “одну лучшую модель”,
а маршрутизировать запросы между несколькими LLM так, чтобы было:
- дешевле
- быстрее
- точнее
Идея простая:
разные модели сильны в разном.
Одна лучше пишет код, другая - рассуждает, третья - дешёвая для рутины.
Но большинство продуктов до сих пор делают тупо:
“все запросы → одна LLM”.
LLMRouter делает наоборот:
- анализирует входной запрос
- оценивает сложность / тип задачи
- выбирает подходящую модель
- может учитывать цену, latency, качество, политики
В итоге:
✅ обычные вопросы идут в дешёвую модель
✅ сложные reasoning-задачи - в сильную
✅ код/инструменты - в специализированную
✅ и всё это автоматически
Почему это важно:
как только у тебя 3-5 моделей (OpenAI/Anthropic/Gemini/open-source),
маршрутизация превращается в экономию десятков тысяч долларов в месяц.
Короче: это “load balancer” для LLM, но с мозгами.
GitHub: https://github.com/ulab-uiuc/LLMRouter
#LLM #AI #Routing #Agents #MLOps
@pythonl
👍19❤11🔥7
Forwarded from Machinelearning
PythonRobotics - открытая коллекция кода на Python и учебник по алгоритмам робототехники, которую собрал Ацуши Сакаи.
К каждой теме есть визуальные анимации, математические объяснения и рабочий код.
Библиотека не перегружена, ее легко читать и понимать, она содержит практические алгоритмы. которые реально используются в индустрии.
Это отличный образовательный ресурс с 2 212 коммитами, вкладом 138 разработчиков и активной поддержкой.
Если вы изучаете робототехнику, создаете автономные системы или преподаете алгоритмы — этот ресурс для вас.
У проекта лицензия MIT, так что можно свободно использовать его в личных или коммерческих проектах.
А еще, это отличный пример, как выглядит хороший опен-сорс: образовательный, практичный, хорошо документированный и развиваемый сообществом.
@ai_machinelearning_big_data
#AI #ML #Robotics #Github
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11❤8
🤖 Chat an idea - get a full research paper.
Появился интересный open-source проект - AutoResearchClaw.
Это система автономного AI-ресёрча: вы просто пишете идею исследования, а агент запускает полный исследовательский цикл автоматически.
Что делает система:
• генерирует гипотезу и план исследования
• ищет и анализирует научные работы
• запускает эксперименты
• пишет код и анализирует результаты
• формирует графики и выводы
• собирает готовую научную статью
Фактически это AI-pipeline “от идеи до paper”.
Один запрос →
полный research workflow без участия человека.
Проект построен как мульти-агентная система, где разные агенты выполняют отдельные задачи: поиск литературы, эксперименты, анализ и написание текста.
Такие системы могут сильно ускорить:
• научные исследования
• ML-эксперименты
• генерацию идей и гипотез
• подготовку академических статей
https://github.com/aiming-lab/AutoResearchClaw
#AI #LLM #AIAgents #MachineLearning #Research
🐍 Python полезные ресурсы 🚀Max
@pythonl
Появился интересный open-source проект - AutoResearchClaw.
Это система автономного AI-ресёрча: вы просто пишете идею исследования, а агент запускает полный исследовательский цикл автоматически.
Что делает система:
• генерирует гипотезу и план исследования
• ищет и анализирует научные работы
• запускает эксперименты
• пишет код и анализирует результаты
• формирует графики и выводы
• собирает готовую научную статью
Фактически это AI-pipeline “от идеи до paper”.
Один запрос →
полный research workflow без участия человека.
Проект построен как мульти-агентная система, где разные агенты выполняют отдельные задачи: поиск литературы, эксперименты, анализ и написание текста.
Такие системы могут сильно ускорить:
• научные исследования
• ML-эксперименты
• генерацию идей и гипотез
• подготовку академических статей
https://github.com/aiming-lab/AutoResearchClaw
#AI #LLM #AIAgents #MachineLearning #Research
🐍 Python полезные ресурсы 🚀Max
@pythonl
❤12👍3😁2🔥1🎉1
Forwarded from Machinelearning
Соло-разработчик с доступом к Claude Code теперь может развернуть целую гейм-дев студию с креативным директором, лидами отделов и профильными специалистами.
В основу геймдизайнерских подходов заложены MDA Framework, теория самодетерминации и проектирование состояния потока.
Claude Code Game Studios - шаблон для Claude Code, который организует ИИ-сессию в трёхуровневую иерархию из 48 специализированных агентов.
На вершине 3 директора (креативный, технический и продюсер), работающие на модели Opus.
Уровнем ниже 8 руководителей отделов на Sonnet: геймдизайнер, ведущий программист, арт-директор, директор по звуку, нарративный директор и другие.
Третий уровень - специалисты на Sonnet и Haiku: от геймплэй-программиста и дизайнера экономики до DevOps-инженера и специалиста по доступности.
Агенты взаимодействуют по четкому протоколу: вертикальная делегация задач сверху вниз, горизонтальные консультации между агентами одного уровня, эскалация конфликтов к общему руководителю.
Каждый агент работает строго в границах своего домена и не модифицирует чужие файлы без явного поручения.
Помимо агентов, шаблон включает 37 команд, покрывающих весь цикл разработки: планирование спринтов, ревью кода и дизайна, аудит ассетов, генерацию идей, подготовку к релизу.
Отдельная категория - командные воркфлоу, которые координируют работу нескольких агентов над конкретной фичей: боевой системой, нарративом, интерфейсом или звуком.
Параллельно работают 8 хуков, привязанных к событиям git и жизненному циклу сессии. Они срабатывают автоматически: валидируют коммиты на захардкоженные значения и корректность данных, предупреждают о пушах в защищённые ветки, подгружают контекст текущего спринта при старте и фиксируют результаты при завершении.
Ещё один слой - 11 правил, привязанных к путям в проекте. Они применяются при редактировании файлов в соответствующих директориях и задают стандарты для каждой зоны кодовой базы.
Агенты задают вопросы, предлагают несколько вариантов с плюсами и минусами, показывают черновик. Но финальное решение всегда за человеком, ничего не фиксируется без его одобрения.
Для каждого предусмотрен свой лид-агент с набором суб-специалистов: у Godot это GDScript, шейдеры и GDExtension, у Unity - DOTS/ECS, VFX и UI Toolkit, у Unreal - GAS, Blueprints и Replication.
Проект открыт к кастомизации: агентов можно добавлять и удалять, промпты редактировать, хуки - перенастраивать.
@ai_machinelearning_big_data
#AI #ML #Vibecoding #Gamedev #Claude
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7😱6🔥5👍1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Китайская лаборатория релизнула GLM-5.1 - флагманскую MoE-модель с 754B параметров нового поколения, ориентированную на агентную инженерию.
Фокус релиза - на кодинг и долгие агентные сессии.
GLM-5.1 построена так, чтобы оставаться продуктивной на длинной дистанции: декомпозировать задачу, запускать эксперименты, читать результаты, находить блокеры и пересматривать стратегию.
Z ai утверждает, что модель устойчиво оптимизирует решение на протяжении сотен итераций и тысяч вызовов инструментов, то есть результат тем заметнее, чем дольше она запускают.
API доступен на платформе Z ai, веб-версия на chat.z.ai обещана в ближайшие дни. Веса опубликованы на Hugging Face под лицензией MIT.
Для локального развертывания уже готовы сборки под SGLang 0.5.10+, vLLM 0.19.0+, xLLM, KTransformers и свежую ветку Transformers.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13❤4
Forwarded from Machinelearning
Команда Claude Code опубликовала в X руководство по loops. Это паттерны, в которых агент повторяет рабочий цикл, пока не сработает условие остановки.
Главная мысль: уходить от ручного режима, где разработчик задаёт направление на каждом шаге, и передавать агенту контроль по нарастающей.
Всего выделяют 4 типа циклов, различая их по способу запуска, условию остановки и степени автономии. Логически получается некая лестница делегирования, где на каждой ступени вы отдаёте агенту очередное полномочие.
Здесь вы отдаёте агенту проверку. Ручные шаги верификации заполняются в
SKILL.md и чем более количественные критерии, тем точнее агент оценивает собственную работу./goal забирает у вас условие прерыванияВы описываете, что значит готово, а дальше при каждой попытке Claude завершить работу отдельная модель-оценщик сверяет результат с вашим критерием (скажем, долей пройденных тестов) и возвращает агента к работе, пока цель не достигнута или не исчерпан заданный лимит попыток.
/loop или /schedule берёт на себя триггер запуска.Это удобно для повторяющейся рутины и при работе с внешними системами (например, дайджест по таскам, реакция на новое ревью или упавший CI).
Рутина срабатывает по событию или расписанию и живёт, пока вы её не выключите. В связке с динамическими воркфлоу агенту передаётся уже сам промпт. Вот этот сценарий уже ближе всего к полной автоматизации.
Не каждая задача требует сложного цикла, начинать стоит с простейшего решения.
Кодовую базу следует держать чистой, а для ревью подключать второй агент. Для этого есть встроенный /code-review.
Контролировать расход токенов чёткими границами: точные условия остановки, подбор модели под задачу (рутину - на модели поменьше и побыстрее, решения с ризонингом - на самой мощной).
Динамические воркфлоу способны породить сотни агентов, так что масштаб лучше проверять на небольшой выборке.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3🔥2🎉1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Институт General Intuition вместе с французской лабораторией Kyutai и Epic Games представил MIRA, генеративный симулятор, воспроизводящий матчи Rocket League в формате 2 на 2 в реальном времени.
На входе только история кадров и нажатия клавиш всех четырёх игроков: ни физического движка, ни рендер-движка, ни явных 3D-представлений в инференсе нет.
В отличие от Odyssey, где логика вычислений и рендеринг разведены, MIRA пошла по пути генеративной симуляции в латентном пространстве видео.
В основе - диффузионный трансформер на 5 млрд параметров и отдельный видеокодек-представление на 600 млн.
Вместо автоэнкодера кодек строится поверх замороженного DINOv3-L, и латентное пространство выходит настолько стабильным, что специальные приёмы против дрейфа не понадобились, модель работает из коробки на обычном diffusion forcing.
Экраны четырёх игроков MIRA сшивает в единую сетку латентов, чтобы механизмы пространственного внимания работали между ракурсами и держали машины, мяч и события согласованными на всех видах.
Механизм action dropout достраивает поведение машин, для которых команды не пришли, компенсируя пропуски в потоках действий.
Всего на обучение MIRA ушло около 10 тыс часов геймплея, целиком сгенерированных ботами.
Латентный подход бьёт пиксельный на порядок: gFID 10.7 против 81–105 и ARR 0.91 против 0.49–0.61 (ARR измеряет, насколько отданные команды считываются обратно из генерации).
Ключ к стабильности именно в DINOv3-L, без него картинка дрейфует в 1.3–1.7 раза сильнее, а с ним gFID держится ровным вплоть до 5 минут, и на практике роллаут идёт часами без коллапса.
ARR, кстати, совпадает с оценками живых людей (корреляция Пирсона 0.84).
Контекст модели около четырёх секунд, поэтому повторы голов она попросту досочиняет - выглядит правдоподобно, но не совпадает с тем, что было на самом деле.
Часы и счёт плывут на переходах, а за 40 минут игры набегает порядка 80 некомандных бустов и 30 прыжков.
Авторы опубликовали код обучения и инференса, а также сет Rocket Science из 1000 часов каток в 720p с потоками действий и физическими состояниями.
На одной NVIDIA B200 модель выдаёт 20 FPS при 576p в реальном времени. Потыкать в играбельное демо можно тут.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7🔥4👍2🎉1
Все уже пользуются AI coding agents. Но почти никто не понимает, как они реально работают.
Вместо магии и маркетинга там показывают базовый цикл агента: модель отвечает, просит вызвать tool, код выполняет действие, результат возвращается обратно в контекст, и цикл продолжается.
Дальше на этот скелет постепенно навешиваются реальные части агентной системы:
* tool use
* permissions
* hooks
* memory
* context compaction
* subagents
* background tasks
* MCP
* worktree isolation
71.1K звёзд у tutorial repo — хороший сигнал. Люди устали от “AI agents за 5 минут” и хотят наконец понять, что там внутри.
https://github.com/shareAI-lab/learn-claude-code
#AI #OpenSource
learn-claude-code разбирает Claude Code-style agent harness с нуля. Авторская формула простая: Bash is all you need.Вместо магии и маркетинга там показывают базовый цикл агента: модель отвечает, просит вызвать tool, код выполняет действие, результат возвращается обратно в контекст, и цикл продолжается.
Дальше на этот скелет постепенно навешиваются реальные части агентной системы:
* tool use
* permissions
* hooks
* memory
* context compaction
* subagents
* background tasks
* MCP
* worktree isolation
71.1K звёзд у tutorial repo — хороший сигнал. Люди устали от “AI agents за 5 минут” и хотят наконец понять, что там внутри.
https://github.com/shareAI-lab/learn-claude-code
#AI #OpenSource
❤6👍4🔥4
Обычный вызов LLM часто напоминает лотерею: модель может нарушить формат, пропустить требование или вернуть ответ, который сложно проверить.
Mellea предлагает писать такие системы как типизированные generative-программы.
Достаточно описать Python-функцию:
from pydantic import BaseModel
from mellea import generative, start_session
class UserProfile(BaseModel):
name: str
age: int
@generative
def extract_user(text: str) -> UserProfile:
"""Извлеки имя и возраст пользователя."""
m = start_session()
user = extract_user(
m,
text="Alice is 31 years old."
)
Mellea превращает docstring в инструкцию, аннотации типов - в схему ответа, а затем проверяет результат и при необходимости автоматически повторяет генерацию.
Возможности проекта:
- структурированные ответы через Pydantic;
- проверяемые требования и автоматический repair;
- rejection sampling и majority voting;
- поддержка OpenAI, Ollama, Hugging Face, Bedrock, LiteLLM и WatsonX;
- интеграция с существующим кодом;
- публикация generative-программ как MCP-инструментов.
Проект начат в IBM Research, написан на Python и распространяется под лицензией Apache 2.0.
https://github.com/generative-computing/mellea
#python #ai #llm #opensource #agents
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10🔥8👍5