Forwarded from Machinelearning
NVIDIA обучила семейство моделей Nemotron-Terminal для автономной работы в терминале Linux: устанавливать зависимости, писать и запускать код, отлаживать окружения и выполнять сквозные инженерные задачи без участия человека.
Семейство построено на базе Qwen3 и специально собранном датасете Terminal-Corpus. И фишка не в архитектуре, а в данных.
Первый адаптирует готовые датасеты по математике, коду и SWE-задачам под терминальный формат (без участия LLM в процессе адаптации).
Второй генерирует синтетику 2 методами: seed-based (LLM создает новые задачи на основе существующих задач из смежных областей) и skill-based (LLM комбинирует до пяти примитивных навыков из таксономии по 9 доменам: Security, Data Science, System Administration и другим).
Terminal-Corpus: около 366K траекторий выполнения задач, разбитых на два потока: ~226K адаптированных примеров из Math/Code/SWE и ~140K синтетических задач на основе skill-таксономии.
Synthetic-Tasks: задачи в стандартизированном формате: инструкция, Docker-окружение из 9 преднастроенных образов и верификационный набор на pytest.
На Terminal-Bench 2.0 все 3 модели показали кратный рост относительно базовой Qwen3: 8B - с 2.5% до 13%, 14B - с 4% до 20.2%, 32B - с 3.4% до 27.4%.
Для сравнения: Qwen3-Coder на 480B параметров набирает 23.9%, GPT-5-Mini - 24.0%, Grok 4 - 23.1%. Nemotron-Terminal-32B превосходит или вплотную конкурирует с ними всеми при разнице в размере на порядок.
Фильтрация неудачных траекторий вредит. Модель, обученная на всех траекториях включая ошибочные, набирает 12.4% против 5.06% у варианта только с успешными.
Curriculum learning (сначала простые данные, потом сложные) не дал преимуществ перед простым смешанным обучением.
Увеличение контекстного окна с 32K до 65K токенов также не помогло, длинные траектории оказались шумнее.
@ai_machinelearning_big_data
#AI #ML #LLM #NemotronTerminal #NVIDIA
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Tips AI | IT & AI
Есть public-apis — старый репозиторий с огромной базой бесплатных API на любую тему.
Финансы, новости, погода, спорт, ML, развлечения.
Там у каждого API указан тип доступа:
• No auth: бесплатно, без регистрации
• apiKey: нужно получить ключ, есть с free тарифами и лимитами
• OAuth: нужна авторизация, часть платные
Можно скормить весь список AI-агенту и попросить найти что пригодится под твои задачи, найдёт то, что сам бы пропустил.
@tips_ai #tools
Финансы, новости, погода, спорт, ML, развлечения.
Там у каждого API указан тип доступа:
• No auth: бесплатно, без регистрации
• apiKey: нужно получить ключ, есть с free тарифами и лимитами
• OAuth: нужна авторизация, часть платные
Можно скормить весь список AI-агенту и попросить найти что пригодится под твои задачи, найдёт то, что сам бы пропустил.
@tips_ai #tools
Вот прямо сейчас чем-то таким занимаюсь (с перерывом на работу) - а тут и новый пакет подоспел. Надо пробовать
https://t.me/ai_machinelearning_big_data/9664
https://t.me/ai_machinelearning_big_data/9664
Telegram
Machinelearning
🌟 ByteDance перезапустила DeerFlow.
DeerFlow 2.0 - проект, переписанный с нуля, который не имеет ничего общего с первой версией. Там был фреймворк для глубокого ресерча, а здесь полноценный рантайм для агентов.
🟡В основе лежит связка LangGraph и LangChain.…
DeerFlow 2.0 - проект, переписанный с нуля, который не имеет ничего общего с первой версией. Там был фреймворк для глубокого ресерча, а здесь полноценный рантайм для агентов.
🟡В основе лежит связка LangGraph и LangChain.…
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
У CEO Obsidian есть еще проект Defuddle — который поможет вытаскивает чистый контент из любой веб-страницы и отдавать в Markdown.
Берёт страницу, убирает рекламу, навигацию, сайдбары, скрытые элементы, трекинг-пиксели, оставляет только контент.
Плюс вытаскивает метаданные в YAML формате: автор, дата публикации, описание, язык.
Можно получить то же самое прямо из CLI одной командой:
Использовать для скриптов и AI-агентов, которым нужен чистый текст без мусора — самое то.
Есть ещё markdown.new от Cloudflare, но он просто конвертирует весь HTML.
Использовать Defuddle можно как угодно:
• Веб — defuddle.md/URL
• CLI — npx defuddle parse URL
• Node.js — как библиотеку в своём проекте
• Obsidian Web Clipper
• Self-hosted
Изначально сделан для Obsidian Web Clipper: расширение, которое сохраняет веб-страницы в заметки Obsidian.
Сейчас он туда встроен (см. видео).
Вот ссылки на [сайт] и [GitHub]
@tips_ai #tools
Берёт страницу, убирает рекламу, навигацию, сайдбары, скрытые элементы, трекинг-пиксели, оставляет только контент.
Плюс вытаскивает метаданные в YAML формате: автор, дата публикации, описание, язык.
Можно получить то же самое прямо из CLI одной командой:
curl defuddle.md/stephango.com Использовать для скриптов и AI-агентов, которым нужен чистый текст без мусора — самое то.
Есть ещё markdown.new от Cloudflare, но он просто конвертирует весь HTML.
Использовать Defuddle можно как угодно:
• Веб — defuddle.md/URL
• CLI — npx defuddle parse URL
• Node.js — как библиотеку в своём проекте
• Obsidian Web Clipper
• Self-hosted
Изначально сделан для Obsidian Web Clipper: расширение, которое сохраняет веб-страницы в заметки Obsidian.
Сейчас он туда встроен (см. видео).
Вот ссылки на [сайт] и [GitHub]
@tips_ai #tools
❤1
Мой Claw сначала посмотрел на тему скептически - типа больше рекламы, но почитал код и решил - а что, системно написано, интересно…
https://t.me/ai_machinelearning_big_data/9667
https://t.me/ai_machinelearning_big_data/9667
Telegram
Machinelearning
🌟 OpenJarvis: фреймворк все-в-одном для ИИ-агентов
Stanford SAIL замерили, насколько эффективно локальные языковые модели конвертируют электроэнергию в полезные вычисления и назвали этот показатель "intelligence per watt".
Они прогнали больше миллиона реальных…
Stanford SAIL замерили, насколько эффективно локальные языковые модели конвертируют электроэнергию в полезные вычисления и назвали этот показатель "intelligence per watt".
Они прогнали больше миллиона реальных…
Кстати, после обновления у Claude появился 1 млн токенов контекста. Это круто, но все-равно, советую за контекстом следить, так как длинные сессии жрут много токенов (каждый новый вопрос к модели - это не добавление одной фразы, а загрузка всего контекста с нуля), а качество ответов модели - падает. Но это все-равно лучше чем autocompact
О, субагенты теперь и в Codex. Интересно, будут ли доступны суб-субагенты (в Claude code - нет). Вообще, время такое, что любое успешное решение моментально копируется.
А я как раз только-только, настраивая агентов, перенес их в папку с Клодом - теперь придется возвращаться к общей (у меня общие доки для моделей, будут и общие агенты)
PS - посмотрел, можно и вложенных агентов делать, то есть оркестрацию можно субагенту передать
А я как раз только-только, настраивая агентов, перенес их в папку с Клодом - теперь придется возвращаться к общей (у меня общие доки для моделей, будут и общие агенты)
PS - посмотрел, можно и вложенных агентов делать, то есть оркестрацию можно субагенту передать
ChatGPT Learn
Subagents | ChatGPT Learn
Use subagents in ChatGPT and Codex, and configure custom Codex agents
А Claude code получил новую фишку - форк контекста. Раньше головной агент получал всю инфу из контекста субагента, а теперь, при включенной опции fork, будет получать только результат - ну, собственно, так и должны работать агентские системы.
Тут важно, правда, чтобы при новом запросе можно было вызвать того конкретного субагента с контекстом, а не такого же нового. Не уверен, что это так сейчас работает, но посмотрим.
Тут важно, правда, чтобы при новом запросе можно было вызвать того конкретного субагента с контекстом, а не такого же нового. Не уверен, что это так сейчас работает, но посмотрим.
X (formerly Twitter)
Lydia Hallie ✨ (@lydiahallie) on X
Btw you can add `context: fork` to run a skill in an isolated subagent. The main context only sees the final result, not the intermediate tool calls
It gets a fresh context window with CLAUDE.md + your skill as the prompt. The `agent` field even lets you…
It gets a fresh context window with CLAUDE.md + your skill as the prompt. The `agent` field even lets you…
Подоспел интересный фреймворк для создания голосовых агентов. Тема очень любопытная - может прикручу к моему кло колонку от Яндекса (но без Яндекса)
Ну и, кстати, кто не захочет тратить память на локальные модели - апи для генерации голоса по тексту от Элона Маска
Ну и, кстати, кто не захочет тратить память на локальные модели - апи для генерации голоса по тексту от Элона Маска
LiveKit Documentation | The platform for voice, video, and physical AI
xAI TTS | LiveKit Documentation
How to use xAI TTS with LiveKit Agents.
Для любителей графов - автоматическое построение графа поверх GitHub
GitHub
GitHub - abhigyanpatwari/GitNexus: GitNexus: The Zero-Server Code Intelligence Engine
GitNexus: The Zero-Server Code Intelligence Engine - abhigyanpatwari/GitNexus
Модный плагин для управления контекстом - тоже надо бы попробовать…
GitHub
GitHub - volcengine/OpenViking: Self-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills.
Self-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills. - volcengine/OpenViking
🔥1
Forwarded from Machinelearning
⚡️ OpenAI выпустили GPT-5.4 mini - новый быстрый и компактный вариант GPT-5.4.
Модель уже доступна в:
• ChatGPT
• Codex
• OpenAI API
🚀 в 2 раза быстрее GPT-5 mini
По словам OpenAI, это самая мощная mini-модель компании, которая почти догоняет полноценный GPT-5.4 по возможностям, но работает быстрее и дешевле.
Также представлена версия GPT-5.4 nano - самая маленькая и дешёвая модель для задач вроде:
- классификации
- извлечения данных
- ranking
- coding-агентов
https://openai.com/index/introducing-gpt-5-4-mini-and-nano/
@ai_machinelearning_big_data
#openai #ai #ml #chatgpt
Модель уже доступна в:
• ChatGPT
• Codex
• OpenAI API
🚀 в 2 раза быстрее GPT-5 mini
По словам OpenAI, это самая мощная mini-модель компании, которая почти догоняет полноценный GPT-5.4 по возможностям, но работает быстрее и дешевле.
Также представлена версия GPT-5.4 nano - самая маленькая и дешёвая модель для задач вроде:
- классификации
- извлечения данных
- ranking
- coding-агентов
https://openai.com/index/introducing-gpt-5-4-mini-and-nano/
@ai_machinelearning_big_data
#openai #ai #ml #chatgpt
Вместе с установкой МАХ на iphone решил посмотреть, кто у меня куда передает данные без спроса. Поставил себе на сервер, через который идет мой траффик, программку Pi-hole. И много мне явилось чудных открытий. Вот мы на МАХ ругаемся, а стоит у меня VK - и передает данные непонятно кому ничем не хуже.
Среди покупных VPN обнаружились настоящие шпионские программы. Какие-то стремные неизвестные приложения (еще надо найти их на телефоне).
Про рекламу молчу - особенно отличается Озон, Яндекс, Google, тащит данные Microsoft. Очень любят тянуть данные банки - ПСБ, Тинькофф и пр.
В общем, шпионских программ на телефонах - больше чем глистов у бомжа. Буду теперь заниматься детоксикацией на постоянной основе...
Среди покупных VPN обнаружились настоящие шпионские программы. Какие-то стремные неизвестные приложения (еще надо найти их на телефоне).
Про рекламу молчу - особенно отличается Озон, Яндекс, Google, тащит данные Microsoft. Очень любят тянуть данные банки - ПСБ, Тинькофф и пр.
В общем, шпионских программ на телефонах - больше чем глистов у бомжа. Буду теперь заниматься детоксикацией на постоянной основе...
🔥2😱2🤔1👀1
Unsloth studio от ребят, которые - лучшие в части квантизации нейронок. Для тех, кто реально работает с обучением сетей
GitHub
GitHub - unslothai/unsloth: Local UI to run and train LLMs and diffusion models. Supports GGUF, MLX, Qwen3.8, DeepSeek-V4, MiniMax…
Local UI to run and train LLMs and diffusion models. Supports GGUF, MLX, Qwen3.8, DeepSeek-V4, MiniMax-H3, Gemma 4, FLUX and more. - unslothai/unsloth
Forwarded from Анализ данных (Data analysis)
⚡️ Нашёл интересный open-source проект: Crucix
Это self-hosted intelligence terminal, который автоматически следит за событиями в мире и присылает сигналы, когда что-то меняется.
По сути это персональный разведывательный агент для данных.
Crucix агрегирует данные примерно из 26 открытых источников и регулярно обновляет их.
Он собирает сигналы из разных категорий:
- геополитика
- экономика
- энергетика
- социальные тренды
- мировые события
И показывает всё это в едином self-hosted дашборде.
Главная идея — не читать десятки сайтов и новостей вручную.
Система сама:
• мониторит источники
• отслеживает изменения
• отправляет уведомления, если появляется важный сигнал
Фактически это инструмент раннего обнаружения трендов.
Можно использовать для:
- мониторинга рынков
- отслеживания геополитики
- анализа новостей
- поиска ранних сигналов изменений
Проект позиционируется как personal intelligence agent, который следит за миром и сообщает, когда происходит что-то важное.
https://github.com/calesthio/Crucix
🎯Полезные Мл-ресурсы 🚀 Max
@data_analysis_ml
Это self-hosted intelligence terminal, который автоматически следит за событиями в мире и присылает сигналы, когда что-то меняется.
По сути это персональный разведывательный агент для данных.
Crucix агрегирует данные примерно из 26 открытых источников и регулярно обновляет их.
Он собирает сигналы из разных категорий:
- геополитика
- экономика
- энергетика
- социальные тренды
- мировые события
И показывает всё это в едином self-hosted дашборде.
Главная идея — не читать десятки сайтов и новостей вручную.
Система сама:
• мониторит источники
• отслеживает изменения
• отправляет уведомления, если появляется важный сигнал
Фактически это инструмент раннего обнаружения трендов.
Можно использовать для:
- мониторинга рынков
- отслеживания геополитики
- анализа новостей
- поиска ранних сигналов изменений
Проект позиционируется как personal intelligence agent, который следит за миром и сообщает, когда происходит что-то важное.
https://github.com/calesthio/Crucix
🎯Полезные Мл-ресурсы 🚀 Max
@data_analysis_ml
Действительно интересный релиз. На OpenRouter Минимакс был самой популярной моделью, что говорит о многом. Стоит присмотреться, особенно если надо подключить какую-то модель по api
https://t.me/data_analysis_ml/4836
https://t.me/data_analysis_ml/4836
Telegram
Анализ данных (Data analysis)
⚡️ Вышла новая модель Minimax M2.7 и релиз получился очень мощным.
Что интересного:
• 🧠 Self-evolving модель
M2.7 — одна из первых моделей, которая помогала улучшать саму себя.
Во время RL-обучения она запускала 100+ автономных циклов оптимизации, что…
Что интересного:
• 🧠 Self-evolving модель
M2.7 — одна из первых моделей, которая помогала улучшать саму себя.
Во время RL-обучения она запускала 100+ автономных циклов оптимизации, что…
На OpenRouter, кстати, регулярно запускаются стелс-модели: бесплатные, от неизвестных авторов. Так, сейчас популярна модель Hunter Alpha - как оказалась, это ранняя версия Mimo V2-Pro от Xiomi.
openrouter.ai
Hunter Alpha - API Pricing & Providers
Hunter Alpha is a 1 Trillion parameter + 1M token context frontier intelligence model built for agentic use. 1,048,576 token context window.
Как поделелились коллеги, у нас уже был эпизод, когда чувак устроился на работу, используя ИИ, который слушал вопросы и давал подсказки для прохождения интервью. Но с работой не получилось - видимо, был слабоват в вайбкодинге. А так, надо понимать, что скоро все наши резюме будут писать эти ИИшки
https://t.me/machinelearning_interview/2609
https://t.me/machinelearning_interview/2609
Telegram
Machine learning Interview
💼 Полезный опенсорс персональный ИИ-тренер для поиска работы и подготовки к собеседованиям.
Что он делает:
• Сам анализирует вакансию и подгоняет под неё ваше резюме;
• Проводит тренировочные собеседования и разбирает ошибки;
• Если «плаваете» — даёт набор…
Что он делает:
• Сам анализирует вакансию и подгоняет под неё ваше резюме;
• Проводит тренировочные собеседования и разбирает ошибки;
• Если «плаваете» — даёт набор…
Пожалуй попробую. Мой интерес к этой теме в том, чтобы вместо работы с pdf и docs сделать для нейронок промежуточный слой в маркдаун.. Свой OCR я сделал, добавлю в него еще модель
https://t.me/machinelearning_interview/2611
https://t.me/machinelearning_interview/2611
Telegram
Machine learning Interview
🚀 Qianfan-OCR - end-to-end модель на 4B параметров для работы с документами.
Главная идея - одна модель вместо целого пайплайна.
Что умеет:
• 📄 Парсинг документов в один проход
Без разбиения на OCR → post-processing → extraction.
Модель сразу выдаёт…
Главная идея - одна модель вместо целого пайплайна.
Что умеет:
• 📄 Парсинг документов в один проход
Без разбиения на OCR → post-processing → extraction.
Модель сразу выдаёт…
❤1