Codex запустил плагины в своем приложении типа @gmail @figma, и обнулил лимиты, чтобы можно было их как следует потестировать. Праздник продолжается
X (formerly Twitter)
OpenAI Developers (@OpenAIDevs) on X
We're rolling out plugins in Codex.
Codex now works seamlessly out of the box with the most important tools builders already use, like @SlackHQ, @Figma, @NotionHQ, @gmail, and more.
https://t.co/PQDsLqHGA6
Codex now works seamlessly out of the box with the most important tools builders already use, like @SlackHQ, @Figma, @NotionHQ, @gmail, and more.
https://t.co/PQDsLqHGA6
Ну а Claude code запустил auto fix команду для автоматического исправления ошибок..
X (formerly Twitter)
Noah Zweben (@noahzweben) on X
Thrilled to announce Claude Code auto-fix – in the cloud. Web/Mobile sessions can now automatically follow PRs - fixing CI failures and addressing comments so that your PR is always green.
This happens remotely so you can fully walk away and come back to…
This happens remotely so you can fully walk away and come back to…
Появился ещё один интересный кандидат для голосовых агентов — Voxtral Mini 4B Realtime от Mistral.
Что важно:
• это realtime streaming ASR,
• русский язык поддерживается,
• модель заточена именно под низкую задержку и voice-agent сценарии,
• размер около 4B, то есть это уже похоже на реальный кандидат для локального/edge запуска.
Но: “поддерживает русский” ещё не значит “лучше всех на русском”. Для прод-сценария его всё равно надо сравнивать с Sber STT, Yandex SpeechKit и Whisper/Whisper-MLX на реальных русских звонках и шумном аудио.
Ссылки:
• Hugging Face: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602
• Документация Transformers: https://huggingface.co/docs/transformers/model_doc/voxtral
• Анонс Mistral: https://mistral.ai/news/voxtral-transcribe-2
Что важно:
• это realtime streaming ASR,
• русский язык поддерживается,
• модель заточена именно под низкую задержку и voice-agent сценарии,
• размер около 4B, то есть это уже похоже на реальный кандидат для локального/edge запуска.
Но: “поддерживает русский” ещё не значит “лучше всех на русском”. Для прод-сценария его всё равно надо сравнивать с Sber STT, Yandex SpeechKit и Whisper/Whisper-MLX на реальных русских звонках и шумном аудио.
Ссылки:
• Hugging Face: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602
• Документация Transformers: https://huggingface.co/docs/transformers/model_doc/voxtral
• Анонс Mistral: https://mistral.ai/news/voxtral-transcribe-2
huggingface.co
mistralai/Voxtral-Mini-4B-Realtime-2602 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Data Secrets
Google выпустили Gemini 3.1 Flash Live
Это аудио‑first модель, которая ориентирована на лайв диалоги и голосовые интерфейсы.
Обещают максимально естественную речь и минимальную задержку. Модель может отличать нюансы диалога по тону и темпу голоса (например, может поменять стиль ответа, если вы выказываете раздражение).
Контекст у новой модели держится примерно в два раза дольше, чем у прошлой версии Gemini Live, то есть она довольна хороша в длинных диалогах.
По другим бенчмаркам (устойчивость к шуму, многошаговый tool call из аудио ввода, следование инструкциям, логика диалога) Gemini 3.1 Flash Live также сильно скакнула относительно предыдущей модели и выбилась в уверенные лидеры.
Для потребителей эта моделька будет лежать в основе Search Live и Gemini Live.
Сейчас поболтать с ней уже можно в Gemini app или через Live API (цена относительно Gemini 2.5 Flash Live не изменилась)
Это аудио‑first модель, которая ориентирована на лайв диалоги и голосовые интерфейсы.
Обещают максимально естественную речь и минимальную задержку. Модель может отличать нюансы диалога по тону и темпу голоса (например, может поменять стиль ответа, если вы выказываете раздражение).
Контекст у новой модели держится примерно в два раза дольше, чем у прошлой версии Gemini Live, то есть она довольна хороша в длинных диалогах.
По другим бенчмаркам (устойчивость к шуму, многошаговый tool call из аудио ввода, следование инструкциям, логика диалога) Gemini 3.1 Flash Live также сильно скакнула относительно предыдущей модели и выбилась в уверенные лидеры.
Для потребителей эта моделька будет лежать в основе Search Live и Gemini Live.
Сейчас поболтать с ней уже можно в Gemini app или через Live API (цена относительно Gemini 2.5 Flash Live не изменилась)
Forwarded from Анализ данных (Data analysis)
Перед вами репозиторий с полноценным визуальным и практическим гайдом по одному из самых мощных инструментов для разработчиков.
Что внутри:
• Пошаговое обучение - от базовых команд (/init, /plan) до продвинутых вещей вроде MCP, хуков и агентов
Осваивается за ~11–13 часов
• Большая библиотека кастомных команд под реальные задачи
• Готовые шаблоны памяти - как для одиночной работы, так и для команд
• Инструкции и скрипты для:
- автокод-ревью
- проверки стиля и стандартов
- генерации API-документации
• Автоматизация через циклы
Можно настроить Claude так, чтобы он работал автономно без вашего участия
• Подключение внешних инструментов
GitHub, API и другие сервисы - всё разложено по шагам
• Объяснения через схемы и диаграммы
Подойдёт даже тем, кто только начинает
• Примеры настройки узкоспециализированных субагентов
• Отдельные скрипты под обучение
Например, генерация книг и материалов для быстрого освоения любой темы
https://github.com/luongnv89/claude-howto
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Может быть интересно, если есть задачки для средненькой модели
https://t.me/ai_machinelearning_big_data/9765
https://t.me/ai_machinelearning_big_data/9765
Telegram
Machinelearning
GLM-5.1 теперь доступна для всех пользователей плана GLM Coding!
http://z.ai/subscribe
@ai_machinelearning_big_data
#news #ai #ml #glm
http://z.ai/subscribe
@ai_machinelearning_big_data
#news #ai #ml #glm
Мне тут Клод пишет, что из-за нехватки памяти Apple сняли с производства Mac Studio M3 Ultra 512….
Forwarded from Machinelearning
👀 Релиз SAM 3.1 - одной из самых сильных open-source моделей для компьютерного зрения.
Модель понимает, что происходит на изображении или видео, и умеет находить объекты по текстовому описанию. Можно буквально написать «человек в красной футболке» и она найдёт нужных людей.
Работает не только с картинками, но и с видео. Объект можно задать один раз, и дальше модель будет отслеживать его между кадрами.
Ключевая идея - open-vocabulary. Модель не ограничена фиксированными классами, как старые системы. Она оперирует огромным количеством понятий и может находить практически любые объекты.
Ещё важный момент можно комбинировать способы управления: текст, клики, рамки, маски. Это даёт гораздо больше контроля и точности.
Под капотом новая архитектура, где отдельно решаются задачи поиска объектов и их отслеживания. За счёт этого модель лучше различает похожие вещи и стабильнее работает на видео.
В репозитории уже есть всё для старта: готовые веса, код, примеры и ноутбуки.
По факту это уже не просто инструмент для разметки, а полноценный vision-движок, который можно встраивать в реальные продукты от аналитики видео до автоматизации разметки данных.
Теперь модель может отслеживать до 16 объектов за один проход.
С multiplexing все объекты обрабатываются одновременно:
• меньше лишних вычислений
• нет узких мест по памяти
Результат: скорость обработки видео увеличивается примерно в 2 раза
с 16 до 32 FPS на одном NVIDIA H100!
На новом бенчмарке SA-CO, который включает 270 тысяч уникальных концептов, SAM 3 достигает 75–80% от уровня человека.
https://github.com/facebookresearch/sam3
@ai_machinelearning_big_data
#ai #ml #llm #cv #python
Модель понимает, что происходит на изображении или видео, и умеет находить объекты по текстовому описанию. Можно буквально написать «человек в красной футболке» и она найдёт нужных людей.
Работает не только с картинками, но и с видео. Объект можно задать один раз, и дальше модель будет отслеживать его между кадрами.
Ключевая идея - open-vocabulary. Модель не ограничена фиксированными классами, как старые системы. Она оперирует огромным количеством понятий и может находить практически любые объекты.
Ещё важный момент можно комбинировать способы управления: текст, клики, рамки, маски. Это даёт гораздо больше контроля и точности.
Под капотом новая архитектура, где отдельно решаются задачи поиска объектов и их отслеживания. За счёт этого модель лучше различает похожие вещи и стабильнее работает на видео.
В репозитории уже есть всё для старта: готовые веса, код, примеры и ноутбуки.
По факту это уже не просто инструмент для разметки, а полноценный vision-движок, который можно встраивать в реальные продукты от аналитики видео до автоматизации разметки данных.
Теперь модель может отслеживать до 16 объектов за один проход.
С multiplexing все объекты обрабатываются одновременно:
• меньше лишних вычислений
• нет узких мест по памяти
Результат: скорость обработки видео увеличивается примерно в 2 раза
с 16 до 32 FPS на одном NVIDIA H100!
На новом бенчмарке SA-CO, который включает 270 тысяч уникальных концептов, SAM 3 достигает 75–80% от уровня человека.
https://github.com/facebookresearch/sam3
@ai_machinelearning_big_data
#ai #ml #llm #cv #python
Forwarded from Data Secrets
NeuralDeep Skills: локальная база агентных навыков под ру-сервисы
Всем, кто пользуется агентами, 100% известна такая вещь, как skills.sh. Это огромная база скиллов агентов под любые сервисы. Ставишь – и агент уже умеет с ними работать из коробки.
Так вот, в российском сообществе давно напрашивался аналог под локальный стек. И его сделал наш друг и коллега по тг – Валерий @neuraldeep. Он в целом регулярно делает разные практичные штуки для разработчиков, и это как раз одна из них.
Итак, встречайте: neuraldeep.ru/
Это база, в которой будут собраны скиллы для работы с самими разными ру-сервисами. Туда уже залили интеграции под инструменты Яндекс, Битрикс24, 1С и другое, чем многие пользуются каждый день.
– Установка все так же происходит одной командой, все привычно и понятно
– Проект опенсорсный: туда можно просто прийти и залить свой скилл через GitHub (формат claude-skill)
– Есть модерация и базовые проверки безопасности
Из этого вполне может получиться что-то вроде стандартного слоя для агентных интеграций под рф-рынок. Если работаете с агентами – заходите попробовать или даже поучаствовать.
Проект -> neuraldeep.ru/
Гитхаб -> https://github.com/vakovalskii/neuraldeep
Следите за обновлениями в канале Валеры -> @neuraldeep
Всем, кто пользуется агентами, 100% известна такая вещь, как skills.sh. Это огромная база скиллов агентов под любые сервисы. Ставишь – и агент уже умеет с ними работать из коробки.
Так вот, в российском сообществе давно напрашивался аналог под локальный стек. И его сделал наш друг и коллега по тг – Валерий @neuraldeep. Он в целом регулярно делает разные практичные штуки для разработчиков, и это как раз одна из них.
Итак, встречайте: neuraldeep.ru/
Это база, в которой будут собраны скиллы для работы с самими разными ру-сервисами. Туда уже залили интеграции под инструменты Яндекс, Битрикс24, 1С и другое, чем многие пользуются каждый день.
– Установка все так же происходит одной командой, все привычно и понятно
– Проект опенсорсный: туда можно просто прийти и залить свой скилл через GitHub (формат claude-skill)
– Есть модерация и базовые проверки безопасности
Из этого вполне может получиться что-то вроде стандартного слоя для агентных интеграций под рф-рынок. Если работаете с агентами – заходите попробовать или даже поучаствовать.
Проект -> neuraldeep.ru/
Гитхаб -> https://github.com/vakovalskii/neuraldeep
Следите за обновлениями в канале Валеры -> @neuraldeep
❤1
Слушайте, тут со странной вещью столкнулся, но поскольку с нейронками в этом варюсь, напишу здесь.
Делаю пет-проект по переноске законодательства в граф, на основе онтологии, которая описывается триплетами: субъект - предикат - объект. С дополнениями, условиями, списками и пр. Типа такого: Орган регулирования - устанавливает - тарифы {в соответствии с Основами ценообразования}. Ожидаю и надеюсь, что эта структара поможет нейронкам лучше и надежнее понимать законодательство.
В этой системе, упрощенно, предикат - это глагол. У нас есть ограниченно количество сущностей, составляющих субъекты и объекты, и предикатов - глаголов. На этом и строится направленный (это важно) граф. Субекты и объекты - это вершины (сущности), ребра - предикаты (глаголы).
И для сущностей, и для глаголов формируются реестры, описываются свойства, формируются синонимы, типы и пр.
Так вот, собственно, в чем сидит заноза - раньше я слушал лекции по квантовой механике, и там все время возникали частицы - переносчики взаимодействия. И это было очень сложно понять. А у меня здесь в графе глаголы - ребра графа - как переносчики взаимодействия выступают, и как частицы тоже, потому что их свойства не сильно от свойств вершин отличаются.
В итоге не могу понять, это реально разумная аналогия или у меня крыша от вайбкодинга уже двигается... Но вообще красиво, я с этой мыслью даже смирился как-то.
Делаю пет-проект по переноске законодательства в граф, на основе онтологии, которая описывается триплетами: субъект - предикат - объект. С дополнениями, условиями, списками и пр. Типа такого: Орган регулирования - устанавливает - тарифы {в соответствии с Основами ценообразования}. Ожидаю и надеюсь, что эта структара поможет нейронкам лучше и надежнее понимать законодательство.
В этой системе, упрощенно, предикат - это глагол. У нас есть ограниченно количество сущностей, составляющих субъекты и объекты, и предикатов - глаголов. На этом и строится направленный (это важно) граф. Субекты и объекты - это вершины (сущности), ребра - предикаты (глаголы).
И для сущностей, и для глаголов формируются реестры, описываются свойства, формируются синонимы, типы и пр.
Так вот, собственно, в чем сидит заноза - раньше я слушал лекции по квантовой механике, и там все время возникали частицы - переносчики взаимодействия. И это было очень сложно понять. А у меня здесь в графе глаголы - ребра графа - как переносчики взаимодействия выступают, и как частицы тоже, потому что их свойства не сильно от свойств вершин отличаются.
В итоге не могу понять, это реально разумная аналогия или у меня крыша от вайбкодинга уже двигается... Но вообще красиво, я с этой мыслью даже смирился как-то.
👍1
Новость не совсем об этом, но то, что робота научили потеть… двигаемся в сторону механических людей..
https://t.me/ai_machinelearning_big_data/9778
https://t.me/ai_machinelearning_big_data/9778
Telegram
Machinelearning
✔️ Xiaomi показала обновленную бионическую руку для робота CyberOne.
Рука уменьшена в размерах на 60% и теперь практически совпадает по габаритам с ладонью взрослого человека.
Это не вопрос эстетики: при обучении робота через телеуправление оператором…
Рука уменьшена в размерах на 60% и теперь практически совпадает по габаритам с ладонью взрослого человека.
Это не вопрос эстетики: при обучении робота через телеуправление оператором…
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Не хватало конечно такой фичи: Claude Code умеет пользоваться не файлами, а самим пк.
Открывать приложения, печатать, делать скриншоты. Всё через CLI, без переключения на десктоп.
То есть клод написал код, скомпилировал, запустил приложение, прокликал, нашёл баг, починил, проверил фикс.
Пока только на Мак, и нужен Pro или Max подписка✋
Включается через /mcp > computer-use.
Надеюсь, что в скором времени линукс и винду добавят.
[Документация]
@tips_ai #news
Открывать приложения, печатать, делать скриншоты. Всё через CLI, без переключения на десктоп.
То есть клод написал код, скомпилировал, запустил приложение, прокликал, нашёл баг, починил, проверил фикс.
Пока только на Мак, и нужен Pro или Max подписка
Включается через /mcp > computer-use.
Надеюсь, что в скором времени линукс и винду добавят.
[Документация]
@tips_ai #news
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1