Forwarded from Институт AIRI
Учёные Института AIRI создали открытую платформу VLA Arena, чтобы исследователи, инженеры и даже любители могли сравнивать и оценивать современные модели управления роботами ⤵️
VLA Arena поддерживает компактные манипуляторы, доступные для самостоятельной сборки или в готовом виде, которые используются в образовательных и исследовательских целях.
На платформе можно:
⚫️ Тестировать модели в симуляции и на реальных роботах
⚫️ Следить за объективной таблицей лидеров с оценками пользователей
⚫️ Поддерживать модели с открытым исходным кодом, включая адаптированные для русского языка версии
⚫️ Найти датасеты и инструменты для обучения собственных моделей
Первый запуск платформы продлится три месяца.
📎 VLA Arena доступна по ссылке.
VLA Arena поддерживает компактные манипуляторы, доступные для самостоятельной сборки или в готовом виде, которые используются в образовательных и исследовательских целях.
На платформе можно:
Первый запуск платформы продлится три месяца.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
Heretic — автоматическое снятие цензуры с LLM
В прошлом году несколько исследователей решило разобраться как именно работает механизм отказов в языковых моделях, когда они блокируют "вредные" запросы. Оказалось что за отказ LLM выполнять запрос отвечает одно единственное направление в пространстве активаций. А вот сейчас на основе этого ресёрча сделали софт для автоматического снятия цензуры.
Heretic вычисляет "направления отказа" как разницу средних активаций между вредными и безвредными промптами, затем ортогонализирует веса аттеншна и MLP проекций для удаления этого направления. Оптимизатор автоматически подбирает параметры подавления, минимизируя одновременно количество отказов и KL-divergence от оригинальной модели.
Работает полностью автоматически — просто запускаешь на любой поддерживаемой модели и через 45 минут получаешь версию без цензуры. Поддерживает большинство популярных архитектур включая Llama, Qwen, Gemma и даже некоторые мультимодальные модели. Той же gpt-oss снятие цензуры точно не помешает.
https://github.com/p-e-w/heretic
@ai_newz
В прошлом году несколько исследователей решило разобраться как именно работает механизм отказов в языковых моделях, когда они блокируют "вредные" запросы. Оказалось что за отказ LLM выполнять запрос отвечает одно единственное направление в пространстве активаций. А вот сейчас на основе этого ресёрча сделали софт для автоматического снятия цензуры.
Heretic вычисляет "направления отказа" как разницу средних активаций между вредными и безвредными промптами, затем ортогонализирует веса аттеншна и MLP проекций для удаления этого направления. Оптимизатор автоматически подбирает параметры подавления, минимизируя одновременно количество отказов и KL-divergence от оригинальной модели.
Работает полностью автоматически — просто запускаешь на любой поддерживаемой модели и через 45 минут получаешь версию без цензуры. Поддерживает большинство популярных архитектур включая Llama, Qwen, Gemma и даже некоторые мультимодальные модели. Той же gpt-oss снятие цензуры точно не помешает.
https://github.com/p-e-w/heretic
@ai_newz
Все ждут выхода Gemini 3 буквально сегодня. На крайняк - до конца недели..
Тестирую Gemini 3 )) пока тяжело сказать, чем отличается от 2.5, буду судить по ошибкам..
Пытаюсь поставить также Gemini Antigravity - IDE от Google, пока с этим что-то сбоит
Пытаюсь поставить также Gemini Antigravity - IDE от Google, пока с этим что-то сбоит
Не Gemini 3 единым. Сейчас работаю с несколькими модельками, которые помещаются на компе - для OCR. Если все получится, расскажу подробнее.
Поэтому появление новых маленьких умных моделек, как минимум, интересно. Хотя таким бенчам все-таки тяжело.
Подробнее, что крутого в этой модельке, здесь
Поэтому появление новых маленьких умных моделек, как минимум, интересно. Хотя таким бенчам все-таки тяжело.
Подробнее, что крутого в этой модельке, здесь
huggingface.co
rl-research/DR-Tulu-8B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
По ссылке в сообщении ниже - полезная информация от разработчиков Gemini. Вообще, у Google какая безумная куча всевозможных фишек, настроек, плавунов и пр. - разобраться в этом чрезвычайно тяжело. Тяжело и получить базовые простые апи, токены и пр. (хотя стало легче, чем раньше). Но зато у компании самый широкий спектр моделей, в целом омнимодальность - не удивлен, что Баффет вложился именно в Гугл.
Из того, на что стоит обратить внимание - можно пользоваться последними моделями бесплатно, с очень щедрыми лимитами, но Гугл будет использовать ваши данные. Имейте это ввиду. Антропия и чат ОпенЭйАй тоже пытаются сделать что-то такое, но только у них бесплатного кот наплакал. А Гугл может себе это позволить, понимая, что самое ценное сейчас - данные. Если хочется прайваси, видимо тоже надо заплатить за платную подписку
https://t.me/machinelearning_interview/2335
Из того, на что стоит обратить внимание - можно пользоваться последними моделями бесплатно, с очень щедрыми лимитами, но Гугл будет использовать ваши данные. Имейте это ввиду. Антропия и чат ОпенЭйАй тоже пытаются сделать что-то такое, но только у них бесплатного кот наплакал. А Гугл может себе это позволить, понимая, что самое ценное сейчас - данные. Если хочется прайваси, видимо тоже надо заплатить за платную подписку
https://t.me/machinelearning_interview/2335
Telegram
Machine learning Interview
⚡️ Вышел подробный гайд по Gemini 3 - новой флагманской модели Google DeepMind, которая в ряде задач уже опережает другие топовые решения.
Внутри разбор возможностей модели, примеры создания реальных приложений, рекомендации по настройке промтов и системных…
Внутри разбор возможностей модели, примеры создания реальных приложений, рекомендации по настройке промтов и системных…
Очень интересная модель SAM-3 от Meta, которая выделяет что-то на картинке и следит за этим на видео. Пригодится нам для анализа видео с птицами на полигонах ))
И да, опен-сорс!
И да, опен-сорс!
Meta AI
SAM 3.1: Faster and More Accessible Real-Time Video Detection and Tracking With Multiplexing and Global Reasoning
А в то же время лидером по скачиванию на Hugging Face становится VibeThinker-1.5B, крошечная модель, которая размышляет на уровне got-oss-20B. Можно ставить буквально на любом компе
huggingface.co
Qwen/Qwen2.5-1.5B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Data Secrets
Видимо, они хотят хотя бы немного перебить хайп вокруг Gemini. Вот что в релизе действительно интересного:
Также для Windows появился Agent mode, с помощью которого агент может работать в терминале автономно (доступы можно настраивать).
«Претрейн и test-time не уперлись в стену» – написал Ноам Браун про релиз. Это он намекает, что масштабирование продолжается.
При этом благодаря новой фишке – «компакции» – Codex теперь может работать с огромными контекстами. Это как бы аналог краткосрочной и долгосрочной памяти. Когда лимит токенов контекстного окна близок, модель сжимает самую старую информацию, а затем вместе с этой выжимкой + последней актуальной информацией переходит в новое контекстное окно. Процесс может повторяться много раз.
Уже доступно в IDE и Codex CLI, в API завезут «soon»
openai.com/index/gpt-5-1-codex-max/
Please open Telegram to view this post
VIEW IN TELEGRAM
Говорят, Сбер раскатал GigaChat3 на базе DeepSeek, плюс выкатил еще кучу моделей
https://t.me/lovedeathtransformers/10018
https://t.me/lovedeathtransformers/10018
Telegram
Love. Death. Transformers.
Сбер выпустил новую линейку генеративных моделей Kandinsky 5.0 в open source — с кодом, весами и под лицензией MIT
Линейку представили на международной конференции Сбера - AI Journey. В нее вошли нейросети:
– Video Pro - превосходит Wan2.2-A14B и работает…
Линейку представили на международной конференции Сбера - AI Journey. В нее вошли нейросети:
– Video Pro - превосходит Wan2.2-A14B и работает…
Forwarded from Анализ данных (Data analysis)
Media is too big
VIEW IN TELEGRAM
Построенная на архитектуре DiT, модель поднимает планку по качеству и доступности.
Что важно:
⚡️ Всего 8.3B параметров - модель можно запускать даже на потребительских GPU с 14GB VRAM
🖥️ Качество: генерирует 5–10 секунд видео в 480p/720p, а через суперразрешение —ё- до 1080p с киношной детализацией
SOTA-качество с очень низкими требованиями к железу.
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Вообще, на этой неделе Сбер и AIRI прекрасно выступили, запустив кучу русскоязычных опенсорсных моделей. Обязательно буду их пробовать
Replit дает бесплатный доступ к своим агентам на ограниченное время
replit
AI App and Website Builder
Describe what you want. Replit builds it. Get a working app or website in minutes. No coding required.
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
О, вышел Cursor 2.1
– Добавили функцию «Find Issues»: поиск и исправление багов по одной кнопке. Агент делает ревью кода и тут же показывает найденные проблемы в боковой панели. В течение этой недели фичу можно тестить бесплатно.
– Напоминаем, что в Cursor недавно обновили поиск, и теперь он работает на базе векторов (как именно, мы писали тут). Так что для любителей пользоваться старым добрым grep его вынесли отдельно. Работает почти мгновенно и ищет по всей кодовой базе, включая точные совпадения и регулярки.
– Улучшили режим планирования. Теперь агент будет задавать уточняющие вопросы, когда вы утверждаете план действий, и отвечать на них можно прямо в новом интерактивном режиме (выглядит прикольно, пример на видео).
Раскрывают постепенно на всех пользователей (ченчлог)
– Добавили функцию «Find Issues»: поиск и исправление багов по одной кнопке. Агент делает ревью кода и тут же показывает найденные проблемы в боковой панели. В течение этой недели фичу можно тестить бесплатно.
– Напоминаем, что в Cursor недавно обновили поиск, и теперь он работает на базе векторов (как именно, мы писали тут). Так что для любителей пользоваться старым добрым grep его вынесли отдельно. Работает почти мгновенно и ищет по всей кодовой базе, включая точные совпадения и регулярки.
– Улучшили режим планирования. Теперь агент будет задавать уточняющие вопросы, когда вы утверждаете план действий, и отвечать на них можно прямо в новом интерактивном режиме (выглядит прикольно, пример на видео).
Раскрывают постепенно на всех пользователей (ченчлог)
Forwarded from Denis Sexy IT 🤖
Я тут понял, что второй после ChatGPT AI-продукт который я использую, это Google AI Studio: https://aistudio.google.com/
Я уже нахваливал его пару раз в канале, но в этот раз хотел отдельно рассказать про их кодинг агента который живет под неприметным "Build": https://aistudio.google.com/app/apps
Это что-то вроде бесплатного Lovable, эта фигня не просто соберет вам красивую веб страницу, но она умеет в GenAI пайплайны, в том числе к генерации картинок – вот строительные блоки к которым имеет доступ агент:
Самое клевое, что вы не просто можете один раз вызвать LLM (как в обычном режиме Playground), вы можете заставить ее отвечать в Structured Output (на картинке детали параметров), поменять температуру, и другие настройки семплинга - и даже сделать пайплайн, где ответ от одной модели попадает на вход в другую модель
Если у вас в голове есть идея "А что если отряд LLM-агентов работал бы над какой-то задачей" и все кодинг фреймворки кажутся душными чтобы быстро проверить, вам сюда
Единственное ограничено, которое вы встретите в какой-то момент – это лимит бесплатных запросов в N времени; для того чтобы это снять, можно подключить свой API ключ через кнопку🔑 и сможете вайбкодить сложные пайплайны которые делают 1000 запросов в минуту к какой-то Gemini Flash 2.5, что за глаза хватает для почти всех идей и стоит копейки (точно также я подключил Nano Banana Pro, потому что она без API ключа в AI Studio не работает)
Короче, Gemini апп мне не нравится, а вот AI Studio реально для АИ инженеров делают, шикарный продукт
P.S. Есть забавный баг, в какой-то момент их агент начинает забывает редактировать код – а пишет будто редактирует, нужно на него накричать капсом и все заведется💡
Я уже нахваливал его пару раз в канале, но в этот раз хотел отдельно рассказать про их кодинг агента который живет под неприметным "Build": https://aistudio.google.com/app/apps
Это что-то вроде бесплатного Lovable, эта фигня не просто соберет вам красивую веб страницу, но она умеет в GenAI пайплайны, в том числе к генерации картинок – вот строительные блоки к которым имеет доступ агент:
🔍 Google Search🌐 Google Maps🟦 Function Declarations (Вы можете сделать свой тул для модели который будет вызываться аппом когда он считает нужным)✍️ Текст и общие задачи:
gemini-2.5-flash
gemini-3-pro-preview
gemini-flash-lite-latest🍎 Изображения:
gemini-2.5-flash-image
gemini-3-pro-image-preview (новая нана банана)
imagen-4.0-generate-001🎬 Видео:
veo-3.1-fast-generate-preview
veo-3.1-generate-preview🔊 Аудио и речь:
gemini-2.5-flash-native-audio-preview-09-2025
gemini-2.5-flash-preview-tts
Самое клевое, что вы не просто можете один раз вызвать LLM (как в обычном режиме Playground), вы можете заставить ее отвечать в Structured Output (на картинке детали параметров), поменять температуру, и другие настройки семплинга - и даже сделать пайплайн, где ответ от одной модели попадает на вход в другую модель
Если у вас в голове есть идея "А что если отряд LLM-агентов работал бы над какой-то задачей" и все кодинг фреймворки кажутся душными чтобы быстро проверить, вам сюда
Единственное ограничено, которое вы встретите в какой-то момент – это лимит бесплатных запросов в N времени; для того чтобы это снять, можно подключить свой API ключ через кнопку
Короче, Gemini апп мне не нравится, а вот AI Studio реально для АИ инженеров делают, шикарный продукт
P.S. Есть забавный баг, в какой-то момент их агент начинает забывает редактировать код – а пишет будто редактирует, нужно на него накричать капсом и все заведется
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Forwarded from Machinelearning
Андрей Карпаты
Его идея в том, что вместо того, чтобы задавать вопрос одной LLM, вы можете объединить их в «Совет моделей».
LLM Council - это простое локальное веб-приложение, с интерфейсом как у ChatGPT, но с той разницей, что запрос отправляется через Openrouter нескольким LLM. Полученные ответы перекрестно оцениваются и ранжируются, и, наконец, «модель-председатель совета» формирует окончательный ответ.
Более подробно процесс выглядит так:
Запрос отправляется всем моделям по отдельности, и их ответы собираются. Ответы каждой модели отображаются в отдельной вкладке, чтобы можно было их посмотреть вручную.
Каждая модель получает ответы других моделей. При этом идентификаторы анонимизированы, чтобы исключить «игру в любимчиков» при оценке чужих результатов. На этом этапе ответы ранжируются их по точности и глубине анализа.
Модель-председатель принимает все ответы моделей и компилирует их в единый окончательный ответ.
⚠️ Для использования нужен API-ключ OpenRouter.
@ai_machinelearning_big_data
#AI #ML #LLMCouncil #Github
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Forwarded from Сиолошная
https://www.anthropic.com/news/claude-opus-4-5
Claude Opus 4.5 таки смог взять 80% на SWE-bench Verified!
Бонусом в модель добавили effort control — прямо как у OpenAI: high, medium, low, дольше думает = лучше решает.
На бенчмарках... ВНЕЗАПНО ждём, потому что цена упала до $5/$25 за миллион токенов (в 3 раза).
Claude Opus 4.5 таки смог взять 80% на SWE-bench Verified!
Бонусом в модель добавили effort control — прямо как у OpenAI: high, medium, low, дольше думает = лучше решает.
На бенчмарках... ВНЕЗАПНО ждём, потому что цена упала до $5/$25 за миллион токенов (в 3 раза).
Очередная маленькая умная моделька - надо будет попробовать ее в OCR задачках.
Особенно интересно, что сделана она на основе Qwen-2.5 VL 7B, которую я использую..
Особенно интересно, что сделана она на основе Qwen-2.5 VL 7B, которую я использую..
evolvinglmms-lab.github.io
OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe.