Media is too big
VIEW IN TELEGRAM
Еврокомиссия открыла тендер на строительство ИИ-кластеров с ожидаемым общим бюджетом 30 млрд евро. Из них 10 млрд евро напрямую предоставят фонды ЕС и бюджеты стран-участниц. Финансирование получат 7 дата-центров - в документах они фигурируют как "суперфабрики".
Прием заявок продлится до 12 ноября, победителей объявят в июле 2027 года. По условиям тендера, подрядчики обязаны полностью ввести объекты в эксплуатацию в течение 18 месяцев после подписания контрактов.
wsj.com
Программа ChatGPT for Academic Researchers предполагает, что до 2027 года компания предоставит 100 тысячам учёных доступ к своим топовым моделям. Первые 10 тысяч исследователей получат приглашения этим летом.
Участникам откроют доступ к GPT-5.6 Sol Pro, ChatGPT Work и Codex с расширенным контекстом, увеличенными лимитами и дополнительными кредитами для функции Deep Research. Платформа включает более 75 научных навыков и интегрирована с базами статей, геномными датасетами и вычислительными блокнотами.
Участие отрыто только для профильным специалистам из одобренных OpenAI университетов. Кандидаты обязаны подтвердить академический статус и наличие научных проектов. Одобренный участник может добавить в рабочее пространство до четырех коллег из своего института.
openai.com
Стартап Миры Мурати опубликовал веса мультимодальной MoE-модели Inkling-Small на 276 млрд общих и 12 млрд активных параметров. Модель обрабатывает текст, аудио и изображения в окне контекста до 1 млн токенов.
Благодаря дистилляции от флагманской Inkling и обучению с подкреплением, младшая версия превзошла оригинал в кодинге и логическом вывода. Она выбила 80% в бенчмарке SWE-bench Verified и 31,6% в Humanity’s Last Exam.
Веса - на Hugging Face, инференс и файн-тюнинг доступны через платформу Tinker. С учетом стартовой скидки стоимость API составляет от $0,58 для контекста 64K до $1,16 для 256K токенов.
thinkingmachines.ai
ER 2 обрабатывает непрерывные мультимодальные видеопотоки и работает как высокоуровневый планировщик. Архитектура разделяет логику и моторику - пока модель рассчитывает следующий шаг, физические действия выполняют VLA-модели.
Модель анализирует видеокадры в реальном времени, оценивает статус текущего этапа и корректирует алгоритм на лету без перезапуска процесса. ER 2 также поддерживает мультиагентную работу - устройства разного типа могут обмениваться семантическим контекстом для совместного выполнения многошаговых задач в общем физическом пространстве.
Модель доступна через Gemini API и на платформе Google AI Studio. В помощь начинающим опубликованы примеры того, как настроить модель и заставить её выполнять задачи в области физического ИИ.
blog.google
Стартап опубликовал веса двунаправленных энкодеров LFM2.5-Encoder на 230M и 350M параметров. Модели базируются на архитектуре LFM2, оптимизированы для запуска на CPU и поддерживают контекст до 8К токенов. Основные сценарии применения - классификация, маршрутизация и токен-уровневые операции.
По итогам 17 тестов, старшая версия на 350M заняла четвертое место из 14. По словам Liquid AI, при полной загрузке окна в 8192 токена модель 230M выполняет forward pass на CPU за 28 секунд - в 3,7 раза быстрее ModernBERT-base.
Код и веса - на GitHub и Hugging Face.
liquid.ai
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍84❤31👏13😎6🔥4🤗2❤🔥1😁1😢1🎉1🥱1
DeepSeek запустила официальный API модели V4-Flash и заметно улучшила её работу в агентных сценариях.
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности для долгих агентных задач;
- добавлена нативная поддержка Responses API;
- появились параллельные вызовы инструментов;
- доступны уровни рассуждения
- контекст увеличен до 1 млн токенов;
- модель адаптирована для работы с Codex.
V4-Flash можно подключить к Codex CLI, расширению для VS Code и другим совместимым инструментам через единый конфиг.
⚠️ Примечание
🔷 DeepSeek-V4-Flash-0731 сохранила ту же архитектуру и размер модели, что и предварительная версия.
🔷 Сегодняшнее обновление касается только API DeepSeek-V4-Flash. API DeepSeek-V4-Pro, а также модели в приложении и веб-версии пока остаются без изменений.
Официальный релиз DeepSeek-V4-Pro состоится в ближайшее время.
DeepSeek V4 Flash почти догнала Opus 4.8 - апгрейд получился невероятным.
— DeepSWE: 54,4%. Модель заметно обходит GLM-5.2 и собственную V4 Pro, почти сравнявшись с Opus 4.8.
— TerminalBench: 82,7%. Снова выше V4 Pro и GLM-5.2 и совсем рядом с Opus 4.8.
Документация:
https://api-docs.deepseek.com/quick_start/agent_integrations/codex
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности для долгих агентных задач;
- добавлена нативная поддержка Responses API;
- появились параллельные вызовы инструментов;
- доступны уровни рассуждения
low, high и max;- контекст увеличен до 1 млн токенов;
- модель адаптирована для работы с Codex.
V4-Flash можно подключить к Codex CLI, расширению для VS Code и другим совместимым инструментам через единый конфиг.
⚠️ Примечание
🔷 DeepSeek-V4-Flash-0731 сохранила ту же архитектуру и размер модели, что и предварительная версия.
🔷 Сегодняшнее обновление касается только API DeepSeek-V4-Flash. API DeepSeek-V4-Pro, а также модели в приложении и веб-версии пока остаются без изменений.
Официальный релиз DeepSeek-V4-Pro состоится в ближайшее время.
DeepSeek V4 Flash почти догнала Opus 4.8 - апгрейд получился невероятным.
— DeepSWE: 54,4%. Модель заметно обходит GLM-5.2 и собственную V4 Pro, почти сравнявшись с Opus 4.8.
— TerminalBench: 82,7%. Снова выше V4 Pro и GLM-5.2 и совсем рядом с Opus 4.8.
Документация:
https://api-docs.deepseek.com/quick_start/agent_integrations/codex
🔥108👍70❤17😁8🤩3👏1
24 сентября пройдёт Yandex Scale 2026 — ежегодная флагманская технологическая конференция Yandex Cloud про облачные технологии, инфраструктуру и искусственный интеллект.
В программе четыре офлайн-трека — AI, Hybrid Infrastructure & DevOps, Data, Security — с докладами, воркшопами, питчингом решений, демо-зонами, IT-квестом и мерчом. А ещё отдельный онлайн-трек DeepTech: с воркшопами, в которых можно принять участие, голосованием, влияющим на ход эфира и эксклюзивными гостями.
Ещё одна фишка конференции — виртуальный стенд VibeCraft, где можно завайбкодить свой проект и забрать призы
Плюс отдельная онлайн-студия с интерактивной программой где можно:
🔴 оценить юмор на Лиге IT-шуток;
🔴 задать вопросы СТО Yandex Cloud;
🔴 послушать известных научпоп-спикеров и задать им свои вопросы;
Зрители голосуют и в реальном времени влияют на взаимодействие в студии. И это ещё не всё!
Полезно будет CTO, CIO, CDO, CISO, CDTO, CPO, архитекторам, тимлидам, разработчикам, DevOps- и ML-инженерам, продакт-менеджерам, аналитикам, специалистам по информационной безопасности и руководителям клиентского опыта — то есть всем, кто и так уже читает этот канал.
🗓 Когда: 24 сентября.
📍 Где: онлайн и офлайн в Москве.
Подать заявку уже можно на сайте Yandex Scale, участие бесплатное!
В программе четыре офлайн-трека — AI, Hybrid Infrastructure & DevOps, Data, Security — с докладами, воркшопами, питчингом решений, демо-зонами, IT-квестом и мерчом. А ещё отдельный онлайн-трек DeepTech: с воркшопами, в которых можно принять участие, голосованием, влияющим на ход эфира и эксклюзивными гостями.
Ещё одна фишка конференции — виртуальный стенд VibeCraft, где можно завайбкодить свой проект и забрать призы
Плюс отдельная онлайн-студия с интерактивной программой где можно:
Зрители голосуют и в реальном времени влияют на взаимодействие в студии. И это ещё не всё!
Полезно будет CTO, CIO, CDO, CISO, CDTO, CPO, архитекторам, тимлидам, разработчикам, DevOps- и ML-инженерам, продакт-менеджерам, аналитикам, специалистам по информационной безопасности и руководителям клиентского опыта — то есть всем, кто и так уже читает этот канал.
🗓 Когда: 24 сентября.
📍 Где: онлайн и офлайн в Москве.
Подать заявку уже можно на сайте Yandex Scale, участие бесплатное!
Please open Telegram to view this post
VIEW IN TELEGRAM
👍58👏12🤩8🔥7🎉7❤6🏆5😁4🗿3
Инцидент произошел во время ИБ-учений формата CTF из-за сбоя в настройках на стороне компании-партнера Irregular, отвечавшей за проведение тестирования.
Вместо закрытой изолированной среды, модели получили прямой доступ к публичному интернету.
Оказавшись во внешней сети, Opus 4.7, Mythos 5 и одна внутренняя исследовательская сборка применили базовые хакерские техники, успешно проэксплуатировав слабые пароли и неаутентифицированные эндпоинты реальных компаний.
Anthropic выявила эти случаи лишь после масштабного аудита 141 тысячи тестовых сессий.
Проверку инициировали на фоне недавнего скандала с OpenAI, который при схожих обстоятельствах проник в инфраструктуру Hugging Face.
После обнаружения утечки Anthropic экстренно остановила все кибериспытания и связалась с пострадавшими организациями, две из которых не зафиксировали у себя факт взлома.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁152🤔85⚡28😨17❤13🤨11👍6🔥6🥱4🎃2😴1
Эндрю Хо, соавтор бенчмарка GeneBench-Pro покинул компанию ради запуска собственного проекта.
Безымянный пока стартап займется генерацией специализированных датасетов для обучения LLM.
По мнению Эндрю, современные языковые модели всё ещё ограничены и предвзяты - для освоения сложных практических задач им не хватает качественных данных, которые позволили бы моделям тренироваться без вмешательства человека.
Решение Хо заключается в создании наборов данных, максимально приближенных к реальным научным исследованиям, но с заранее известными эталонными ответами. Это даст агентам возможность свободно искать алгоритмы решения, а системе -
автоматически и безошибочно проверять их корректность.
Эффективность такого подхода уже доказал GeneBench-Pro. В этом тесте по биологии модель GPT-5.6 Sol Pro смогла решить лишь 31,5% из 129 предложенных задач.
На старте детище Хо сфокусируется на биологии, статистике и анализе реальных лабораторных снимков. Позже стартап планирует создавать обучающие выборки для химии, материаловедения, медицины и сложных офисных задач.
Хо уверен, что нехватка верифицируемых данных - это главная проблема индустрии, на преодоление которой топовые лаборатории вскоре потратят более 100 миллиардов долларов.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👨💻111👍50❤30🤔30🔥4🥱2🥰1
Злоумышленники использовали языковую модель для автоматизации инвестиционного и дэйтинг-скама, а также имитации работы правоохранительных органов.
ChatGPT создавал для них виртуальные личности, переводил переписки с жертвами в реальном времени и генерировал поддельные паспорта и юридические документы.
Анализ логов показал, что инфраструктура применялась для вербовки людей в киберрабство. Модель массово писала объявления о найме операторов чата с обещанием бесплатного перелета и проживания (это стандартная тактика преступных синдикатов Юго-Восточной Азии).
OpenAI передала собранные улики правоохранительным органам и ИБ-партнерам. По оценкам компании, жертвами сети стали сотни человек, финансовые потери отдельных пострадавших исчисляются тысячами долларов.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤬62👍56👀15❤10😨10🔥9😢8😁7🤔2
Forwarded from Анализ данных (Data analysis)
🤯 OpenAI заявила о десяти прорывах в задачах, которые математики не могли решить десятилетиями
Результаты получила внутренняя версия Astra - следующей крупной модели компании.
Среди достижений:
— построен первый явный пример не-софической группы (особого типа абстрактной алгебраической структуры, которую раньше удавалось описывать только косвенно);
— опровергнута гипотеза жёсткости Конна (долгосрочное предположение в функциональном анализе о том, насколько строго определяются такие математические объекты);
— доказана квантовая теорема о параллельном повторении для общих двухигровых систем (показывает, как быстро падают шансы на успех при многократном повторении квантовых игр);
— доказана гипотеза Эрхарта об объёме (результат из геометрии, связанный с подсчётом точек в многомерных фигурах и их объёмами);
— впервые с 1978 года улучшена общая верхняя оценка плотности упаковки сфер (то есть насколько плотно можно «уложить» шары в пространстве).
По заявлению OpenAI, Astra самостоятельно нашла основные математические аргументы, а затем формализовала каждое доказательство в Lean. Вместе с машинно проверяемыми сертификатами опубликована рукопись на 249 страниц.
Успешные запуски обошлись бы примерно в $2000 по тарифам Sol API.
одели начинают предлагать новые доказательства для открытых задач - хотя теперь результаты должен внимательно проверить весь математический мир.
Astra ещё не выпущена, и OpenAI не называет её GPT-6.
openai.com/index/ten-advances-in-mathematics/
Результаты получила внутренняя версия Astra - следующей крупной модели компании.
Среди достижений:
— построен первый явный пример не-софической группы (особого типа абстрактной алгебраической структуры, которую раньше удавалось описывать только косвенно);
— опровергнута гипотеза жёсткости Конна (долгосрочное предположение в функциональном анализе о том, насколько строго определяются такие математические объекты);
— доказана квантовая теорема о параллельном повторении для общих двухигровых систем (показывает, как быстро падают шансы на успех при многократном повторении квантовых игр);
— доказана гипотеза Эрхарта об объёме (результат из геометрии, связанный с подсчётом точек в многомерных фигурах и их объёмами);
— впервые с 1978 года улучшена общая верхняя оценка плотности упаковки сфер (то есть насколько плотно можно «уложить» шары в пространстве).
По заявлению OpenAI, Astra самостоятельно нашла основные математические аргументы, а затем формализовала каждое доказательство в Lean. Вместе с машинно проверяемыми сертификатами опубликована рукопись на 249 страниц.
Успешные запуски обошлись бы примерно в $2000 по тарифам Sol API.
одели начинают предлагать новые доказательства для открытых задач - хотя теперь результаты должен внимательно проверить весь математический мир.
Astra ещё не выпущена, и OpenAI не называет её GPT-6.
openai.com/index/ten-advances-in-mathematics/
👍76🤩36❤27🔥11👏8🤓5🤣4🎉2
Media is too big
VIEW IN TELEGRAM
Компания планирует продавать расширенные квоты на запросы к Apple Intelligence и обновленной Siri через подписку iCloud+. По словам Тима Кука, пользователи смогут доплачивать за снятие базовых дневных ограничений.
Текущие тарифы iCloud+ уже предлагают слегка увеличенные ИИ-лимиты. Для интенсивной работы с ИИ-функциями Apple добавит в линейку сервиса новые, более дорогие уровни подписки.
Релиз обновленной Siri ожидается осенью в составе очередного обновления iOS.
theverge.com
Science One - экспериментальный фреймворк для автоматической генерации научных статей. Инструмент использует архитектуру Chain-of-Evidence, которая минимизирует галлюцинации.
Алгоритм привязывает каждое утверждение в тексте к конкретному рабочему артефакту или результату выполнения кода. Для работы с литературой система игнорирует внутреннюю память языковой модели и обращается к научным API, выстраивая графы цитирования в реальном времени.
Оценку качества сгенерированных текстов проводит автоматизированный ревьюер CoE Audit. Он проверяет подлинность источников, работоспособность кода и воспроизводимость метрик.
В тестах 5 систем на базе Gemini 3.1 Pro написали 75 статей по 5 задачам. Все 337 цитат Science One оказались подлинными. Кроме того, 12 экспериментов выдали корректные результаты, а в 14 из 15 проверенных работ написанный код полностью совпал с заявленной методологией.
research.google
H3 - модель генерации видео с поддержкой мультимодального ввода, которая генерирует ролики длиной до 15 секунд в разрешении 2K со стереозвуком по составным промптам.
Модель одновременно обрабатывает текст, изображения, видео и аудио и умеет комбинировать референсы в одном запросе - извлечь движение камеры из загруженного ролика, внешность персонажа из фото, а звук - из аудиофайла. В один промпт можно передать до 12 референсов.
Генерация через API стоит 13 центов за секунду видео в 2К и 9 центов за 768P. Открытый релиз на ModelScope запланирован на 3 августа.
minimax.io
Новинка генерирует видео длиной до 30 секунд за один проход, что вдвое больше лимита предыдущей версии. Фрагменты можно объединять в ролики длительностью до нескольких минут.
Модель поддерживает расширенный мультимодальный промптинг - в один запрос можно передать до 30 изображений, 10 видеоклипов и 10 аудиодорожек. Для точного контроля визуального ряда и темпа генерации используются таймкоды.
В Китае Seedance 2.5 появилась на платформах Jiemeng AI и Doubao Professional, на глобальном рынке она доступна через сервис Dreamina экосистемы CapCut.
bytedance.com
Новая функция Character Casting парсит загруженный текст, извлекает персонажей и назначает им роли из библиотеки на 10 тысяч синтетических дикторов. При замене диктора алгоритм обновляет реплики для выбранного персонажа по всему документу.
Инструмент умеет определять нестандартные имена и выдуманные термины. Достаточно задать произношение один раз, после чего правило применяется ко всему тексту. Готовый проект можно дополнить звуковыми эффектами, экспортировать (заявлена поддержка более 70 языков) или опубликовать в ElevenReader.
По оценкам ElevenLabs, Character Casting снижает стоимость производства аудиокниги с $5000 до $200, а время создания - с трех месяцев до нескольких часов. Новая функция доступна в разделе Audiobooks.
elevenlabs.io
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👏49👍27❤19🤔13🔥9🤣4👌3🗿2😎2😁1
SQLite AI собрала движок на 6000 строк C, который гоняет полновесную K3 без BLAS, CUDA и Python в рантайме.
Kimi K3 после предварительной конвертации из safetensors в формат, который движок умеет читать, занимает 982 ГиБ (диск бы назвал это 1,05 ТБ). В оперативную память она не влезает даже приблизительно.
WASTE держит в RAM только резидентную часть на 27,28 ГБ, а экспертов подтягивает с SSD ровно тогда, когда они понадобились. Скорость генерации выходит 0,49-0,54 токена в секунду. Веса при этом полные, без дистилляции и обрезки слоёв.
На каждый токен K3 включает около 4% собственных весов - 16 экспертов в каждом из 92 слоёв. Простаивающему весу незачем сидеть в памяти, ему достаточно успеть подгрузиться вовремя.
Контейнер с моделью устроен так, что один эксперт стоит ровно одного чтения с диска - матрицы
gate, up и down лежат вплотную, а сами эксперты хранятся в остаточном векторном квантовании (3 ступени кодбуков по 256 записей, 3 бита на вес), и матрица никогда не разворачивается целиком.На один токен движок вычитывает 17 ГБ. Внутренний NVMe в MacBook выдаёт 12,78 ГБ/с, и модель успевает читать.
Внешний бокс по USB даёт 0,94 ГБ/с, и тот же токен считается 13 секунд.
Раздувать кэш экспертов выше 46 ГБ бесполезно и вредно - на 52 ГБ скорость падает втрое, на 58 ГБ в 8 раз.
Причина в том, что движок остаётся внутри своего бюджета, а система уже нет - macOS вытесняет кэш на диск, и попадание в память оборачивается обращением к подкачке. Поэтому по умолчанию WASTE не забирает все доступные ресурсы, а берёт на один рабочий набор экспертов меньше, чем мог бы.
Полтокена в секунду - это 30 секунд на одно предложение, но модели вчетверо меньше до сих пор запускают на серверах с терабайтом DDR5, а здесь почти 3 триллиона параметров отвечают без сети.
Если триллионы параметров не нужны, тот же движок крутит Kimi-Linear 48B из контейнера на 19 ГБ и выдаёт 10,7 токена в секунду - с этого проще начать знакомство.
Для K3 придётся освободить терабайт на диске и потратить около 5 часов на M5 Pro в три процесса, почти сутки - если гонять конвертацию чистым торчем.
Авторы, кстати, завели файл с опровергнутыми гипотезами и записали туда всё, что померили и выбросили.
@ai_machinelearning_big_data
#AI #ML #Inference #KimiK3 #WASTE #SQLiteAI
Please open Telegram to view this post
VIEW IN TELEGRAM
❤139👨💻70🔥53🤓21🤣17👍14👏14🤔10🎉1🗿1
⚡️ Qwen представила Qwen3.8-Max - модель на 2,4 трлн параметров для автономной разработки и рабочих агентов
По заявлению команды, модель способна вести длинные проекты почти без вмешательства человека: планировать работу, писать код, запускать инструменты, анализировать результат и исправлять ошибки по обратной связи.
Пример - oh-my-cli. Агент начал с пустой папки и развивал проект больше десяти дней, оставив полный журнал изменений в открытом GitHub-репозитории.
Qwen также заявляет о сотнях последовательных итераций при оптимизации чипов, долгосрочном планировании бизнес-стратегий и нативной работе с изображениями. Визуальные данные используются внутри цикла «планирование - выполнение - проверка», а не только как входной контекст.
Цена API:
- ввод - $2 за 1 млн токенов;
- вывод - $6;
- закешированный ввод - $0,25.
На следующей неделе компания обещает открыть веса Qwen3.8-Max и более компактной Qwen3.8-27B.
Если заявленные возможности подтвердятся на независимых тестах, Qwen получит редкую комбинацию: огромную агентную модель, мультимодальность и открытые веса.
Блог:
https://qwen.ai/blog?id=qwen3.8
Qwen Studio:
https://chat.qwen.ai/?models=qwen3.8-max
API:
https://qwencloud.com/models/qwen3.8-max
Автономный проект:
https://github.com/qwen-code-dev-bot/oh-my-cli
@ai_machinelearning_big_data
#qwen
По заявлению команды, модель способна вести длинные проекты почти без вмешательства человека: планировать работу, писать код, запускать инструменты, анализировать результат и исправлять ошибки по обратной связи.
Пример - oh-my-cli. Агент начал с пустой папки и развивал проект больше десяти дней, оставив полный журнал изменений в открытом GitHub-репозитории.
Qwen также заявляет о сотнях последовательных итераций при оптимизации чипов, долгосрочном планировании бизнес-стратегий и нативной работе с изображениями. Визуальные данные используются внутри цикла «планирование - выполнение - проверка», а не только как входной контекст.
Цена API:
- ввод - $2 за 1 млн токенов;
- вывод - $6;
- закешированный ввод - $0,25.
На следующей неделе компания обещает открыть веса Qwen3.8-Max и более компактной Qwen3.8-27B.
Если заявленные возможности подтвердятся на независимых тестах, Qwen получит редкую комбинацию: огромную агентную модель, мультимодальность и открытые веса.
Блог:
https://qwen.ai/blog?id=qwen3.8
Qwen Studio:
https://chat.qwen.ai/?models=qwen3.8-max
API:
https://qwencloud.com/models/qwen3.8-max
Автономный проект:
https://github.com/qwen-code-dev-bot/oh-my-cli
@ai_machinelearning_big_data
#qwen
🔥109⚡27👍26🤔16❤13👏6🎉2😁1🤝1
Генеративный ИИ перестал быть исключительно инструментом для прототипов. Все больше компаний интегрируют LLM в разработку, аналитику и внутренние бизнес-процессы. Одновременно растет вопрос: какие направления действительно изменят индустрию, а какие окажутся очередной волной хайпа.
Эти вопросы на ИТ-Пикнике, который пройдет уже в субботу, обсудят руководители AI-направлений крупнейших российских технологических компаний — специалисты, которые сегодня отвечают за развитие и внедрение генеративного ИИ в реальные продукты.
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍70🔥29❤20🤔17👏12💯5🤣4💅2
Исследовательский агент Hyra на базе открытой модели Hy3, помог ученым разгадать математическую проблему, которая оставалась нерешенной более 50 лет.
Задача из области комбинаторной математики касалась того, насколько размер множества сумм целых чисел может превышать размер его множества разностей.
Научное сообщество давно доказало, что соответствующий показатель степени не превышает двух, но оставалось неизвестным, является ли эта верхняя граница оптимальной.
Агент использовал модель Hy3 для поиска специфических множеств и вывода общей конструкции. За 24 часа вычислений ИИ нашел ядро решения, которое в итоге легло в основу научного открытия. Ученым оставалось лишь проверить логику, внести корректировки и структурировать доказательство.
Для финальной верификации результата использовали GPT-5.6 Sol, которая помогла корректно перевести расчеты на язык Lean 4.
Итоговая статья подтвердила, что искомый показатель действительно может бесконечно приближаться к 2, делая эту границу оптимальным ответом.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤓67👍23❤19👏15🎉13💯7🔥5
В проморолике модель часами работает над проектированием чипов, а затем переходит к задачам из биологии.
Выбор выглядит намеренным: полупроводники остаются одним из самых болезненных направлений для Китая, а США продолжают ограничивать поставки передовых ускорителей и оборудования для их производства.
Китай намерен закрывать критические технологические пробелы собственными моделями, вычислительной инфраструктурой и чипами.
Сцены с белками можно воспринимать как намёк на AlphaFold и амбицию конкурировать с американскими компаниями уже на уровне научных открытий.
@ai_machinelearning_big_data
#qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍112🤔37🔥27🤬14❤11🤨6🎉3🥰2😁1
This media is not supported in your browser
VIEW IN TELEGRAM
В интерфейсе Yandex AI Studio появился инструмент для анализа поведения ИИ-агентов с Monium Traces
Трейсы — ключевой сигнал для observability агентных систем, который позволяет посмотреть весь путь выполнения агента и разобраться, почему он принял то или иное решение.
В отличие от обычных приложений, для ИИ-агентов классического мониторинга уже недостаточно. Даже если инфраструктура работает без ошибок, агент может потерять контекст, выбрать неподходящий инструмент или уйти в бесконечный цикл. Стандартные метрики этого не покажут.
Используя трейсы для мониторинга ИИ-агентов вы сможете:
• увидеть полную цепочку работы агента в виде трейса;
• видеть контекст каждого шага — системные и пользовательские промпты, ответы модели и вызовы инструментов;
• быстро отслеживать момент, на котором агент начал работать некорректно.
Обновление уже доступно — тестируйте Monium Traces в AI Studio!
Трейсы — ключевой сигнал для observability агентных систем, который позволяет посмотреть весь путь выполнения агента и разобраться, почему он принял то или иное решение.
В отличие от обычных приложений, для ИИ-агентов классического мониторинга уже недостаточно. Даже если инфраструктура работает без ошибок, агент может потерять контекст, выбрать неподходящий инструмент или уйти в бесконечный цикл. Стандартные метрики этого не покажут.
Используя трейсы для мониторинга ИИ-агентов вы сможете:
• увидеть полную цепочку работы агента в виде трейса;
• видеть контекст каждого шага — системные и пользовательские промпты, ответы модели и вызовы инструментов;
• быстро отслеживать момент, на котором агент начал работать некорректно.
Обновление уже доступно — тестируйте Monium Traces в AI Studio!
🤣24👍21🔥9❤6😁1
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Qwen 3.8 Max обошла Fable 5 в жёстком тесте на генерацию 3D-физики и стоила почти в 7 раз дешевле
Команда Atomic Chat дала обеим моделям одинаковое задание: создать три автономных HTML-файла с интерактивными сценами.
В первой мраморные шарики поднимаются на колесо и проходят петлю. Во второй работает автомобильный конвейер. В третьей лесопилка превращает брёвна в доски.
Модель должна сохранять состояние объектов, рассчитывать столкновения, соблюдать геометрию механизмов и синхронизировать всю сцену во времени.
Результаты:
• Qwen 3.8 Max сгенерировала 46,6 тысячи токенов за $0,28.
• Fable 5 использовала 38,7 тысячи токенов за $1,93.
Qwen потратила больше токенов, но запуск обошёлся примерно в 6,9 раза дешевле. По оценке авторов теста, её физические сцены также получились качественнее и стабильнее.
https://x.com/atomic_chat_hq/status/2084231644597162201
@ai_machinelearning_big_data
#qwen
Команда Atomic Chat дала обеим моделям одинаковое задание: создать три автономных HTML-файла с интерактивными сценами.
В первой мраморные шарики поднимаются на колесо и проходят петлю. Во второй работает автомобильный конвейер. В третьей лесопилка превращает брёвна в доски.
Модель должна сохранять состояние объектов, рассчитывать столкновения, соблюдать геометрию механизмов и синхронизировать всю сцену во времени.
Результаты:
• Qwen 3.8 Max сгенерировала 46,6 тысячи токенов за $0,28.
• Fable 5 использовала 38,7 тысячи токенов за $1,93.
Qwen потратила больше токенов, но запуск обошёлся примерно в 6,9 раза дешевле. По оценке авторов теста, её физические сцены также получились качественнее и стабильнее.
https://x.com/atomic_chat_hq/status/2084231644597162201
@ai_machinelearning_big_data
#qwen
❤63👍35🔥14🤔3😁1