This media is not supported in your browser
VIEW IN TELEGRAM
Он использовал модель Opus 5, чтобы превратить абзац из книги "Властелин колец" в 5500 строк кода браузерной графической библиотеки Three.js.
Генерация сцены заняла около 2-х часов, потребовала миллион токенов и обошлась примерно в 10 долларов. Звук был сгенерирован через ElevenLabs.
По мнению Карпати, привычные тесты на пространственное мышление вроде рисования пеликана на велосипеде в SVG окончательно устарели. Современные мультимодальные модели справляются с ними без труда.
Генерация целых интерактивных миров с помощью кода, по мнению Андрея, может стать новым стандартом оценки возможностей ИИ.
Пока главным препятствием для идеального результата остается отсутствие у модели возможности анализировать собственный видеовыход - сейчас она вынуждена опираться на скриншоты, из-за чего в рендере возникают ошибки.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣62👍36❤🔥19❤9🔥7🌭3🥰2🤨1💋1💅1
До закрытия подачи документов в магистратуру ФКН НИУ ВШЭхМТС осталось 4 дня!
Исследования и предпринимательство в ИИ — магистерская программа для будущих исследователей и разработчиков AI-решений.
В программе: классический ML, AI-агенты и LLM, генеративные нейросети, компьютерное зрение, NLP, обучение с подкреплением и многое другое
Самое важное о программе:
➡️ 30 студентов учатся бесплатно — МТС финансирует обучение
➡️ Преподаватели — действующие эксперты MWS, MWS AI и НИУ ВШЭ, практика на реальной инфраструктуре компании
➡️ Занятия вечером и в субботу — удобно совмещать с работой
➡️ Возможность получить оффер в МТС во время или после обучения
➡️ Соревнование на Kaggle: возможность получить доп. баллы в конкурс портфолио
➡️ Новости о программе в канале магистратуры
Подробная информация о программе и документах на сайте! Ждем тебя!
Исследования и предпринимательство в ИИ — магистерская программа для будущих исследователей и разработчиков AI-решений.
В программе: классический ML, AI-агенты и LLM, генеративные нейросети, компьютерное зрение, NLP, обучение с подкреплением и многое другое
Самое важное о программе:
➡️ 30 студентов учатся бесплатно — МТС финансирует обучение
➡️ Преподаватели — действующие эксперты MWS, MWS AI и НИУ ВШЭ, практика на реальной инфраструктуре компании
➡️ Занятия вечером и в субботу — удобно совмещать с работой
➡️ Возможность получить оффер в МТС во время или после обучения
➡️ Соревнование на Kaggle: возможность получить доп. баллы в конкурс портфолио
➡️ Новости о программе в канале магистратуры
Подробная информация о программе и документах на сайте! Ждем тебя!
👍12😁6❤5🔥5🤣4🌭3
Media is too big
VIEW IN TELEGRAM
Власти США отчитались о создании добровольного регламента тестирования новых моделей. Документ дает правительству и доверенным партнерам 30-дневный доступ к системам до их публичного релиза.
Содержание регламента, сроки внедрения и список допущенных к аудиту лиц не опубликованы. Эксперты рассчитывали, что администрация представит прозрачную структуру взаимодействия разработчиков с государством, включая требования к кибербезопасности, защите интеллектуальной собственности и конфиденциальности на время проверок.
По данным источников, на ближайшей закрытой встрече Белый дом обсудит новые стандарты с представителями ИИ-компаний.
axios.com
Компания ограничила прием баг-репортов из-за спама, сгенерированного языковыми моделями. С июня компания лимитировала количество одновременных отчетов и ввела месячную паузу для ИБ-исследователей.
Ограничения затронули легитимных специалистов. Итальянский стартап Bynario заявил, что за 3 недели нашел более 50 уязвимостей в macOS с помощью ChatGPT, включая цепочку повышения привилегий до полного контроля над устройством. Из-за ограничений команда не смогла передать все данные.
Сама Apple активно использует LLM для аудита безопасности. В последних патчах компания закрыла в 5 раз больше уязвимостей по сравнению с предыдущими релизами.
ft.com
Компания отказалась от планов по выпуску отдельного клиента для iOS и Android, несмотря на 800 тысяч предварительных регистраций. В Google пришли к выводу, что заставлять аудиторию скачивать еще одно приложение нецелесообразно.
Вместо этого кодинг-инструменты Studio интегрируют в базовую версию Gemini. Пользователи смогут описать нужный функционал в формате обычного диалога, после чего чат-бот самостоятельно напишет приложение. Ожидается, что эта опция станет доступна как на мобильных устройствах, так и на десктопах, хотя точные сроки запуска пока не раскрываются.
Веб-версия Google AI Studio продолжит работу и развитие.
Google AI Studio в сети Х
CEO компании Сатья Наделла подтвердил разработку универсального приложения, релиз которого запланирован в этом году. Новая платформа соберет под одной крышей диалоговые интерфейсы, кодинг-ассистентов и автономных агентов. Ожидается, что решение покроет задачи как обычных пользователей, так и корпоративного сектора.
По словам Наделлы, концепция Copilot стремительно эволюционирует из обычного чат-бота в цифрового коллегу и уже близка к формату полноценного автопилота. Интеграция всех этих сценариев в единый продукт должна начаться уже в текущем квартале.
Этот анонс официально подтверждает недавний инсайд, в котором сообщалось, что Microsoft готовит масштабный хаб, связывающий базовый чат-бот, GitHub Copilot, Copilot Cowork и Autopilot.
theverge.com
Модель под названием Namazu на базе Kimi K2.6 дообучена на закрытых данных под локальные бизнес-задачи с фокусом на японский контекст. В бенчмарке FairPoliticsQA файнтюн поднял результат с 34,10% (Kimi) до 56,30% (Namazu) при сохранении показателей родительской модели в логике и кодинге.
Стоимость токенов составляет $0,95 за 1 млн на входе и $4 на выходе. Внешние инструменты тарифицируются отдельно: вызов веб-поиска обойдется в $7 за 1000 обращений, среда выполнения кода - в $0,12 за час. API Namazu полностью совместим со стандартом OpenAI.
Из-за необходимости соблюдать GDPR модель недоступна в ЕС, Великобритании и Швейцарии.
sakana.ai
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍42🔥37🤔14❤12👏8😁3⚡2🎅1🎄1🦄1
В мире существуют лишь единицы систем, способных синтезировать физически точные данные для ИИ. Сбер выложил под открытой лицензией MIT семейство моделей Kandinsky WM 1.0, сделав технологию бесплатно доступной для всех разработчиков.
Системы генерируют физически достоверные видео и решают ключевую проблему — невозможность безопасно и дёшево снять вживую редкие или опасные сценарии вроде ДТП, экстремальной погоды или отказов оборудования.
Что внутри:
• Обучение на реальности: Kandinsky 5.0 Video Lite дообучили на нескольких миллионах видеозаписей реальных дорожных процессов и заводских линий;
• Контроль физики: Специальные алгоритмы через RL оценивают сохранение геометрии и естественность кинематики, избавляя ролики от деформации объектов;
• Модульные сценарии: Генерация 5-секундных блоков видео, из которых складывается обучение автономных систем и систем компьютерного зрения.
Модели становятся фундаментом для создания «моделей мира» — систем, способных предсказывать развитие событий в реальности. Решение уже применяют Центр робототехники Сбера и институт AIRI в своём дорожном симуляторе, а полный технический разбор опубликован в статье на Habr.
@ai_machinelearning_big_data
#ai #opensource #sber
Please open Telegram to view this post
VIEW IN TELEGRAM
👍61🔥39❤37🤣18🗿6😁3🤬3
Как и было обещано на релизе в пятницу, китайская компания опубликовала модель H3, которая делает короткие ролики со звуком по текстовому описанию, картинкам, видео и аудио на входе.
Модель на 33 миллиарда параметров генерирует клипы длиной от 4 до 15 секунд, 24 кадра в секунду, со стереозвуком 32 килогерца, в пропорциях от широких 21:9 до вертикальных 9:16. Реплики персонажей поддерживаются на 11 языках, включая русский.
Полный конвейер H3 состоит из трёх частей:
Но открыли не всю систему - только модуль, который отвечает непосредственно за генерацию. Закрытыми остались H3-Context-IR и H3-Regenerate-2K.
H3-Base-FL2VA работает с первым и последним кадром. Без картинок на входе это генерация по тексту, с одной или двумя - достройка ролика от заданного кадра или между двумя кадрами.
H3-Base-Ref2VA принимает смешанный ввод - до 9 изображений, до 3 видео и до 3 аудиодорожек, но суммарно не больше 12 файлов. Звук без картинки или видео система не примет.
По рейтингу Artificial Analysis, H3 занимает 1 место в редактировании видео, второе в генерации видео по тексту и третье - по изображению.
СomfyUI подготовили детальную инструкцию по использованию в своей среде и опубликовали базовые воркфлоу для генерации по тексту и референсу.
Помимо СomfyUI есть кукбуки под SGLang, vLLM и diffusers, а так же промпт-гайды под базу и фулл-реф мод.
Лицензия разрешает дообучать модель на своих видео, персонажах или визуальном стиле.Официального кода для трейна пока нет.
⚠️ Коммерческое использование допускается только для компаний с выручкой ниже 20 миллионов долларов.
@ai_machinelearning_big_data
#AI #ML #Video #H3 #Minimax
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍70🔥33❤14👏12🤩8💯5
547 участников, 17 выступлений и мастер-классов, три зала и целый день Data Science: от RecSys и антифрода до NLP, LLM и агентных систем.
Главная фишка — максимум практики и общения. Топовые спикеры из российского бигтеха и международных компаний делились не только подходами, но и реальными историями из разработки.
А после технической части гости продолжили общение на нетворкинге, играли в ИИ-шахматы, настольный теннис и баскетбол. А завершился день афтепати во дворе московского лофта.
Получился отличный день про ML — с сильными кейсами, живым общением и людьми, которые двигают индустрию вперед
@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥59👏22🎉13👌12👍11❤4😁3🥱1
LFM2.5-2.6B - компактная агентная модель на 2,6 млрд параметров. Она умеет планировать действия, вызывать инструменты и выполнять многошаговые задачи полностью на устройстве, без облачного API.
Модель обучили примерно на 34 трлн токенов, расширили словарь до 128 тысяч токенов и добавили контекст 128K.
Особенно интересно устроено дообучение:
- отдельные модели-эксперты усиливали математику, код, tool use и длинный контекст;
- затем их навыки перенесли в одну модель через on-policy distillation;
- финальный этап прошёл внутри реальных агентных сред, включая Hermes Agent и OpenClaw.
По тестам Liquid AI, модель выдаёт:
- до 220 токенов/с на Apple M5 Max;
- до 113 токенов/с на Ryzen AI Max+ 395;
- около 30 токенов/с на смартфоне;
- почти 15 000 выходных токенов/с на одной H100 при высокой параллельной нагрузке.
При этом потребление памяти на CPU остаётся ниже 2,5 ГБ.
В бенчмарках LFM2.5-2.6B обходит более крупные Gemma и Qwen в ряде задач на следование инструкциям и использование инструментов. В сложном программировании большие модели пока сохраняют преимущество.
Есть поддержка
llama.cpp, MLX, vLLM, SGLang и ONNX. Доступны базовая и дообученная open-weight версии.Источник:
https://www.liquid.ai/blog/lfm2-5-2-6b
#LiquidAI #opensource
@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤44👍42🔥19👏12🤓3
📌 НИЯУ МИФИ продолжает набор в онлайн-магистратуру, созданную в партнерстве с Яндекс Практикумом
Программа «Специалист по работе с данными и применению ИИ» рассчитана на 2 года и проходит в онлайн-формате с сохранением очного статуса студента. Учебный план сфокусирован на прикладных задачах и разделен на четыре трека:
• ML-инженер — разработка и внедрение моделей, автоматизация процессов и MLOps (DVC, MLflow, Airflow, Optuna, Docker, FastAPI, Yandex Cloud).
• CV-инженер — алгоритмы компьютерного зрения, детекция и распознавание объектов (OpenCV, PyTorch, Hugging Face, Transformers).
• NLP-инженер — обработка естественного языка, работы с LLM и извлечение данных (PyTorch, NLTK, TF-IDF, RNN, LSTM).
• Data-инженер— проектирование хранилищ, обработка и поставка данных (SQL, PostgreSQL, Vertica, Hadoop, Kafka, MongoDB).
Практическая часть включает более 10 проектов на базе задач в том числе продуктовых команд Яндекса без ограничений по NDA, а также возможность работы над собственными кейсами. В программу заложена подготовка к найму: mock-интервью и консультации с нанимающими менеджерами.
Выпускники получают диплом магистра НИЯУ МИФИ (направление «Прикладная математика и информатика») и диплом о профпереподготовке от Яндекса. Поступление проходит дистанционно — по вступительным экзаменам и мотивационному письму.
Подробное описание предметов и программа треков доступны на сайте.
@ai_machinelearning_big_data
#news #ai #ml
Программа «Специалист по работе с данными и применению ИИ» рассчитана на 2 года и проходит в онлайн-формате с сохранением очного статуса студента. Учебный план сфокусирован на прикладных задачах и разделен на четыре трека:
• ML-инженер — разработка и внедрение моделей, автоматизация процессов и MLOps (DVC, MLflow, Airflow, Optuna, Docker, FastAPI, Yandex Cloud).
• CV-инженер — алгоритмы компьютерного зрения, детекция и распознавание объектов (OpenCV, PyTorch, Hugging Face, Transformers).
• NLP-инженер — обработка естественного языка, работы с LLM и извлечение данных (PyTorch, NLTK, TF-IDF, RNN, LSTM).
• Data-инженер— проектирование хранилищ, обработка и поставка данных (SQL, PostgreSQL, Vertica, Hadoop, Kafka, MongoDB).
Практическая часть включает более 10 проектов на базе задач в том числе продуктовых команд Яндекса без ограничений по NDA, а также возможность работы над собственными кейсами. В программу заложена подготовка к найму: mock-интервью и консультации с нанимающими менеджерами.
Выпускники получают диплом магистра НИЯУ МИФИ (направление «Прикладная математика и информатика») и диплом о профпереподготовке от Яндекса. Поступление проходит дистанционно — по вступительным экзаменам и мотивационному письму.
Подробное описание предметов и программа треков доступны на сайте.
@ai_machinelearning_big_data
#news #ai #ml
👨💻50👏15💯11😁9🔥8👍6❤2
This media is not supported in your browser
VIEW IN TELEGRAM
Andrew Ng собрал открытый проект альтернативы Cowork, который берёт рабочую задачу и возвращает готовый результат - документ, разобранный почтовый ящик, обновлённый календарь, ответ в Slack с нужными цифрами.
Пользователь формулирует, что хочет получить, агент сам делит работу на шаги и обращается к файлам, терминалу и подключённым сервисам.
В описании проекта их больше 25, включая GitHub, Jira, Notion, Gmail, Google Calendar, Outlook и HubSpot.
Andrew Ng - одна из самых узнаваемых фигур в ML.
Он основал и возглавил команду Google Brain, затем работал главным научным сотрудником Baidu, где руководил ИИ-подразделением на 1300 человек. До этого он был директором лаборатории ИИ Стэнфорда, сейчас преподаёт там как профессор.
В 2012 году его курс по машинному обучению вырос в платформу Coursera, а позже он запустил образовательный проект DeepLearningAI. Курсы Andrew Ng прослушали больше 8 млн человек.
Проект не привязан к конкретному поставщику модели. Можно подать ключ OpenAI, Anthropic, Google, DeepSeek, Qwen, Mistral, GLM, Kimi, Grok и других, либо подключиться локально через Ollama.
OpenWorker в открытой бете. Сборка для macOS подписана и обновляется сама, а вот версия для Windows пока не подписана, поэтому фильтр SmartScreen выдаёт предупреждение при запуске (подпись оформляется и будет позже).
Объявляя о запуске в X, Andrew написал, что его цель - дать рынку открытый вариант ИИ-коллеги, не зависящий от вендора.
@ai_machinelearning_big_data
#AI #ML #Agent #OpenWorker #AndrewNg
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩30👍14🔥13👏9❤1🎉1🤗1