289K subscribers
5.23K photos
1.2K videos
17 files
5.58K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
Media is too big
VIEW IN TELEGRAM
Эндрю Уайлс 7 лет тайно решал задачу, которую не могли решить 358 лет

Последнюю теорему Ферма он увидел ещё в 10 лет. В 1986 году, уже будучи профессором Принстона, Уайлс начал работать над ней почти в полной изоляции. О его настоящей цели знала только жена.

Чтобы никто не понял, чем он занят, он почти перестал публиковаться и постепенно выпускал старые результаты.

В июне 1993 года Уайлс представил доказательство на трёх лекциях в Кембридже. Мир решил, что одна из самых известных задач математики наконец закрыта.

Но затем рецензент нашёл серьёзную ошибку.

Следующие 14 месяцев Уайлс пытался спасти доказательство уже под вниманием всего математического сообщества. В какой-то момент он был готов сдаться.

Решение пришло в сентябре 1994 года. Позже Уайлс рассказывал, что около 20 минут просто смотрел на исправление, не веря, что оно работает.

Когда BBC попросила его вспомнить этот момент, он не смог договорить и отвернулся от камеры в слезах.

Семь лет в тайне, год после почти полного краха и задача, которая ждала решения больше трёх веков.

@data_analysis_ml
👍14750🔥35❤‍🔥7👏7🤨4🙈4🫡3🌭2👌1
✔️ Vals-Smith: оценивайте модели на своей кодовой базе

Независимая бенчмарк-платформа Vals представила Vals-Smith - инструмент для автоматической генерации кастомных бенчмарков на основе кодовой базы пользователя.

Vals-Smith позволяет тестировать модели и агентов на специфике собственных проектов, не полагаясь на публичные лидерборды. Инструмент поддерживает открытые и приватные репозитории.

Система анализирует GitHub-репозитории и извлекает задачи из принятых PR.

Каждое задание включает описание проблемы, скрытые проверки и воспроизводимую среду. Модель получает код до внесения правок (сам патч скрыт).

Для успешного решения испытуемая должна пройти скрытые тесты и не нарушить существующую логику приложения.

Доступ к платформе выдается по заявкам. Есть демо-результаты тестирования популярных моделей на задачах из исходников LinuxNext.jsSGLang и Spark.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔53👍40👏9🔥75💯5
This media is not supported in your browser
VIEW IN TELEGRAM
🚨 Moonshot AI выложила Kimi K3 на Hugging Face — 2,8 ТРИЛЛИОНА параметров в открытых весах.

Это первая open-weight модель класса ~3T. При этом благодаря MoE на каждом токене активируется 104 млрд параметров: 16 экспертов из 896. (Hugging Face)

Что внутри:

— контекст 1 048 576 токенов
— нативная работа с текстом и изображениями
— новая Kimi Delta Attention (KDA)
— Attention Residuals
— 93 слоя: 69 KDA + 24 Gated MLA
— MXFP4-веса + MXFP8-активации
— заявлено примерно 2,5× более эффективное масштабирование, чем у Kimi K2. (Hugging Face)

K3 заточена под долгие агентные задачи: работу с огромными репозиториями, терминалом, исследования, оптимизацию GPU-ядер, компиляторы и другие многошаговые инженерные сценарии. (Hugging Face)

Moonshot действительно опубликовала полные веса модели, а не ограничилась API. (Hugging Face)

https://huggingface.co/moonshotai/Kimi-K3
166🤩51👏44🎉14👍13🔥12🤷‍♂2😁2👀2
📌 Moonshot AI опубликовала техотчёт Kimi K3

Если коротко - от K2 архитектура K3 отличается почти во всём.


🟡Внимание

В K2 все слои (61) работали на одном механизме, MLA. В K3 слоёв 93, и собраны они блоками - 3 слоя KDA и один глобальный MLA, суммарно 69 и 24.

KDA сжимает предыдущий текст в состояние фиксированного размера, поэтому длина диалога перестаёт раздувать кэш.

Явных позиционных меток в модели нет, и она растягивается до миллиона токенов без привычных приёмов вроде перенастройки RoPE.

🟡Residual connections

Обычно слой получает всё накопленное предыдущими слоями одной суммой.

Attention Residuals позволяют каждому слою выбирать, из каких ранних блоков брать информацию. 93 слоя K3 разбиты на 8 блоков по 12.

🟡MoE

Маршрутизируемых экспертов теперь 896 против 384 у K2, на токен активируются 16 вместо 8, общих экспертов стало 2 вместо одного.

Считают они во вдвое более узком латент спэйсе, чем основной, а результат возвращают в общий поток.

Функцию активации SwiGLU заменили на SiTU-GLU, схему балансировки нагрузки - на Quantile Balancing.

Общий профит Moonshot оценивает примерно в 2,5 раза по эффективности масштабирования.

🟡Агентские способности

Тут сыграло роль не столько железо, сколько дообучение. 3 специализации (общие задачи, агенты, код) обучали отдельно, каждую на трёх уровнях ризонинга, а 9 получившихся моделей слили в одну.

Отдельные тренировочные эпизоды доходят до тысяч вызовов инструментов, причём состояние файлов, приложений и виртуальных машин сохраняется между шагами.


🖥Github


@ai_machinelearning_big_data

#AI #ML #LLM #KimiK3 #MoonshotAI
Please open Telegram to view this post
VIEW IN TELEGRAM
🤓116👌3926👏16👍8🔥4🤔4🥱1💘1
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ В ChatGPT люди все чаще решают задачи вне основной профессии

OpenAI проанализировала 800 тысяч промптов к ChatGPT и выявила эффект пересечения задач. В 43,5% случаев пользователи делегируют модели задачи вне своей основной специальности.

Чаще всего пересечение затрагивает инженерию и маркетинг. Сотрудники непрофильных отделов с помощью LLM анализируют данные, ревьюят контракты и ищут баги в коде. Эффект наиболее заметен в небольших компаниях без выделенных команд узких специалистов.

Для классификации запросов исследователи использовали американскую базу профессий O*NET. Из выборки исключили генерацию текстов, саммаризацию и планирование.
openai.com

✔️ Microsoft представила security-модель MAI-Cyber-1-Flash

Корпорация выпустила компактную модель MAI-Cyber-1-Flash для поиска уязвимостей в коде. В составе мультиагентной системы MDASH она показала точность 96% на бенчмарке CyberGym, опередив Mythos на 12 пунктов и превзойдя актуальные версии моделей OpenAI и Google.

Архитектура новинки базируется на линейке MAI-Thinking-1. Модель самостоятельно обрабатывает 90% задач, а сложные случаи пересылает на GPT-5.4. По оценкам компании, такой подход снижает затраты на безопасность в 2 раза.

Одновременно запущена агентная система мониторинга и нейтрализации угроз Perception. Она обрабатывает 100 трлн сигналов ежедневно, используя телеметрию 1,6 млн клиентов.

MAI-Cyber-1-Flash не выйдет в open-source и не будет доступна через API. Модель останется эксклюзивным компонентом коммерческих платформ MDASH и Perception.
microsoft.ai

✔️ Чаты Claude попали в поисковую выдачу

Публичные ссылки на диалоги в Claude попали в выдачу поисковиков из-за отсутствия тега noindex. Поисковые роботы проиндексировали сгенерированные страницы с API-ключами, персональными данными и корпоративными документами.

Anthropic пока не отреагировала, Google превентивно скрыл ссылки на Claude из поисковой выдачи, а вот алгоритмы Bing и Brave продолжают их индексировать. До решения проблемы необходимо вручную удалять публичные диалоги с чувствительной информацией через раздел Shared Conversations в настройках профиля.

Аналогичная проблема с ChatGPT произошла год назад - тогда OpenAI оперативно закрыла индексацию.
reddit.com

✔️ Nvidia расширяет партнерство со стартапом Ильи Суцкевера

Чипмейкер увеличил инвестиции в стартап SSI Ильи Суцкевера и договорилась о поставках ускорителей следующего поколения на архитектуре Rubin. Оборудование увеличит вычислительные мощности SSI примерно в 10 раз. Сумма допвложений не раскрывается.

Ранее SSI преимущественно использовала Google TPU. По условиям нового партнерства, инженеры Nvidia и SSI займутся совместной оптимизацией текущих и будущих вычислительных платформ под задачи стартапа.

SSI основан в 2024 году для разработки ASI и пока не выпускал публичных моделей и продуктов. Решение об увеличении финансирования и выделении квот на железо руководство Nvidia приняло после оценки закрытых промежуточных результатов исследований команды Суцкевера.
wsj.com

✔️ ИИ заставляет ВУЗы менять подход к обучению

По данным исследования ассоциации ACM, IT-преподаватели меняют учебные программы из-за влияния ChatGPT и GitHub Copilot.

Из 763 опрошенных педагогов 69% заявили, что ИИ изменил базовый набор навыков для разработки ПО. Вектор обучения смещается с написания программ с нуля на чтение чужого кода, дебаггинг, проектирование архитектуры и промпт-инжиниринг.

68% респондентов скорректировали форматы оценки знаний. Из-за риска плагиата (72%) и зависимости студентов от ИИ (87%) университеты снижают значимость домашних заданий, возвращаясь к очным экзаменам, тестам на бумаге и устной защите кода.

Единых стандартов использования LLM в вузах нет - правила варьируются от полных запретов до легальной работы с ИИ при условии строгого логирования промптов. Половина участников опроса называет главным барьером нехватку методик преподавания и тестирования в условиях доступности генеративных нейросетей.
acm.org


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔70👍27👏2119🎉8🔥3
✔️ Андрей Карпати опроверг слухи о своем уходе из Anthropic

Поводом для спекуляций стало внезапное исчезновение упоминания Anthropic из профиля в сети Х.

Это породило тряску волну слухов о том, что сооснователь OpenAI покинул команду предварительного обучения всего через 68 дней после трудоустройства к разработчику Claude.

Андрей объяснил пропажу статуса странной ошибкой платформы и подтвердил, что продолжает работать в Anthropic.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9844🤔32😁26🎉5🔥2
📈 AI-лихорадка в одном IPO: производитель памяти за день подорожал до $500 млрд

Китайский производитель памяти CXMT вышел на биржу и в первый день акции взлетели примерно на 465%. Капитализация выросла с $85,5 млрд при IPO до почти $500 млрд, временно сделав компанию самой дорогой на биржах материкового Китая.

CXMT выпускает DRAM для смартфонов, ПК и серверов. Инвесторы рассчитывают, что дефицит памяти и рост AI-инфраструктуры помогут компании приблизиться к Samsung, SK Hynix и Micron. Сейчас её долю мирового рынка оценивают примерно в 8%.

Скачок усилила и механика размещения: в свободное обращение поступило лишь около 6,7% акций, поэтому ограниченное предложение резко разогнало цену.

CXMT находится в санкционном списке Пентагона, но Apple, по данным FT, уже добивается разрешения на закупку её памяти.

Производитель ОЗУ за один день становится дороже банков и IT-гигантов, состояние AI-рынка объяснять больше не нужно.
Please open Telegram to view this post
VIEW IN TELEGRAM
68🔥47👍19👏17🤩12🌭5💯5
🦾 Как развернуть модель машинного обучения через Docker
Практика и ваши вопросы в прямом эфире

Открытый урок курса «Машинное обучение. Экспертный уровень»
6 августа, 18:00

Для разработчиков, инженеров по данным, инженеров машинного обучения и MLOps, которые хотят полный цикл развертывания модели машинного обучения: от исследовательского кода до работающего контейнера с оркестрацией.

На вебинаре мы пошагово разберём:
- запуск и управление контейнерами, работа с их состоянием;
- написание Dockerfile для модели с учётом зависимостей;
- сборка образа и тестирование модели внутри контейнера;
- построение многокомпонентной системы через docker-compose.

Каждый шаг объясняется и демонстрируется в реальном времени. Вы увидите не только команды, но и логику принятия решений — как правильно структурировать контейнер, какие настройки важны для промышленного использования.

Участвовать бесплатно https://tglink.io/a63131474758ce?erid=2W5zFJxYZCV


Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.
👍42😁24👏12🤔76👌3🔥1
📌 Теренс Тао: в математике кризис из-за ИИ

На Международном конгрессе математиков в Филадельфии Теренс Тао (медаль Филдса 2006 года) прочитал лекцию "Математика в эпоху ИИ".

Его тезис: сообщество входит в период, сопоставимый с кризисом оснований 1900-1930 годов, когда парадокс Рассела и теоремы Гёделя заставили математиков пересмотреть базовые допущения.


Только пересматривать теперь придётся не логику, а ценности и правила профессии.

Публичные свидетельства о возможностях моделей Тао оценил сдержанно - собраны в основном вне контролируемых условий, подвержены смещению в отчётности и коммерческим стимулам, часть издержек и переменных не раскрывается.

Исключением он считает проект First Proof - независимую проверку, где 28 мая 2026 года 4 системы получили 10 новых исследовательских задач, а решения рецензировали эксперты.

По итогам 7 задач из 10 хотя бы одна из систем решила на уровне, пригодном для публикации. Стоимость вычислений составила от 10 до 1000 долларов на задачу.

Тао разложил работу математика на 5 стадий: получение доказательства, его проверка, внятное изложение, принятие сообществом через публикацию, и наконец канонизация - попадание в учебники.

ИИ хорошо справляется с первой стадией и заметно продвинулся на второй, остальные, по его словам, остаются человеческими и идут медленно.

Отсюда переход от "дефицита к избытку" - доказательства копятся в очереди на проверку, проверенные ждут читаемого изложения, а рецензирование не справляется с потоком.

Признаки этого видны уже сейчас. На сайте задач Эрдёша скопились десятки присланных ИИ доказательств, которые никто не взялся подтвердить, причём часть отправителей заявили, что сами не в состоянии их проверить.

Возможна ситуация, допускает Тао, когда формально верное доказательство важного результата не сможет объяснить ни один человек.


🟡Рекомендации

Нормализовать открытое признание того, что при работе использовался ИИ - хуже всего скрытое применение из страха перед коллегами.

Снизить престиж "решил первым" и поднять цену изложения, публикации и включения результата в общее знание.

Если авторы не могут внятно, на экспертном уровне и с корректными ссылками рассказать о собственном результате, публиковать его не следует.

Конгресс, который проходит раз в 4 года и вернулся в США впервые с 1986 года, работает до 30 июля.

Медали Филдса, самую престижную награду в математике, в этом году получили Дэн Юй, Джон Пардон, Джейкоб Цимерман и Ван Хун - за результаты, полученные без участия ИИ.


Презентацию лекции Тао выложил сам, запись обещана позже.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍79🤔69👏2019🔥8💯5👨‍💻2❤‍🔥1🤝1
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI, Anthropic, Google и Microsoft обновили рекорды расходов на лоббирование

В первой половине этого года ИИ-компании увеличили бюджеты на лоббирование в правительстве США. Бизнес пытается повлиять на правила строительства дата-центров, стандарты аудита своих моделей и смягчить нормативные ограничения.

Расходы OpenAI выросли почти вдвое в годовом исчислении и составили $2,22 млн. Anthropic увеличила бюджет втрое - до $3,53 млн. Траты Google и Microsoft обновили максимумы с 2020 года, лоббистскую активность также нарастили Scale AI и Tencent.

Компании продвигают разные подходы к регулированию. Anthropic настаивает на жестком контроле открытых моделей, тогда как Microsoft выступает против подобных ограничений. Google фокусируется на законах, закрепляющих технологическое лидерство США.
ft.com

✔️ Amazon останавливает развитие моделей Nova

AWS сворачивает разработку линейки Nova, представленной в декабре 2024 года. Заморозка коснется флагманских Premier и Omni, видеогенератора Reel и генератора изображений Canvas.

Клиенты сохранят доступ к API в режиме базовой поддержки, но дальнейших обновлений весов не будет. Решение принято на фоне закрытия профильной лаборатории и увольнений в подразделении AGI. Высвободившиеся ресурсы перенаправлены в группу Frontier Model Research под руководством Питера Аббила, перешедшего в Amazon после покупки робототехнического стартапа Covariant.

Команда Аббила работает над новой фундаментальной моделью, презентация которой запланирована на осень в рамках конференции re:Invent.
businessinsider.com

✔️ Personal Computer от Perplexity пришёл на Windows

ИИ-поисковик выпустил версию агента Personal Computer для Windows 10 и 11. Инструмент получил доступ к локальным файлам и установленному ПО для автономного выполнения задач.

В мае Perplexity интегрировали агента в облачные версии Microsoft 365. Представленное десктопное приложение открывает доступ к корпоративным данным, которые хранятся локально и недоступны облачным сервисам. Теперь управление файлами на устройстве, Office 365 и веб-ресурсами происходит в едином окне.

Инструмент развертывается для подписчиков тарифов Pro, Max и Enterprise. Перед выполнением критических действий система запрашивает подтверждение владельца ПК.
PerplexityAI в сети Х

✔️ Экс-глава Uber запустил индустриальный ИИ-холдинг Atoms

Робототехнический стартап Atoms Трэвиса Каланика привлек $1,7 млрд акционерного и заемного капитала. Лид-инвестором раунда выступил фонд a16z.

Новая структура объединит предыдущий проект Каланика CloudKitchens и разработчика автономного транспорта Pronto, поглощенного в марте. Atoms будет выпускать аппаратно-программные ИИ-комплексы для горнодобывающей отрасли, строительства, тяжелых грузоперевозок и производства продуктов питания.

Компания отказывается от создания универсальных роботов-гуманоидов в пользу узкоспециализированной автоматизации традиционной промышленности. По заявлению Бена Горовица из a16z, инвестиции направлены на разработку систем, способных полностью взять на себя задачи по созданию, перемещению и хранению физических объектов.
atoms.co

✔️ Маркетплейсы биометрии в Китае продают права на внешность для генерации контента

Китайские платформы запустили биржи прав на внешность реальных людей для генерации ИИ-видео. Основной потребитель - индустрия микросериалов. За право на использование лица пользователи получают от $15 до $700.

Лицензирование биометрии снижает затраты продакшена на кастинг и рендеринг, решая проблему однообразия синтетических персонажей. В первом квартале 2026 года генерация применялись при создании 95% из 128 тысяч выпущенных в Китае микросериалов.

Платформы называют такие маркетплейсы способом борьбы с нелегальными дипфейками.
restofworld.org


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔36👍2814💯13🔥5🏆5🎃1😨1
Forwarded from Яндекс
Media is too big
VIEW IN TELEGRAM
🧠 Чем живёт ML-индустрия? Чтобы найти ответ на вопрос, разработчик из ML-инфраструктуры Яндекса Даша отправилась в Сеул на конференцию ICML — одну из главных мировых конференций по машинному обучению.

На ней она вместе с коллегами представила свою статью об ускорении графовых нейронных сетей. В видео Даша рассказывает, о чём ее статья, как выглядят подобные ML-события и в чём ценность участия в них.

Присоединяйтесь к команде Яндекса и решайте самые интересные задачи.

Подписывайтесь 〰️ @yandex
Please open Telegram to view this post
VIEW IN TELEGRAM
👨‍💻28👍13🤣12🎉107👏6🙉4🔥3🤩3
📌Mythos нашла математические слабости в криптографических алгоритмах

Anthropic опубликовала отчёт подразделения Frontier Red Team. По его данным, Mythos улучшила атаку на постквантовую схему цифровой подписи HAWK и нашла новый способ атаковать упрощённую версию шифра AES.

HAWK - кандидат в новый стандарт. В 2022 году американский институт стандартов NIST объявил конкурс на подписи, устойчивые к будущим квантовым компьютерам - HAWK дошёл до третьего раунда, и специалисты разбирали его 2 года.


По утверждению Anthropic, Mythos за 60 часов обнаружила в математической решётке, на которой держится стойкость схемы, ранее незамеченную симметрию. Эффективная длина ключа сокращается вдвое - для варианта HAWK-256 оценка стоимости взлома падает с 2 в 64-й степени операций до 2 в 38-й.

Атака остаётся экспоненциальной и на другие постквантовые кандидаты NIST не переносится, но чтобы вернуть прежний запас прочности, ключи HAWK пришлось бы удвоить, а тогда схема теряет свои главные преимущества.

🟡AES-128

Полная версия шифра делает 10 раундов преобразований, атака работает против урезанной, семираундовой (такие варианты криптографы изучают специально, чтобы оценивать надёжность целого шифра).

Модель предложила метод, который назвала "мостом Мёбиуса" - он убирает один из перебираемых атакующим параметров и ускоряет лучшую известную атаку до 800 раз.

🟡Человек в тесты взлома почти не вмешивался

В кейсе HAWK участвовал исследователь без специализации в решётчатой криптографии, и занимался он в основном организацией процесса.

Атаку на AES модель нашла почти сама - сначала она от задачи отказывалась, написав, что "AES-128 r5/r6 трудная задача", и взялась за поиск только после нескольких подбадривающих сообщений.

За 3 дня она выдала несколько сотен миллионов токенов, получив всего 3 подсказки.

Каждая из двух работ обошлась примерно в 100 тысяч долларов оплаты API.


В отчёте упомянуты и другие результаты - атаки на укороченные версии шифров LEA и Serpent-128, небольшие улучшения против Salsa20, Poseidon и SHA-1. Подробности компания обещает позже.

Anthropic выложила статью и демонстрационный код атаки на HAWK, цепочку рассуждений Mythos в момент находки по AES и сообщила, что консультировалась с криптографами, передала находку авторам HAWK и синхронизировала раскрытие с публичной рассылкой NIST.

Также, вместе с ETH Zurich, Тель-Авивским университетом и Университетом Хайфы Anthropic выпустила набор тестов CryptanalysisBench, чтобы криптоаналитические способности языковых моделей могли измерять и другие.


@ai_machinelearning_big_data

#AI #ML #Research #Cybersecurity #Mythos #Anthropic
Please open Telegram to view this post
VIEW IN TELEGRAM
👍27🔥1310🤣1😨1💘1
🔥 ChatGPT приближается к 1 млрд пользователей в неделю, но давление на OpenAI растёт

По данным The Information:

• цель достигнута на семь месяцев позже плана
• у ChatGPT уже более 50 млн платных пользователей
• enterprise приносит свыше 40% выручки
• прогноз выручки на год - около $25 млрд
• ожидаемый cash burn - примерно те же $25 млрд
• Anthropic могла обогнать OpenAI по выручке благодаря корпоративным клиентам

Миллиард пользователей - исторический масштаб.

https://www.theinformation.com/articles/openais-chatgpt-nears-1-billion-weekly-active-users-seven-months-target
🔥3017👍4👀3🤣1