Машинное обучение RU
18.2K subscribers
1.81K photos
255 videos
11 files
2.23K links
Все о машинном обучении

админ - @workakkk

@data_analysis_ml - анализ даннных

@ai_machinelearning_big_data - Machine learning

@itchannels_telegram -лучшие ит-каналы

@pythonl - Python

@pythonlbooks- python 📚

@datascienceiot - 📚

РКН: clck.ru/3FmrUw
Download Telegram
🔥 Intern-S2-397B — новая открытая модель для научного reasoning и длинных agent-задач

Shanghai AI Laboratory выпустила Intern-S2-397B в версиях BF16 и FP8 под лицензией Apache 2.0.

По данным авторов, модель набрала:

- 87.0 на FrontierScience-Olympiad
- 84.0 на SWE-bench Multilingual

и возглавила заявленное сравнение на обоих тестах.

Одна из интересных особенностей — научные материалы подаются в обучение напрямую как страницы, без промежуточного парсинга: сохраняются текст, изображения, формулы, символы и связи между ними.

Обучение охватывает более 20 научных направлений: scientific reasoning, biomolecular interaction design, генерацию материалов и прогнозирование временных рядов.

Для агентных задач используется long-horizon RL: упор на работу с инструментами, длительное выполнение цепочек действий и устойчивое reasoning. Есть режимы с reasoning и без него.

https://modelscope.ai/collections/Shanghai_AI_Laboratory/Intern-S2
👍31🥰1
Media is too big
VIEW IN TELEGRAM
📞 Трамп позвонил Хуангу прямо на сцене и назвал страхи перед ИИ «обманом»

На All-In Summit в Лос-Анджелесе глава Nvidia включил громкую связь, и участники конференции услышали выступление президента.

Началось с шутки: пока Хуанг искал нужную кнопку, Трамп заметил, что тот создаёт чипы, которые годами никто не может повторить, но не справляется с громкой связью.

Дальше - об ИИ:

* Роботы и ИИ не захватят мир, заявил Трамп.
* Дата-центры он назвал «нефтью следующих 20–25 лет», которая должна обогащать штаты и жителей.
* Сопротивление их строительству, по его словам, выгодно Китаю.
* Осторожность нужна, но останавливать ради неё всю индустрию он не собирается.

Хуанг поддержал президента и пообещал работать над тем, чтобы в американской ИИ-гонке выигрывали компании, штаты и обычные люди.
8🤬2👍1🔥1
ИИ может за секунды предложить готовый код — вместе с несуществующим методом API, уязвимостью или давно устаревшим решением. Поэтому скорость генерации уже не главный навык. Важнее уметь проверять результат.

🎥22 сентября в 20:00 МСК на открытом уроке разберём, как выстроить безопасную работу с ИИ в Python-разработке: от воспроизведения инцидента и проверки гипотез до анализа кода и подготовки исправления.

На практическом примере покажем, как находить галлюцинации, уязвимости и устаревшие решения, проверять рекомендации модели и использовать ИИ при разборе кода без потери контроля над качеством.

🔔 Урок проходит в преддверии старта курса «ИИ для Python-разработчиков» и будет полезен Python-разработчикам, которые уже используют или только начинают использовать ИИ-инструменты в разработке и хотят применять их в соответствии с инженерными практиками.

💻Зарегистрируйтесь: https://otus.pw/bkRd/?erid=2W5zFGgmmr9


Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.
1
🔥 World Models для робототехники начинают учитывать геометрию latent space, а не считать её просто «плоским» векторным пространством.

Идея JEPA, которую много лет продвигает Yann LeCun, получила интересное развитие: в GeoWorld latent-представления переносятся в гиперболическое пространство, а planning и reinforcement learning выполняются уже с учётом этой геометрии.

Почему это важно:

обычный подход предполагает, что расстояния между состояниями можно измерять как в евклидовом пространстве. Но сложные иерархические состояния мира могут лучше описываться искривлёнными manifold.

GeoWorld использует:

Hyperbolic JEPA → Geometric RL → multi-step planning

На CrossTask и COIN авторы получили примерно +3% success rate на 3 шагах и +2% на 4 шагах относительно V-JEPA 2.

Параллельно работа LeCun и соавторов по LeJEPA показывает, что структура latent space напрямую влияет на возможность корректного планирования.

Похоже, следующий этап world models - это уже не только «научить модель предсказывать мир», но и правильно описать геометрию пространства, в котором она этот мир представляет.

arxiv.org/pdf/2603.12231
👍3
🔥 China Telecom открыла Xing4.0-29B-A4B - MoE-модель на 29B параметров, где на каждом шаге активны только около 4B.

Модель ориентирована на многошаговое планирование, tool use, работу в терминале и длительное выполнение задач. Контекст - 256K, с расширением до 512K.

По данным авторов, Xing4.0 лидирует в своём сравнении на Claw-Eval, Terminal-Bench 2.1 и DeepresearchBII, а на SWE-bench Verified набирает 75.0.

В архитектуре используются mHC, MLA и MTP. Обучение и inference полностью адаптированы под китайскую вычислительную инфраструктуру, а системные оптимизации дали около +96% throughput.

Apache 2.0.

https://modelscope.ai/models/XingChen-AGI/Xing4.0-29B-A4B
4👍2🔥2
🔥 Один из лучших обучающих курсов на StepiK по SQL

SQL можно знать годами и всё равно теряться, когда запрос внезапно начинает тормозить в проде.

Этот курс про уровень, где ты не просто пишешь SELECT, а понимаешь, что происходит внутри MySQL, почему запрос работает медленно и как ускорить его без новых проблем. Здесь разбираются EXPLAIN, индексы, CTE, оконные функции, транзакции, аналитические паттерны, legacy SQL и работа с AI-ассистентами.

Каждый урок - с практикой и реальными SQL-задачами на MySQL 8 с автопроверкой.

После курса ты сможешь увереннее разбирать чужой код, находить узкие места и предлагать решения, которые действительно работают.

Для подписчиков скидка - 49% в течение 2 суток: https://stepik.org/a/298827/
😁21
🔥 Cohere ускорила LLM inference на H100 с помощью megakernel - до 1,58× быстрее vLLM

Обычный inference запускает десятки отдельных GPU kernels: QKV, attention, MoE, RMSNorm и другие. Между ними GPU постоянно ждёт синхронизацию и новые kernel launches.

Cohere объединила весь decode step в один persistent megakernel.

На North Mini Code:

- 292 tok/s при batch size 1
- против 185 tok/s у vLLM
- использование теоретического bandwidth H100 выросло с 39% до 62%
- ускорение сохраняется вплоть до 256K context
- без измеримой потери качества

Откуда выигрыш:

меньше kernel launches → меньше глобальных barriers → лучше загрузка SM → prefetch весов → меньше простаивающего GPU

Причём это уже не лабораторный benchmark: система поддерживает continuous batching, paged attention, ragged sequences, tool calling и OpenAI-compatible API.

Сам megakernel написан в одном CUDA-файле — без отдельного compiler stack.

https://cohere.com/blog/megakernels
🔥4🤔3
🧠 ИИ может «думать дольше», не генерируя длинную цепочку рассуждений

Исследователи представили Looped Flows - метод, который позволяет модели многократно уточнять внутреннее представление задачи перед выдачей ответа.

Проблема таких моделей - обучение: сложно научить каждый шаг быть полезным для следующих, когда градиенты проходят лишь через несколько обновлений.

Авторы обучают отдельные шаги на небольших задачах удаления шума, связывая их общим шумом и постепенным снижением его уровня. Так модель учится сохранять полезную информацию между обновлениями.

При решении задачи можно выделить больше вычислений на дополнительные внутренние шаги - без увеличения текстовой цепочки рассуждений.

📊 Результаты на ARC-AGI:

* 58,8% на ARC-AGI-1;
* 12,2% на ARC-AGI-2.

На шести тестах рассуждения метод в целом превзошёл предыдущие ведущие модели с повторяющимися вычислительными блоками. Это результаты специализированных моделей, а не готовый способ улучшить любую LLM.

https://arxiv.org/abs/2609.11801
4🤔1
Forwarded from Machinelearning
📌Goldman Sachs повысил прогноз по развитию физического ИИ

Финансовый конгломерат обновил свой прогноз по динамике развития воплощенного ИИ, предположив, что к 2035 году в мире будет выпущено 6,5 миллиона человекоподобных роботов, а рыночная стоимость этого сегмента составит 138 миллиардов долларов.

Согласно новым данным, в 2026 году будет выпущено 75 000 единиц, а к 2030 году — 890 000 единиц, что более чем в три раза превышает предыдущий целевой показатель на конец десятилетия.

Ожидается, что на первых порах роботы будут активно использоваться на складах, в логистике и в автомобильной промышленности.

Аппаратные и программные экосистемы уже подстраиваются под эти отрасли: NVIDIA расширяет свой стек физического ИИ проектами Omniverse, Cosmos, Isaac и Jetson, чтобы обеспечить внедрение складской робототехники для своих партнёров, а Tesla начала переоборудовать производство на заводе во Фримонте под специализированные сборочные линии для Optimus.

Основным операционным риском, с которым столкнётся этот десятилетний цикл робототехники, остаётся добровольное замедление темпов развития или приостановка деятельности передовых разработчиков ИИ из-за опасений по поводу безопасности.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
5