Машинное обучение digest
54 subscribers
3.95K photos
638 videos
2.44K links
Download Telegram
⚡️ Gemini 3.1 Flash-Lite - самый экономичный Gemini 3

Google представил Gemini 3.1 Flash-Lite - ультрабыструю и максимально дешёвую модель в линейке Gemini 3.

Цена - всего $0.25 за 1 млн входных токенов и $1.50 за 1 млн выходных токенов.

Модель выполняет задачи быстрее и обходится в разы дешевле крупных моделей, обеспечивая увеличение скорости генерации на 45% по сравнению с Gemini 2.5 Flash.

Главное:


• Настраиваемые уровни "мышления"
Можно регулировать глубину рассуждения под задачу - от лёгких операций до более сложной логики.

• Подходит для high-scale задач
Оптимизирована для массовых сценариев - генерация UI, дашбордов, симуляций, автоматизация workflow.

• Доступна через Gemini API
Разработчики уже могут тестировать модель в Google AI Studio.

Отличный дешёвый и быстрый ИИ.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-lite/

@ai_machinelearning_big_data

#Gemini
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ ChatGPT-5.3 Instant

Похоже, это такая новая тенденция - релизить новинки синхронно.

OpenAI развернула GPT-5.3 Instant, масштабный апдейт своей самой используемой модели.

В этот раз создатели сфокусировались на качестве общения: модель стала реже отказывать в обработке безопасных запросов и избавилась от излишне осторожных, морализирующих нравоучений.

Существенно улучшена логика работы с веб-поиском. GPT-5.3 Instant глубже синтезирует найденные данные с собственными знаниями, не сводя выдачу к простому перечислению ссылок.

В релизе говорят, что заметно подросла фактологическая точность: в сложных областях (медицина, право, финансы) количество галлюцинаций упало на 26,8% при поиске в сети и на 19,7% при опоре только на внутреннюю базу.

Также улучшены навыки генерации текста, слог стал более живым и разнообразным по стилю.

Модель уже открыта для всех, в том числе через API по идентификатору gpt-5.3-chat-latest.

Предыдущая версия, GPT-5.2 Instant, останется в Legacy-доступе для платных подписчиков до 3 июня этого года, после чего ее отключат.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Легендарный математик - Дональд Кнут начал свою новую научную работу словами: “Shock! Shock!”

Почему?

Потому что Claude Opus 4.6 решил открытую задачу, над которой Кнут работал несколько недель.
Речь о гипотезе разложения графов из легендарной книги The Art of Computer Programming.

Кнут даже назвал статью в честь ИИ:

“Claude’s Cycles”

Что произошло:

- Claude провёл 31 исследование
- на это ушло примерно 1 час
- Кнут изучил результат
- оформил формальное математическое доказательство

И закончил работу фразой:

> *«Похоже, мне придётся пересмотреть своё мнение о генеративном ИИ.»*

Это сказал человек, который написал библию компьютерных наук.

И назвал научную работу в честь ИИ.

Почитать саму работу можно здесь:
https://cs.stanford.edu/~knuth/papers/claude-cycles.pdf
⚡️ Anthropic расширила возможности skill-creator.

Anthropic перенесла часть инженерной культуры: тестирование, бенчмаркинг и итеративность в процесс создания навыков и для этого теперь не нужно уметь писать код.

В skill-creator добавили автоматические тесты, бенчмарки и A/B-сравнения и теперь создатели навыков могут измерить, работает ли skill, до его запуска в продакшен.

🟡 Центральный инструмент - evals (автотесты качества).

Автор задает тестовые промпты и описывает, как выглядит нужный результат. Skill-creator запускает их параллельно: с навыком и без него.

Независимый агент-сравниватель оценивает результаты вслепую, не зная, какая версия перед ним, и сразу показывает, дает ли навык реальный прирост.

Внутренние тесты Anthropic: точность PDF-навыка выросла с 6/8 до 7/8, Excel-навыка - с 6/8 до полных 8/8.


Отдельный бенчмарк-режим дает детальную картину по каждому прогону: процент успешных тестов, время выполнения, расход токенов.

На примере PDF-навыка при работе с незаполняемыми формами и таблицами из многостраничных документов успешность выросла с 40 до 100% (при том же времени выполнения).


🟡Evals полезны и в долгосрочной перспективе.

Если базовая модель начинает проходить тесты без загруженного навыка - это сигнал о том, что навык уже есть в ее поведении и skill можно отключить. Результаты тестов хранятся локально и интегрируются в CI-системы.

🟡Обновление улучшило триггерную активацию.

Claude решает, когда подключить навык, исключительно по короткому текстовому описанию в системном промпте.

Skill-creator теперь анализирует эти описания против тестовых промптов и предлагает правки, снижающие и ложные срабатывания и пропуски.

По результатам внутреннего прогона триггеринг стал лучше на 5 из 6 публичных навыков.


Все обновления уже доступны в вебе и Cowork. Для Claude Code обновили плагин или вот он же - в репозитории, если ставить руками.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
BullshitBench v2, созданный Питером Гостевым, - это бенчмарк, который проверяет, способны ли модели ИИ распознавать бессмысленные запросы и отказываться на них отвечать, вместо того чтобы уверенно продолжать и «придумывать» ответ.

Только модели Claude от Anthropic и Qwen 3.5 от Alibaba показывают результат выше 60% по распознаванию бессмыслицы.
А модели OpenAI и Google? Застряли на месте и почти не улучшаются.

Еще более неожиданно: модели с усиленным рассуждением (reasoning), которые «думают дольше», на самом деле показывают худшие результаты. Они используют дополнительное вычисление не для того, чтобы отвергнуть бессмысленный запрос, а чтобы рационализировать и оправдать этот абсурд.

https://x.com/petergostev/status/2028492838082666780
This media is not supported in your browser
VIEW IN TELEGRAM
Google Research показали способ научить LLM рассуждать более рационально - как байесовские модели.

Идея проста: вместо того чтобы просто генерировать текст, модель обучают обновлять свои убеждения при появлении новой информации, как это делает теория вероятностей.

Проблема в том, что обычные LLM плохо работают с неопределённостью. Когда появляется новая информация, они не всегда корректно пересматривают свои выводы и часто не улучшают предсказания даже при увеличении количества данных.

Исследователи предложили метод Bayesian Teaching:
модель обучают имитировать решения оптимальной байесовской модели, которая считается математически правильным способом рассуждать о вероятностях.

Что получилось:

- LLM начинают лучше обновлять свои предположения, когда получают новую информацию.
- Навык переносится на другие задачи, даже если модель обучали на одном типе задач.
- Улучшается принятие решений в условиях неопределённости.

Например, после такого обучения модель, обученная на задаче рекомендаций авиаперелётов, смогла применять тот же принцип рассуждений к выбору отелей и даже к онлайн-шопингу, хотя эти задачи сложнее и для них трудно задать точную байесовскую модель.

Главный вывод исследования:

LLM можно учить стратегиям рассуждения, а не только фактам.
И если обучить модель копировать правильную логику (например, байесовскую), она может переносить этот способ мышления на новые задачи.

https://research.google/blog/teaching-llms-to-reason-like-bayesians/
🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Google Research показали способ научить LLM рассуждать более рационально - как байесовские модели.

Идея проста: вместо того чтобы просто генерировать текст, модель обучают обновлять свои убеждения при появлении новой информации, как это делает теория вероятностей.

Проблема в том, что обычные LLM плохо работают с неопределённостью. Когда появляется новая информация, они не всегда корректно пересматривают свои выводы и часто не улучшают предсказания даже при увеличении количества данных.

Исследователи предложили метод Bayesian Teaching:
модель обучают имитировать решения оптимальной байесовской модели, которая считается математически правильным способом рассуждать о вероятностях.

Что получилось:

- LLM начинают лучше обновлять свои предположения, когда получают новую информацию.
- Навык переносится на другие задачи, даже если модель обучали на одном типе задач.
- Улучшается принятие решений в условиях неопределённости.

Например, после такого обучения модель, обученная на задаче рекомендаций авиаперелётов, смогла применять тот же принцип рассуждений к выбору отелей и даже к онлайн-шопингу, хотя эти задачи сложнее и для них трудно задать точную байесовскую модель.

Главный вывод исследования:

LLM можно учить стратегиям рассуждения, а не только фактам.
И если обучить модель копировать правильную логику (например, байесовскую), она может переносить этот способ мышления на новые задачи.

https://research.google/blog/teaching-llms-to-reason-like-bayesians/
🔥 Новый research от ByteDance показал, как ИИ научился писать CUDA-код для GPU лучше стандартных компиляторов.

Система генерирует кастомные низкоуровневые компоненты, которые могут работать до 100% быстрее, чем решения, созданные традиционными автоматическими инструментами оптимизации.

Проблема в том, что программирование под AI-чипы и GPU невероятно сложное. Разработчик должен идеально управлять памятью, потоками и математическими операциями, иначе производительность резко падает.

Исследователи решили это так:
они дали LLM безопасную среду для экспериментов, где модель может:

- писать CUDA-код
- запускать тесты производительности
- анализировать результат
- улучшать код через цикл проб и ошибок

Поскольку обучающих данных по такому низкоуровневому коду почти нет, систему заставили генерировать тысячи новых тренировочных задач, комбинируя базовые математические операции.

При этом награда выдавалась не просто за правильный результат, а только если код выполнялся значительно быстрее существующих решений.

В тестах против:

- коммерческих моделей
- встроенных оптимизаторов компиляторов

этот агент регулярно находил неожиданные оптимизации, которые ускоряли работу GPU.

Главный вывод исследования:

LLM могут не только писать код, но и создавать оптимизации на уровне железа, находя такие способы ускорения, которые люди и компиляторы часто пропускают.

arxiv.org/abs/2602.24286
Модель с триллионом параметров буквально «удалила половину своего мозга» и стала умнее.

Yuan3.0 Ultra**-— новая open-source мультимодальная **MoE-модель от Yuan Lab.
Всего 1010 млрд параметров, но при инференсе активны только 68.8 млрд.

На бенчмарках RAG она обошла GPT-5.2, Gemini 3.1 Pro и Claude Opus 4.6 с заметным отрывом.

Например:

- 67.4% на Docmatix против 56.8% у GPT-4o

Что умеет модель:

- Enterprise RAG - 68.2% средней точности на 10 задачах поиска
- Анализ сложных таблиц - 62.3% на бенчмарке MMTab
- Text-to-SQL - 83.9% на Spider 1.0
- Мультимодальный анализ документов с контекстом 64K

Ключевая инновация — Layer-Adaptive Expert Pruning (LAEP).

Во время предобучения у MoE возникает сильный дисбаланс:
некоторые эксперты получают в 500 раз больше токенов, чем другие.

LAEP постепенно удаляет малоиспользуемых экспертов слой за слоем,
что позволяет:

- сократить 33% параметров
- увеличить эффективность обучения на 49%

Также исследователи улучшили метод “fast-thinking” RL.

Теперь система больше награждает ответы, которые:

- правильные
- используют меньше шагов рассуждения

Это позволило:

- уменьшить количество выходных токенов на 14.38%
- повысить точность на 16.33%

Главный сигнал из этого исследования:

MoE-модели начинают сжимать себя прямо во время обучения, а не после.

Если pruning станет частью pretraining, стоимость обучения триллионных моделей может резко снизиться.

https://github.com/Yuan-lab-LLM/Yuan3.0-Ultra
🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
🌟 Self-Flow: обучение диффузионных моделей без внешних энкодеров от Black Forest Labs.

Black Forest Labs и MIT решили проблему, с которой сталкиваются диффузионные и flow-модели: чтобы генерировать качественные картинки, им нужны сильные семантические представления. Обычно их берут снаружи - выравнивают внутренние признаки модели с признаками энкодера вроде DINOv2. Метод работает, но есть нюанс.

Чем сильнее энкодер, тем хуже результат: в экспериментах замена DINOv2-B на более мощный DINOv3-H+ стойко ухудшала FID. Модель привязывалась к фиксированным внешним представлениям и переставала масштабироваться. На видео и аудио выравнивание с энкодерами V-JEPA2 и MERT вообще давало результат хуже ванильного flow matching.


🟡Self-Flow предлагает механизм Dual-Timestep Scheduling

В стандартном flow matching все токены нойзятся одинаково, поэтому модель решает задачу локально и не учится строить глобальные связи. Self-Flow сэмплирует 2 разных уровня шума и случайно назначает их разным токенам (часть входа зашумлена сильнее, часть чище). Это создает асимметрию: чтобы восстановить сильно зашумленные токены, модель вынуждена опираться на чистые и строить глобальный контекст.

Поверх этого работает самообучение по принципу дистилляции. Обучаются одновременно 2 копии модели: модель-ученик видит смешанный зашумленный вход, модель-учитель - более чистую версию (EMA-копия с экспоненциальным скользящим средним).

Ученик учится предсказывать признаки учителя из зашумленного входа, и это вынуждает его развивать сильные семантические представления без какого-либо внешнего энкодера.

🟡Результаты тестов

🟢На ImageNet 256×256 Self-Flow показал FID 5.70 против 5.89 у REPA;
Это, кстати, первый случай, когда self-supervised метод превзошел внешнее выравнивание на этом бенче


🟢На text-to-image: FID 3.61 против 3.92 у REPA;

🟢По видео: FVD 47.81 против 49.75 у REPA;

🟢По аудио: лучшие FAD-оценки среди всех вариантов.

При этом на масштабировании (с 290M до 1B) разрыв с REPA увеличивается: модель Self-Flow на 625M параметров обходит REPA на 1B.

Метод универсален для модальностей - он работает одинаково на картинках, видео и аудио, что намекает на применение для мультимодального обучения.

В репозитории проекта есть код инференса на основе SiT-XL/2 с per-token timestep conditioning, чекпоинт на основе ImageNet 256×256 и скрипты для генерации сэмплов под FID-оценку через ADM evaluation suite. Поддерживаются режимы SDE и ODE, мульти-GPU через torchrun.


🟡Статья
🟡Техотчет
🖥GitHub

@ai_machinelearning_big_data

#AI #ML #Multimodal #Framework #BFL
Please open Telegram to view this post
VIEW IN TELEGRAM
OpenAI объявила о начале развёртывания новых моделей GPT-5.4 Thinking и GPT-5.4 Pro в ChatGPT.

Также GPT-5.4 стала доступна разработчикам через API и в Codex. Новая версия объединяет несколько ключевых направлений развития моделей: улучшенное логическое рассуждение, более сильные возможности программирования и поддержку агентных сценариев работы.

По словам компании, GPT-5.4 стала одной из самых точных и эффективных моделей. Она требует меньше токенов для выполнения задач и работает быстрее по сравнению с предыдущими версиями.

В версии ChatGPT модель GPT-5.4 Thinking получила улучшенный режим размышления: при более длительном анализе она лучше удерживает контекст и способна проводить более глубокие исследования в интернете.

Появилась и новая функция управления процессом ответа. Теперь пользователь может прервать генерацию в середине ответа и изменить направление работы модели, добавив новые инструкции.

Функция управления ответом уже начинает появляться в веб-версии ChatGPT и на Android. Поддержка iOS ожидается немного позже.

https://x.com/openai/status/2029620624923189283?s=46
⚡️ Карпаты показал, как быстро можно обучить модель уровня GPT-2.

NanocHat теперь тренирует модель с возможностями GPT-2 всего за 2 часа на одном узле с 8×H100. Еще месяц назад это занимало около 3 часов.

Главное улучшение оказалось не только в оптимизациях и FP8, а в смене датасета - с FineWeb-edu на NVIDIA ClimbMix. Другие датасеты вроде Olmo, FineWeb и DCLM давали регрессии, а ClimbMix сразу показал стабильный результат.

Но самое интересное другое.
Карпати подключил AI-агентов, которые автоматически экспериментируют с настройками nanocHat.

Агент работает так:
он создает feature-ветку, пробует разные идеи, тестирует их и автоматически мержит те, что улучшают метрики.

За ~12 часов агент сделал 110 изменений, снизив validation loss модели d12 с 0.862 → 0.858 без увеличения времени обучения.

Фактически модель теперь сама оптимизирует свой тренировочный пайплайн.

Карпати шутит, что последние недели он больше оптимизирует агентную систему, которая улучшает код, чем сам репозиторий nanocHat.

https://x.com/karpathy/status/2029701092347630069
⚡️ Карпаты показал, как быстро можно обучить модель уровня GPT-2.

NanocHat теперь тренирует модель с возможностями GPT-2 всего за 2 часа на одном узле с 8×H100. Еще месяц назад это занимало около 3 часов.

Главное улучшение оказалось не только в оптимизациях и FP8, а в смене датасета - с FineWeb-edu на NVIDIA ClimbMix. Другие датасеты вроде Olmo, FineWeb и DCLM давали регрессии, а ClimbMix сразу показал стабильный результат.

Но самое интересное другое.
Карпати подключил AI-агентов, которые автоматически экспериментируют с настройками nanocHat.

Агент работает так:
он создает feature-ветку, пробует разные идеи, тестирует их и автоматически мержит те, что улучшают метрики.

За ~12 часов агент сделал 110 изменений, снизив validation loss модели d12 с 0.862 → 0.858 без увеличения времени обучения.

Фактически модель теперь сама оптимизирует свой тренировочный пайплайн.

Карпати шутит, что последние недели он больше оптимизирует агентную систему, которая улучшает код, чем сам репозиторий nanocHat.

https://x.com/karpathy/status/2029701092347630069
✔️ OpenAI открыла доступ к Codex Security.

Это инструмент, который сканирует архитектуру проекта и выстраивает индивидуальную модель угроз. Опираясь на эту карту, агент целенаправленно ищет слабые места в безопасности приложения.

Фирменная фича - защита от ложных срабатываний за счет практической проверки найденных багов. Обнаружив проблему, агент разворачивает изолированную копию системы в песочнице и пытается самостоятельно провести реальный взлом. Если попытка оказалась успешной и угроза подтверждена, ИИ сам пишет патч. Затем система тестирует обновление, чтобы убедиться, что внесенные исправления не сломают другие функции продукта.

Доступ к превью-версии инструмента получат пользователи тарифов ChatGPT Enterprise, Business и Edu в ближайшие дни.
openai.com

✔️ США привяжут экспорт ИИ-ускорителей Nvidia и AMD к инвестициям в свою экономику.

Министерство торговли США подготовило новые правила продажи чипов для ЦОД. Теперь государствам, чьи компании закупают большие объемы продукции Nvidia и AMD, придется встречно инвестировать в американскую ИИ-инфраструктуру.

Проект вводит многоуровневую систему выдачи экспортных лицензий. Строгость требований напрямую зависит от суммарной вычислительной мощности запрашиваемых компонентов. Для одобрения крупных сделок высшего уровня страны-покупатели будут обязаны проводить прямые финансовые вливания в технологический сектор США.

Этот подход формализует практику, которая уже была успешно обкатана на недавних соглашениях с ОАЭ и Саудовской Аравией. На поставки оборудования в Китай, эти правила не повлияют - они по-прежнему регламентируются отдельными санкциями.
ft.com

✔️ Cursor представил платформу Automations.

Новый инструмент от создателей ИИ-редактора кода избавляет разработчиков от необходимости каждый раз вручную писать промпты. Теперь ИИ-помощник может включаться в работу фоном, самостоятельно реагируя на внешние события.

Триггерами служат действия в Git, сообщения в Slack, новые тикеты в Linear или инциденты в PagerDuty. Платформа также поддерживает настройку кастомных вебхуков и запуск задач по расписанию. Обновленные агенты способны брать на себя полноценные инженерные процессы: проанализировать логи через протокол MCP, локализовать ошибку и сразу подготовить пулл-реквест с готовым исправлением.

Важная деталь - у агентов появилась память. Они запоминают результаты прошлых запусков, постепенно адаптируясь к контексту проекта и избегая повторения старых ошибок.
cursor.com

✔️ SoftBank запросил рекордный кредит для увеличения своей доли в OpenAI.

Японский конгломерат ведет переговоры о привлечении крупнейшего в своей истории долларового займа. Ожидается, что кредит на 40 млрд. сроком на год будет обеспечен четырьмя банками.

Главная цель сделки - финансирование ставки основателя SoftBank Масаёси Сона на ИИ. Банк уже вложил в OpenAI более 30 млрд. долларов, получив около 11% акций стартапа. Чтобы обеспечить эти инвестиции, холдингу пришлось частично распродать другие свои активы.

Агрессивные заимствования усиливают опасения аналитиков по поводу раздувания ИИ-пузыря. Суммарный долг ключевых партнеров OpenAI уже достиг 96 млрд. долларов, а ведущая пятерка ИТ-корпораций набрала новых кредитов на 121 млрд., это в 4 раза выше привычной нормы. При этом монетизация буксует - платные подписки на ИИ-сервисы пока оформили лишь 3% пользователей.
bloomberg.com

✔️ Claude ежедневно привлекает более миллиона новых пользователей.

Об этом достижении сообщил Майк Кригер, возглавляющий подразделение экспериментальных ИИ-разработок. Столь стремительный рост аудитории обусловлен несколькими факторами. Помимо глобального тренда на ИИ, Anthropic извлекла серьезную выгоду из недавнего скандала вокруг сотрудничества OpenAI с Пентагоном.

На фоне этих событий в глазах потребителей и технологического сообщества создатели Claude выглядят более последовательными в вопросах этики. Статус «морального победителя» обеспечивает компании сильное репутационное преимущество и стимулирует массовый приток пользователей.
Mike Krieger в сети Х

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
💰 «Структурный парадокс Джевонса», который сейчас происходит в индустрии ИИ.

Стоимость запуска LLM падает, но общее потребление вычислительной энергии всё равно стремительно растёт.

Исследование математически показывает: когда снижается стоимость единицы цифрового интеллекта и программирования, общий спрос на сложных AI-агентов и инфраструктуру для них начинает расти экспоненциально. В результате появляется огромная новая экосистема сервисов и инструментов, которой всё равно требуется человеческое управление.

Работа раскрывает парадокс: удешевление использования ИИ не экономит деньги, а наоборот подталкивает разработчиков создавать всё более сложных агентов, которые требуют экспоненциально больше вычислительных ресурсов.

Из-за такого прогресса малые компании, создающие простые приложения поверх моделей, со временем проигрывают — базовые модели начинают встраивать те же функции прямо в себя.

Исследователи также обнаружили жёсткую экономическую динамику: даже идеально работающая LLM мгновенно теряет экономическую ценность, как только конкурент выпускает более умную модель.

В итоге авторы показывают, что сочетание огромных затрат на вычисления и постоянной потребности в пользовательских данных естественным образом толкает всю индустрию ИИ к неизбежной монополии.

Исследование:
“The Economics of Digital Intelligence Capital”

arxiv.org/pdf/2601.12339v1

@FinanceStable
Please open Telegram to view this post
VIEW IN TELEGRAM
Большинство людей просто пользуются LLM, но очень немногие понимают, как они работают внутри.

Если хотите перейти от обычного пользователя промптов → к настоящему AI-инженеру, изучайте эти 9 тем по порядку:

1️⃣ Трансформеры
Основы: attention, токены, self-attention
https://youtu.be/Ub3GoFaUcds?si=-dXadGrDAWWAMHGa

2️⃣ Трюки трансформеров
Что делает их стабильными и масштабируемыми
https://youtu.be/yT84Y5zCnaA?si=PxU67ALQNlQfF_cQ

3️⃣ От трансформеров к LLM
Как масштабирование меняет поведение моделей
https://youtu.be/Q5baLehv5So?si=PVUMIZSkIz4eQIss

4️⃣ Обучение LLM
Где на самом деле появляется “интеллект” модели
https://youtu.be/VlA_jt_3Qc4?si=5Q3BgsEw6ijZKJsE

5️⃣ Instruction tuning и alignment
Почему дообучение моделей критически важно
https://youtu.be/PmW_TMQ3l0I?si=iHWjE7IiLTwMbO0E

6️⃣ Рассуждение LLM
Почему модели ошибаются и как улучшить их reasoning
https://youtu.be/k5Fh-UgTuCo?si=2qggA_CELZNFtv0e

7️⃣ Agentic LLM
Модели, которые планируют, вызывают инструменты и действуют
https://youtu.be/h-7S6HNq0Vg?si=LwPg2PpHj7-JA0ez

8️⃣ Оценка LLM
Как реально измерять качество моделей, а не только по демо
https://youtu.be/8fNP4N46RRo?si=IDqAVa7dN0NBKS_J

9️⃣ Актуальные бесплатные ресурсы для изучения ИИ и машинного обучения (2026)

https://uproger.com/aktualnye-besplatnye-resursy-dlya-izucheniya-ii-i-mashinnogo-obucheniya-2026/

🎯Полезные Мл-ресурсы 🚀 Max
This media is not supported in your browser
VIEW IN TELEGRAM
🖥 Как устроен Kubernetes

Kubernetes-кластер состоит из двух основных частей.

Первая - Control Plane. Это мозг системы, который управляет кластером и принимает решения. Вторая часть - Worker Nodes. Это серверы, на которых запускаются контейнеры и реальные приложения.

В Control Plane несколько ключевых компонентов. API Server является точкой входа в кластер - через него проходят все команды и запросы. Scheduler выбирает, на каком узле запускать новые Pod. Controller Manager следит за состоянием системы и автоматически восстанавливает сервисы при сбоях. etcd хранит конфигурацию и текущее состояние всего кластера.

Worker Nodes выполняют приложения.

Pod - это минимальная единица развертывания, внутри которой работают контейнеры. Container Runtime запускает контейнеры на сервере. kubelet является агентом узла и следит за тем, чтобы контейнеры работали как описано в конфигурации. kube-proxy отвечает за сетевое взаимодействие и маршрутизацию трафика внутри кластера.

Если упростить, Control Plane управляет кластером, а Worker Nodes запускают контейнеры и приложения.

Кластер Kubernetes

Control Plane
API Server - точка входа в кластер
Scheduler - назначает Pod на узлы
Controller Manager - поддерживает состояние кластера
etcd - хранилище конфигурации и состояния

Worker Nodes
Pods - минимальная единица развертывания
Container Runtime - запускает контейнеры
kubelet - агент узла
kube-proxy - сеть и маршрутизация

https://www.youtube.com/shorts/OtNY1e4LGts
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Андрей Карпаты выложил минимальный репозиторий Autoresearch - систему, где AI сам проводит исследования.

Это упрощённая версия ядра обучения LLM из nanoGPT/nanochat:
весь код обучения помещается в один файл (~630 строк) и работает на одной GPU.

Как это устроено:

- человек редактирует prompt (.md)
- AI-агент автоматически меняет training code (.py)

Дальше начинается цикл автономных экспериментов.

Каждая точка на графике — полный запуск обучения LLM (~5 минут).

AI-агент работает в бесконечном цикле:

- создаёт git-ветку
- меняет архитектуру модели
- подбирает optimizer
- оптимизирует гиперпараметры
- запускает обучение
- коммитит улучшения

Если validation loss становится ниже, изменение сохраняется.

Фактически агент сам оптимизирует собственный код обучения и постепенно улучшает модель.

Можно запускать несколько агентов с разными промптами и сравнивать, кто быстрее двигает исследование.

Карпаты шутит, что раньше AI-исследования делали люди между:

- едой
- сном
- митингами

Теперь же исследования могут выполнять рои автономных AI-агентов, которые бесконечно гоняют эксперименты на кластерах.

GitHub: github.com/karpathy/autoresearch

🎯Полезные Мл-ресурсы 🚀 Max

@data_analysis_ml
Новая модель GPT-5.4 от OpenAI поднялась на 6 пунктов и разделила 1-е место в Intelligence Index вместе с Gemini 3.1 Pro Preview от Google.

Модель показывает очень сильные результаты в задачах уровня научных исследований, особенно в физике и агентном программировании, устанавливая новые рекорды по нескольким бенчмаркам.

Также у неё огромное контекстное окно — 1.05 млн токенов.

Но есть и минус.

Модель очень дорогая:

• запуск бенчмарков обошёлся почти в 3 раза дороже, чем у Gemini

• уровень галлюцинаций вырос до 89%, потому что модель слишком стремится отвечать на вопросы, даже когда не уверена.
🚨 Исследователи из Беркли провели 8 месяцев внутри одной технологической компании, наблюдая, как сотрудники на самом деле используют ИИ.

Обещание было простым:
ИИ сэкономит время, позволит делать меньше и работать умнее.

Но произошло обратное.

Сотрудники не использовали ИИ, чтобы заканчивать работу раньше и уходить домой.
Они начали брать на себя больше - больше задач, больше проектов, больше часов работы.
И что важно - никто их не заставлял. Они делали это сами.

Исследователи приходили в компанию два раза в неделю на протяжении 8 месяцев.
Они наблюдали 200 сотрудников в реальном времени, анализировали рабочие чаты и провели 40+ интервью с инженерами, продактами, дизайнерами и операционными командами.

Вот что они обнаружили.

ИИ ускорил работу, и люди начали заполнять каждую свободную минуту.
Промпты отправляли во время обеда, перед встречами, поздно ночью.
Естественные паузы в рабочем дне исчезли.

Люди одновременно:
- запускали несколько AI-агентов в фоне
- писали код
- создавали документы
- сидели на встречах

Это ощущалось как мощный рабочий поток и высокая продуктивность.
Но когда сотрудники остановились и посмотрели со стороны, они описали состояние как перегруженность, постоянную занятость и невозможность отключиться от работы.

83% сотрудников сказали, что ИИ увеличил их нагрузку.
Не уменьшил - увеличил.

При этом:
- 62% специалистов среднего уровня сообщили о выгорании
- 61% сотрудников начального уровня тоже испытывают выгорание
- среди руководителей это ощущают только 38%

То есть основной удар по нагрузке пришёлся на тех, кто выполняет реальную работу, в то время как руководство видит лишь рост продуктивности в цифрах.

А затем появился эффект ловушки.

Если один сотрудник начинает делать больше благодаря ИИ, остальные чувствуют, что отстают.
Команда начинает работать быстрее.

Никто официально не повышает ожидания.
Но новый темп становится нормой.

То, что ИИ сделал возможным, постепенно становится обязательным.

Исследователи назвали это явление workload creep - ползучее увеличение нагрузки.

Сначала это выглядит как рост продуктивности.
Потом становится новым стандартом.
А затем превращается в выгорание.

ИИ должен был вернуть людям время.
Но вместо этого он забирает ещё больше.

И самое неприятное - люди делают это с собой сами. Добровольно.

https://hbr.org/2026/02/ai-doesnt-reduce-work-it-intensifies-it
1