Big Data AI
18.2K subscribers
1.13K photos
166 videos
19 files
1.13K links
@haarrp - админ

Вопросы с собеседований по Machine Learning, Data Science, Deep Learning и Нейроннным сетям

@data_analysis_ml - анализ данных

@ai_machinelearning_big_data

@itchannels_telegram - важное для программиста

РКН: clck.ru/3Fmqxe
Download Telegram
CAIS и Scale заявили, что Fable 5 теперь автоматизирует 16.1% реальных remote-work проектов. Это примерно в 2 раза выше результата Opus 4.8.

Речь про Remote Labor Index — бенчмарк, который проверяет, может ли AI выполнить оплачиваемую freelance-задачу на уровне, который примет заказчик.

Каждая задача включает бриф, файлы и профессиональный deliverable, с которым сравнивают результат человека.

В новых результатах лидирует Fable 5. Opus 4.8 набрал 8.3%, GPT-5.56.3%.

Да, 16.1% всё ещё означает провал на большинстве задач. Но динамика сильная: когда RLI только запускался, лучший результат был всего 2.5%.

Задачи там не игрушечные: CAD, архитектура, анимация, аудио, анализ данных, веб-приложения. То есть проверяется реальная работа в разных инструментах, а не ответы на текстовые вопросы.

Fable 5 особенно хорошо показал себя в задачах вроде моделирования кольца, анимации и дизайна ванной комнаты.

Есть важный нюанс: автоматический judge в целом неплохо ранжировал модели, но завышал качество GPT-5.5 примерно в 2.9 раза, а Opus 4.8 — примерно в 2.3 раза. Агенты быстро растут, но контроль качества остаётся жёстким ограничением.

Сама модель уже не весь продукт. Прирост идёт от более сильных agent setups: лучшее использование инструментов, полноценные desktop environments, профессиональный софт, длинные запуски и связки worker-critic, где один агент делает задачу, а второй проверяет её как придирчивый заказчик.
👎3
MWS Cloud вошел в топ-3 облачных провайдеров для ИИ

Компания заняла второе место в рейтинге российских GPU-облаков CNews Market, набрав 817 баллов.

При составлении рейтинга оценивались доступность вычислительных ресурсов, скорость развертывания инфраструктуры, технологические возможности платформы, прозрачность биллинга и соответствие требованиям информационной безопасности.

Высокую оценку MWS Cloud получил благодаря сервису MWS GPU, который предоставляет доступ к 13 типам графических ускорителей и более чем 30 видам процессоров на базе современных GPU и управляемой инфраструктуры для ИИ-нагрузок. Провайдер предлагает более 60 готовых конфигураций серверов с возможностью мгновенного запуска и гарантированного резерва мощностей.
Вычислительные ресурсы для ИИ также доступны на собственной платформе MWS Cloud Platform Compute, где доступны виртуальные машины с API, CLI, Terraform и веб-консолью для быстрого развертывания и масштабирования нагрузок.

Экосистема MWS включает инструменты для работы с LLM, речевую аналитику и ML-платформу для обучения и запуска моделей.
😁2
🇨🇳 Плохие новости для open-source AI: доступ к frontier-моделям может перестать быть глобальным.

Китай готовит ограничения для иностранных пользователей на свои самые сильные AI-модели. Это может поднять стоимость AI по всему миру и расколоть рынок моделей по национальному признаку.

Пекин уже обсуждал этот вопрос с Alibaba, ByteDance и Z.ai. Речь идёт о том, чтобы удерживать продвинутые китайские модели внутри страны, включая те, которые ещё даже не вышли.

Обсуждения вело Министерство коммерции Китая, а также участвовало государственное агентство по планированию. Это больше похоже не на обычное регулирование платформ, а на будущий экспортный контроль.

Под ограничения могут попасть не только закрытые модели, но и open-weight системы. То есть проблема не только в API-доступе, но и в возможности скачивать сильные модели.

Китайские чиновники также обсуждали идею считать утечки или кражу проприетарного AI вопросом национальной безопасности, а не просто спором об интеллектуальной собственности.

Ещё один слой — возможные ограничения на то, кто сможет финансировать китайские AI-стартапы. Так Пекин может одновременно контролировать капитал, таланты и доступ к моделям.

Для зарубежных компаний это риск: они могут потерять доступ к дешёвым китайским моделям как раз в момент, когда эти модели стали достаточно сильными для реального production.

США уже ограничивают доступ к продвинутым американским моделям по соображениям безопасности. Китай теперь тоже опасается, что модели вроде Mythos могут искать уязвимости в софте и использоваться против китайских интересов.

Обе стороны всё чаще относятся к AI как к стратегической инфраструктуре.

Пекин также проверял китайские AI-стартапы, которые переезжали за границу, и, по данным Reuters, давил на Meta, чтобы та свернула сделку с Manus на $2 млрд.

Вероятный сценарий - многоуровневый контроль: базовые open tools проходят регистрацию, более сильные системы идут на проверку, а frontier-модели остаются внутри страны.

Для открытого AI это серьёзный удар. Прогресс моделей может больше не распространяться просто через качество продукта и цену.

Reuters
🙈32👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Восточная горнорудная компания сделала AI-платформу, которая в реальном времени балансирует парк из 350 карьерных самосвалов.

А теперь с тем же подходом: «сначала продукт, потом вакансия», компания меняет представления о найме в тяжелой индустрии. Проект «Дивизион Марс» выглядит как серия трейлеров к фантастическому фильму. Но это реальная работа.

Без привычного «требуется специалист с опытом от 3 лет». Сначала — концепт и масштаб задачи, конкретные направления и позиции — чуть позже.

Сейчас можно оставить заявку на интерес первым по ссылке.
3👍2
Microsoft подняла точность ChatGPT с 41% до 80%, не меняя ни одного параметра модели.

Система называется SkillOpt.

Обычно все думают, что AI-агенты становятся лучше через промпты или fine-tuning.

Но fine-tuning дорогой, медленный и жёсткий.

А “prompt engineering” часто превращается в угадайку.

Подход Microsoft другой: они оптимизируют не модель, а skill-документ.

То есть текстовую инструкцию, которая объясняет агенту, как решать задачу.

SkillOpt делает этот документ живым: он учится на ошибках агента.

Как это работает:

1. Агент выполняет задачи и собирает успешные и провальные попытки.

2. Отдельная маленькая модель анализирует результаты и точечно меняет skill-документ: добавить, удалить или заменить фрагмент.

3. Новая версия принимается только если реально улучшает результат на отдельном наборе задач.

По сути, это что-то вроде градиентного спуска для естественного языка.

Результаты сильные:

на шести крупных бенчмарках SkillOpt обошёл и человеческие skills, и одноразовые LLM-подходы.

На ALFWorld одна модель выросла с 70% до 85% точности.

В чат-сценариях прирост был больше 23 пунктов.

Главный плюс: нет лишней нагрузки во время инференса.

Ты один раз тратишь compute на оптимизацию skill-документа, а потом агент работает с уже улучшенной инструкцией.

Идея мощная: агент становится лучше не потому, что ты переписываешь код или дообучаешь модель.

А потому что его “плейбук” сам улучшается через обратную связь.

arxiv.org/pdf/2605.23904
5👍2🔥2🤔2
Отличная новость.

Anthropic продлила доступ к Claude Fable 5 для платных пользователей до 12 июля.

Старое ограничение остаётся: Fable 5 может использовать только 50% вашего недельного лимита Claude.

Сам недельный лимит — это внутренний usage budget, который не показывается напрямую. Длинные чаты, файлы, инструменты и более тяжёлые модели расходуют его быстрее.
💩2🦄2
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ Власти США сняли ограничения на релиз GPT-5.6

Министерство торговли США разрешило полномасштабный релиз GPT-5.6. OpenAI планирует открыть доступ к модели в ближайшие дни. Ранее развертывание допускалось только поэтапно для предварительно одобренных правительством организаций.

Ограничения сняли после тестирования системы в Институте безопасности ИИ и очных консультаций технической команды OpenAI с регулятором в Вашингтоне.

Сейчас допуски для крупных LLM согласовываются в ручном режиме. По заявлению OpenAI, фрагментированный доступ стал вынужденной мерой, так как единых стандартов в отрасли нет, а требования безопасности из последнего указа администрации США еще дорабатываются.
axios.com

✔️ xAI выпустила Grok 4.5

Новая модель позиционируется как инструмент для кодинга и агентнтых задач. Продукт создавался совместно с командой Cursor, который в июне перешел под контроль SpaceX.

В Terminal Bench 2.1 Grok 4.5 почти сравнялся с GPT-5.5 и на один балл отстал от Fable 5. При этом в DeepSWE 1.1 модель уступает лидерам в решении задач из GitHub-репозиториев.

Стоимость API - $2 за 1 млн входных токенов и $6 за 1 млн выходных. По заявлению создателей, в SWE Bench Pro модель тратит в 4,2 раза меньше токенов по сравнению с Opus 4.8. Скорость генерации достигает 80 токенов в секунду.

Grok 4.5 доступна в консоли xAI, среде Grok Build и редакторе Cursor. Выпущены официальные плагины для Word, PowerPoint и Excel. Релиз в странах Евросоюза отложен до середины июля.
x.ai

✔️ Mistral анонсировала навигационную модель для роботов

Французский стартап представил 8-миллиардную модель Robostral Navigate для пространственной ориентации роботов. Система использует только данные с одной RGB-камеры, полностью обходясь без лидаров и дополнительных датчиков.

Во время инференса модель покадрово рассчитывает следующий шаг по изображению. Если цель пропадает из поля зрения, алгоритм задействует базовые двигательные команды для смены ракурса и поиска.

По данным Mistral, результат тестов превосходит метрики как других монокамерных решений, так и мультисенсорных систем, а Эксперименты с RL-дообучением уже дали прирост общей эффективности на 3,2%.

Модель применима для колесных платформ, шагающих роботов и дронов. Сроки релиза и формат распространения весов пока не раскрываются.
mistral.ai

✔️ MiniMax обучает крупнейшую в Китае модель

Стартап готовит к релизу в 3-м квартале откытую модель на 2,7 трлн параметров. По данным источников, рабочее название проекта - M3 Pro.

Архитектуру масштабировали для улучшения логического вывода и точного выполнения многошаговых инструкций. Текущий флагман разработчика, модель M3, насчитывает 428 млрд параметров.

Выпуском открытой модели такого объема MiniMax планирует усилить позиции на рынке и составить конкуренцию локальным Zhipu, DeepSeek и Moonshot AI.
theinformation.com

✔️ ИИ-компании оккупируют центр Нью-Йорка

Anthropic арендовала 16-этажное здание площадью 43 тыс. кв. метров на Манхэттене по адресу Гудзон-стрит, 330. Новая площадка в 30 раз больше текущего нью-йоркского офиса. После переезда компания планирует увеличить местный штат до 1000 человек к концу года.

По данным агентства CBRE, за первый квартал ИИ-компании арендовали в Нью-Йорке 96 тыс кв. метров - это больше, чем за весь прошлый год. Доля ИИ-сектора в объеме технологической аренды города выросла с 20,9% в 2024 году до 56%.

Ранее крупные офисы на Манхэттене сняли OpenAI и Harvey.
nytimes.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2💩21
Amazon Kani для Rust получил академическую статью, принятую на ASE 2026. 🦀

Kani пытается формально доказать корректность Rust-кода математически.

Что умеет:

* доказывать отсутствие panic, overflow и нарушений memory safety
* проверять, что `unsafe`-код действительно безопасен
* гонять 16 000+ harness’ов на каждый commit в Rust standard library
* находить баги, которые раньше не видели в промышленных Rust-проектах

Главное отличие простое:

fuzzing пытается найти баги через множество входных данных.

Kani проверяет свойства кода формально, в рамках заданного harness’а.

Kani интегрирован в CI стандартной библиотеки Rust.

Каждый commit в std проходит формальную проверку.

🔗 arxiv.org/abs/2607.01504
3🔥2
🚨 Grok 4.5 примерно в 17 раз дешевле Opus 4.8 на реальных задачах

Цены:

* Grok 4.5: $2 за input / $6 за output
* Opus 4.8: $5 за input / $25 за output

То есть Grok 4.5 дешевле примерно в 4 раза за токен.

Но важнее другое: для решения той же задачи он тратит в 4,2 раза меньше токенов.

В итоге реальная стоимость выполнения задачи получается примерно в 17 раз ниже.
5🤔2👍1😁1
XQuad - “LLVM” для quadratic optimization на Rust

Интересный проект на стыке Rust, оптимизации и quantum tooling.

Идея такая: вы описываете QUBO, Ising или discrete optimization problem один раз, а потом можете запускать её через разные backend’ы: quantum annealers или классические solver’ы.

Что внутри:

* Rust VM для quadratic models
* Python reference VM
* единая спецификация
* CLI и Python API
* solver adapters, включая D-Wave
* примеры для TSP и MaxCut
* CI-проверка: если Rust VM и Python VM расходятся, сборка падает

github.com/QuipNetwork/xquad
2🤔2👍1
Unsloth выкатили Gemma 4 NVFP4 quants.

Заявка простая: быстрее 4-bit inference на Blackwell GPU без обычного компромисса “сжали, но стало заметно тупее”.

Главные цифры:

* Gemma-4-12B NVFP4 запускается на 11 GB VRAM
* Gemma-4-26B-A4B доходит до 13K tok/s на B200
* NVFP4 даёт до 1.5× ускорения на GPU

NVFP4 - это не просто “ещё один 4-bit формат”. Он заточен под Blackwell и позволяет делать inference быстрее, сохраняя точность лучше, чем грубая квантизация.

Для локального и self-hosted inference это важный сдвиг: больше моделей помещается в память, throughput растёт, стоимость токена падает.

Особенно полезно для тех, кто гоняет много коротких запросов, агентные пайплайны или batch-инференс, где скорость и VRAM решают всё.

Blog: https://unsloth.ai/docs/basics/nvfp4
Gemma NVFP4: https://huggingface.co/collections/unsloth/nvfp4
👍43🔥2
Кто-то разобрал Claude Code почти до винтика

learn-coding-agent - репозиторий для тех, кто хочет понять, как устроены современные coding agents не на уровне промо-страниц, а на уровне архитектуры.

Автор собрал разбор Claude Code по публичным источникам: цикл агента, систему инструментов, разрешения, работу с контекстом, сессии, подпроцессы, MCP, удалённые настройки, телеметрию и скрытые флаги.

Получился не “гайд по использованию”, а карта внутренней логики CLI-агента: как он принимает решение, когда просит разрешение, как вызывает инструменты, как хранит историю и как расширяется через внешние интеграции.

https://github.com/justxor/Claudecourse/
4👍2
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку

В IT прокачивается тот, кто каждый день видит сильные идеи, новые инструменты, реальные задачи, вакансии и разборы.

Окружение решает больше, чем кажется.

Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.

AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: t.me/DevopsDocker
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/java_library
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg

Собеседования и карьера:

DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview

Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy

Полезное сверху:

ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: @courses
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy

Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg

Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.

Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.
2🔥2👍1
Полностью локальная мультимодальная модель для GPU с 8 ГБ памяти

Модель запускается на локальном компьютере, понимает изображения и подходит для создания ИИ-агентов.

Возможности

- fine-tuning на Hermes V3
- оптимизация под агентные сценарии
- анализ изображений
- рабочий function calling
- готовые версии GGUF и mmproj
- минимум встроенных ограничений и отказов
- запуск на видеокартах с 8 ГБ VRAM

Хороший вариант для локальных агентов, которым нужно анализировать изображения, работать с интерфейсами и вызывать внешние инструменты без облачного API.

Модель с отключёнными ограничениями лучше запускать в изолированной среде без доступа к важным файлам, ключам и системным командам.

https://huggingface.co/LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
🔥6👎31👍1
Forwarded from Machinelearning
🚀 Qwen3.8 скоро выйдет в open-weight

Новая модель Alibaba получит 2,4 трлн параметров. Разработчики называют её одной из самых мощных моделей на рынке и ставят рядом с ведущими frontier-моделями.

Предварительную версию Qwen3.8-Max-Preview уже можно протестировать через Alibaba Token Plan, Qoder и QoderWork.

Полный релиз и открытые веса обещают в ближайшее время.

Token Plan:

- Международная версия: https://www.qwencloud.com/pricing/token-plan
- Китай: https://platform.qianwenai.com/pricing/token-plan

#AI #LLM #Qwen #OpenWeight
2🔥2👍1
Команда GigaChat зовёт на вечеринку для AI-разработчиков и исследователей 🎉

29 июля, Сбер.Среда, пространство «Оригинал» (м. «Курская», ул. Земляной Вал, 9А)

Без докладов, презентаций и официальных дискуссий – только общение с коллегами по индустрии, обсуждение рабочих задач и болей, новые знакомства и летний вечер на веранде.

Регистрация и подробности

Надеемся на хорошую погоду 🥳
До встречи!
1
Media is too big
VIEW IN TELEGRAM
Дарио: «МАСШТАБИРОВАНИЕ МОДЕЛЕЙ С ОТКРЫТЫМ ИСХОДНЫМ КОДОМ ИДЁТ ПО ОЧЕНЬ ОПАСНОМУ ПУТИ».

Это стоит пересмотреть ещё раз.

Доступ к открытым моделям без ограничений будут терпеть лишь до тех пор, пока они недостаточно умны, чтобы угрожать закрытым ИИ-компаниям.
😁10🤡3🥱2
— Мам, а почему мы стали такими бедными?

— Потому что у твоего отца были Claude Max, Cursor Pro и Grok 4.5, а в итоге он так ничего и не выпустил.
😁18🙈9💯5
🔥 Tree-sitter переписали с C на Rust с помощью ИИ и ускорили почти на 30%

Автор ast-grep поручил ChatGPT переписать ядро Tree-sitter на Rust, сохранив совместимость с существующими сгенерированными парсерами.

Результат:

• raw parsing: +29,74% throughput
• обход дерева: +10,16%
• полный ast-grep: примерно 22% меньше CPU-времени
• существующие grammar/parser-артефакты остались совместимыми

Но самое интересное началось после первых бенчмарков: сам ast-grep сначала стал медленнее, хотя парсер уже работал быстрее.

Причина оказалась в архитектуре и работе с памятью. Первую пачку AI-оптимизаций вообще пришлось откатить: код стал плохо читаемым и начал ловить segfault'ы.

После этого подход поменяли: сначала упростили runtime, убрали ненужные для ast-grep части incremental parsing, переработали аллокации и структуры данных, а уже потом снова занялись производительностью.


🔗 https://astgrep.com/blog/tree-sitter-rust-rewrite
🔥43👍3
🔥 За одну неделю вышло сразу 6 интересных open-weight моделей

Пока все ждут веса Kimi K3 и Ling 3.0, Sebastian Raschka обновил свою LLM Architecture Gallery свежими релизами. И там есть несколько необычных решений.

1. Nanbeige 4.2 3B
Берёт один стек из 22 Transformer-блоков и прогоняет его дважды. Получается эффективная глубина 44 блока без удвоения весов: больше compute, но почти тот же parameter footprint.

2. Laguna S 2.1
118B MoE, всего 8B активных параметров и контекст 1M токенов. Poolside позиционирует её для долгих coding-agent задач, причём модель помещается на одном DGX Spark.

3. Motif 3 Beta
314B-A13B MoE с новой Grouped Differential Latent Attention: latent-compression внимания дополняется группировкой heads и механизмом подавления «шума».

4. Solar Open 2
250B-A15B от Upstage. Архитектура чередует 3 linear-attention слоя и 1 GQA, что помогает довести контекст до 1M токенов.

5. Antares 1B
Маленькая security-модель Cisco на базе Granite 4.0. Её дообучили через SFT + GRPO для поиска уязвимых участков кода через терминал. Хороший пример того, насколько далеко можно увести специализированную модель всего на 1B параметров.

6. BTL-3
Всего лишь rank-32 LoRA поверх Qwen3.6-27B, заточенная под coding agents и structured tool calling. Авторы заявляют 88,5% на BFCL v4 AST и 95,12% HumanEval pass@1.

Open-weight экосистема сейчас интересна именно разнообразием архитектур: looped transformers, sparse MoE, linear attention, специализированные SLM и обычные LoRA-адаптеры развиваются одновременно.

Все схемы и сравнения:
https://sebastianraschka.com/llm-architecture-gallery/

@bigdatai
7🔥2👍1