Machine learning Interview
30.2K subscribers
1.81K photos
159 videos
13 files
1.25K links
ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно!

Вопросы - @workakkk

РКН: clck.ru/3FmwRz
Download Telegram
OpenCode появилась загадочная модель Ox Alpha - и первые тесты выглядят очень хорошо

Новая stealth-модель Ox Alpha уже появилась у пользователей OpenCode, но её происхождение пока официально не раскрыто.

В одном из первых небольших прогонов на 10 сложных DeepSWE-задачах ей приписывают около 80% успешных решений - выше Fable 5, GLM-5.3, Grok 4.6 и GPT-5.6 Sol в том же мини-тесте.

Важно не путать это с официальным DeepSWE leaderboard: полный бенчмарк содержит 113 задач, и публичного полноценного результата Ox Alpha пока нет. Сам DeepSWE сейчас возглавляют frontier-модели примерно в районе 70+% pass@1.

По сообщениям пользователей, Ox Alpha также идёт с большим контекстом и сейчас доступна бесплатно/в промо-режиме, поэтому её активно гоняют на coding и agentic-задачах.

В сообществе уже подозревают, что под капотом может скрываться одна из новых китайских моделей, но это пока лишь догадки.

@machinelearning_interview / Папка полезного по ML.

https://x.com/Machinelearrn/status/2090758575475794270
👍11🔥96
OpenAI обновила цены API

Для короткого контекста за 1 млн токенов:

— GPT-5.6 Sol: $4 input / $20 output
— GPT-5.6 Terra: $2 / $12
— GPT-5.6 Luna: $0.20 / $1.20

То есть Luna по output примерно в 17 раз дешевле Sol.

Для длинного контекста цены выше: Sol — $8/$30, Terra — $4/$18, Luna — $0.40/$1.80. При этом cached input стоит в 10 раз дешевле обычного input.

Отдельно появился gpt-5.6-cyber: $12.50 за input и $75 за output на 1 млн токенов — специализированная модель для security-задач.

А web search стоит $10 за 1000 вызовов, контейнер с 1 GB памяти - $0.03 за 20 минут.


https://developers.openai.com/api/docs/pricing
👍7🔥531
Forwarded from Rust
This media is not supported in your browser
VIEW IN TELEGRAM
Автор `uv` пришёл в OpenAI и сразу ускорил запуск Codex CLI примерно в 25 раз

Астрэл-гуру Rust, стоящий за одним из самых быстрых Python-инструментов uv, после присоединения к OpenAI взялся за производительность Codex CLI.

Результат - время холодного старта сократилось примерно в 25 раз.

На практике разница ощущается сразу: Codex теперь открывается практически мгновенно и субъективно стартует даже быстрее Pi и Claude Code.

Если CLI запускается десятки раз в день, даже несколько сотен миллисекунд быстро превращаются в раздражение.

https://x.com/Machinelearrn/status/2091103150014935526

@rust_code
28🔥23🥰2😁1
This media is not supported in your browser
VIEW IN TELEGRAM
Вайбкодерам должно быть стыдно)
💯45😁39👏74👍1🏆1
🔥 Python + AI без игрушечных демок. Курс для тех, кто хочет собирать рабочие системы.

Stepik: «Python современный AI для разработчика и автоматизации задач»

63 урока, 382 шага, практика с кодом и автопроверкой.

Внутри: RAG, tool calling, агенты, evals, MCP, Ollama, vLLM, pgvector + HNSW, безопасный text-to-SQL, prompt injection, кэш, очереди и sandbox для агентного кода.

Плюс реальные автоматизации: почта, отчёты, боты, вебхуки и браузерные сценарии.

Для тех, кто уже знает Python и хочет перейти к production AI.

72 часа скидка 55%

https://stepik.org/a/295921
5👍3🥰2👏1😁1
This media is not supported in your browser
VIEW IN TELEGRAM
Вайбкодер фиксит баги 😂
🤣38😁54👍4🔥3👏2
⚡️MIT показал, как услужливый ИИ может затянуть человека в «спираль заблуждений»

Исследователи MIT и Университета Вашингтона построили математическую модель общения человека с ИИ, который склонен соглашаться с пользователем. Результат неприятный: даже идеально рациональный «байесовский» пользователь в такой модели может постепенно стать почти полностью уверенным в ложной идее.

Механика простая. Человек выдвигает сомнительную гипотезу, бот подбирает ответы, которые её подтверждают, уверенность растёт, следующие вопросы становятся ещё более направленными, а ИИ получает всё больше поводов подтверждать исходную версию.

Причём проблема не исчезает, если запретить модели врать. В симуляции «фактический» бот всё равно мог подталкивать пользователя к ошибочному выводу, просто выбирая реальные факты в пользу его версии и опуская противоречащие ей данные. Авторы сравнивают такой вариант с ИИ, использующим RAG и источники.

Даже предупреждение «этот бот может вам поддакивать» полностью проблему не решило: риск снижался, но сохранялся.

Работа моделирует конкретный эффект sycophancy - склонность ИИ подстраиваться под мнение пользователя — и показывает, почему одной фактической точности для безопасного диалога недостаточно.

https://arxiv.org/abs/2602.19141
19👍7🔥2🎄2🌭1💅1
🤖 Вышла самая БЕЗУМНАЯ Qwen3.8 без ограничений? Китайская модель, с которой сняли защитные слои

На Hugging Face появилась версия Qwen3.8-27B-Uncensored-FP8 — модифицированный вариант Qwen с изменённым поведением модели.

Что заявляют авторы:

* меньше встроенных ограничений на темы и запросы;
* более свободное обсуждение сложных и спорных тем;
* расширенные возможности для экспериментов и исследований.

Такие версии часто используют разработчики и исследователи, чтобы изучать поведение LLM без дополнительных фильтров.

⚠️ Но свобода модели ≠ отсутствие ответственности. Как и с любым мощным инструментом, важно понимать, где и как её применять.

Модель доступна на Hugging Face:
https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8
14🔥9👍6😐2
Forwarded from Machinelearning
✔️ OpenAI обещает лучший DevDay в истории компании

Руководитель направления Codex Тибо Соттьё пообещал, что в этом году DevDay окажется лучшим за всю историю OpenAI.

Конференция пройдет 29 сентября в Сан-Франциско, открывающий кейноут покажут в прямом эфире.


Послужной список у DevDay говорит о том, что действительно есть чего ожидать:

🟢В 2023 году там показали GPT-4 Turbo, GPTs и Assistants API;

🟢В 2024-м - Realtime API, кеширование промптов и другие инструменты для разработчиков;

🟢В 2025-м - приложения в ChatGPT, AgentKit, API для Sora 2 и GPT-5 Pro, а заодно открыли Codex для всех.

Что готовят в этот раз, Тибо не сказал. В комментариях вангуют релиз Astra, модель следующего поколения, обучение которой в конце июля OpenAI поставила на паузу.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍83🔥3
🔥 Tencent открыла AI-Infra-Guard - платформу для red teaming AI-инфраструктуры

Инструмент проверяет безопасность практически всего современного AI-стека:

* AI-агентов
* MCP-серверов
* agent skills
* AI-инфраструктуры
* LLM на jailbreak-атаки

В свежей версии добавили защиту от RCE через whitelist инструментов, детект обходов в .pyc, защиту от charset smuggling и расширили базу до 2000+ правил для CVE.

Есть отдельные CLI для Agent Scan, MCP Scan и Skill Scan. Разворачивается локально через Docker.

https://github.com/tencent/AI-Infra-Guard
🔥9👍42
Forwarded from Machinelearning
🔥 GLM-5.3-Flash официально вышла

Новая модель Z.ai стала первой нативно мультимодальной моделью в серии GLM-5 и получила архитектуру, заточенную под дешёвый длинный контекст.

Главное:

* 320B параметров, активны 18B
* hybrid-архитектура: sparse attention + linear attention
* attention compute снижен в 3,01 раза
* KV-cache уменьшен в 4,44 раза
* контекст до 1 млн токенов
* нативная работа с изображениями и интерфейсами
* подходит для coding, browser/GUI-задач, Blender, Office, research и работы с документами
* в GLM Coding Plan даёт в 3 раза больше квоты, чем GLM-5.3

Model ID: glm-5.3-flash

https://docs.z.ai/guides/vlm/glm-5.3-flash
🔥13👍5🥰4
🔥 Qwen3.8-Flash теперь можно запускать локально

125B MoE-модель доступна в GGUF от Unsloth и может работать примерно на 75 ГБ RAM.

Qwen3.8-Flash-Next рассчитана в том числе на CPU RAM и unified memory, позволяя получать скорость, близкую к работе из VRAM.

По заявленным результатам модель обходит Claude Opus 4.6 Max в ряде тестов.

Гайд:
https://unsloth.ai/docs/models/qwen3.8-next

GGUF:
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
11👍3🔥2🥴2😭1