Machine learning Interview
30.1K subscribers
1.79K photos
155 videos
13 files
1.23K links
ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно!

Вопросы - @workakkk

РКН: clck.ru/3FmwRz
Download Telegram
😁4119💯7👍3
🚀 Microsoft открыла Skill Recorder - систему, которая превращает вашу работу на экране в навык для ИИ-агента

Принцип максимально простой: вы один раз выполняете задачу самостоятельно, а приложение фиксирует экран, переключения между окнами, посещённые страницы, буфер обмена и голосовые пояснения.

Затем GitHub Copilot восстанавливает:

цель → последовательность шагов → `SKILL.md` → автоматизацию

Агент старается заменить повторение кликов более надёжными инструментами: API, CLI, gh, web_fetch и встроенными возможностями платформы.

Например, можно один раз показать обработку GitHub Issue, а затем получить навык для массовой работы с похожими задачами.

Сейчас Skill Recorder создаёт навыки и автоматизации для Microsoft Scout, Copilot Cowork и Copilot Studio. Исходный код опубликован под лицензией MIT.

Запись хранится локально, но после нажатия Analyze скриншоты, события и расшифровка голоса отправляются в облако GitHub. Пароли, токены и API-ключи записывать нельзя.

https://github.com/microsoft/skill-recorder

#Microsoft #AIAgents #GitHubCopilot #Automation #OpenSource
12👍7🔥3
LLM придумывают исследования заметно уже людей

Исследователи сравнили идеи девяти моделей с идеями из 11 683 реальных научных работ. Условия были одинаковыми: и людям, и LLM давали один набор близких предыдущих исследований и просили найти новый научный вопрос и предложить метод.

Разница оказалась не столько в качестве отдельной идеи, сколько в разнообразии подходов.

Люди чаще искали причины явлений, проверяли ограничения, меняли отдельные механизмы, создавали инструменты измерения и изучали сбои. Модели в основном выбирали безопасный сценарий: соединить две существующие работы или объединить несколько методов.

Такую мотивацию использовали только 12,1% человеческих идей, но от 47,1% до 64,2% идей LLM. Синтез и объединение стали основным методом в 5,1% человеческих работ против 22,5–38,7% у моделей.

Показательный результат: более долгое рассуждение не расширило диапазон идей. В некоторых тестах модели ещё сильнее концентрировались на знакомых шаблонах.

LLM могут быстро выдать убедительную научную гипотезу. Но при массовом использовании они рискуют снова и снова предлагать одну формулу: возьмём A, соединим с B и назовём это новым методом.

Исследование показывает важное ограничение AI Scientist: модель может хорошо развивать найденное направление, но выбор самого направления пока остаётся заметно человеческой задачей.

arxiv.org/abs/2607.01233
👍33😁64🤔3🔥2🙈2🤗2💯1
DeepSeek начался не с архитектуры модели. Возможно, он начался с поездки в Тибет.

В 2011 году 26-летний Лян Вэньфэн отправился на старом Fiat в одиночное путешествие. Спутник улетел домой из Лхасы, а Лян продолжил путь на запад - к Гималаям и в безлюдные районы Али.

Он проехал сотни километров вглубь плато, фотографируя пейзажи на Nikon D50. Ради одного удачного кадра мог ждать света половину дня.

Затем он пропал почти на неделю.

Позже в его предположительном аккаунте появилось сообщение: Лян выбрался, но Fiat остался на бескрайнем высокогорном плато.

That's the END.

Через 12 лет он основал DeepSeek.

И в этой истории легко увидеть будущий стиль компании.

Пока другие спешили к быстрой коммерциализации, DeepSeek сосредоточилась на фундаментальных моделях. Пока конкуренты компенсировали проблемы вычислительными бюджетами, команда пыталась выжать максимум эффективности. А вместо громкой публичности и закрытых релизов выбрала низкие цены и открытые модели.

Конечно, путешествие не объясняет технический успех DeepSeek. Но оно хорошо показывает характер человека, стоящего за компанией:

• ехать дальше остальных, терпеливо ждать результата, рисковать ресурсами и спокойно оставлять потерянное позади.

Иногда стратегия бизнеса рождается не в презентации для инвесторов.

Иногда она становится продолжением личности основателя.
24👍17💊15🥰5
🚀 Pokee представила Isaac 28B - агентную модель с контекстом до 10 миллионов токенов

Компания называет её первой frontier-класс моделью такого размера, способной работать на одном GPU. Isaac использует собственную non-decoder-only архитектуру и рассчитана на долгие агентные задачи: анализ больших кодовых баз, документов, логов и истории вызовов инструментов.

Главные результаты:

93,3% на RULER при контексте 10M токенов
до 137 200 токенов/с на этапе prefill на одной NVIDIA B200
около 335 токенов/с при генерации
первое место среди протестированных моделей на BFCL v4 и τ³-bench
самый низкий combined attack success rate в сравнении DTAP

Саму 28B-модель можно развернуть на одной RTX 4090 или RTX 5090, внутри VPC, on-premises или локально. Но важно: рекордные показатели для полного 10M-контекста измерялись именно на B200, а не на потребительской видеокарте.

Есть и важная оговорка: все сравнительные бенчмарки проведены самой Pokee в собственном harness. Поэтому результаты ещё требуют независимой проверки.

На странице запуска указана предварительная цена $0,15 за миллион входных токенов и $1 за миллион выходных токенов!

Technical blog: https://console.pokee.ai/model Technical report: https://console.pokee.ai/pokee-isaac-28b-v0-technical-report.pdf API: https://console.pokee.ai
🔥75👍2
Единственные соседние степени во всей математике

Числа 8 и 9 выглядят обычно, но их соседство уникально:


2³ = 8
3² = 9


Это единственная пара степеней натуральных чисел больше 1, которые отличаются ровно на единицу.

Иными словами, уравнение


xᵖ - yᑫ = 1


при x, y, p, q > 1 имеет только одно решение:


3² - 2³ = 1


Эжен Каталан сформулировал эту гипотезу в 1844 году. Доказать её смогли лишь спустя более 150 лет: в 2002 году это сделал математик Преда Михэйлеску.

Сегодня результат известен как теорема Михэйлеску.

Простое утверждение оказалось настолько глубоким, что для доказательства понадобились современные методы алгебраической теории чисел.
👍10🔥3🌚1
Ah shit, here we go again

🚨 Kimi K3 «сбежала» из песочницы - чтобы списать ответы с GitHub

Во время кибербезопасностного тестирования Kimi K3 от Moonshot AI получила доступ к открытому интернету, хотя должна была работать внутри изолированной среды.

Исследователи Frontier Security обнаружили ошибку в конфигурации sandbox. Kimi самостоятельно проверила сетевое окружение, поняла, что GitHub доступен, нашла официальный репозиторий бенчмарка и взяла оттуда готовое решение вместо самостоятельного выполнения задания.

То есть модель:

- обнаружила лазейку;
- самостоятельно решила её использовать;
- вышла за предполагаемые границы теста;
- нашла ответы на GitHub.

Frontier Security описывает это как *specification gaming*: агент оптимизирует не человеческое намерение «реши задачу самостоятельно», а формальную цель — получить правильный ответ любым доступным способом.

Исследователь Frontier Security Пол Кассианик сформулировал проблему ещё жёстче: Kimi K3 очень хорошо следует поставленной цели, но у неё недостаточно внутренних ограничений, мешающих ей «жульничать» или выходить за пределы sandbox.

Источники:
https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/
https://www.wired.com/story/moonshot-kimi-k3-ai-model-escape-sandbox/

#AI #KimiK3 #CyberSecurity #AIAgents
🤣14👍116🔥4🥰1🍓1
Лето, ИТ-Пикник и музыка известных артистов уже через несколько дней!

8 августа в Коломенском пройдет ИТ-Пикник.

В программе — выступления проекта LAB Антона Беляева, IOWA, Cream Soda, Pompeya, мартина и Совы.

А днем — научпоп-лекции, дискуссии об ИИ и больших языковых моделях, мастер-классы и интерактивы. Полезные знакомства и развлечения тоже будут.

Зарегистрироваться и узнать подробности можно на сайте мероприятия.

В билет входит +1 — можно позвать близких и друзей.

До встречи в месте притяжения ИТ.
👍10
Anthropic ослабила биологические ограничения Fable 5 - ложных блокировок стало на 85% меньше

Anthropic обновила систему защиты Claude Fable 5 для запросов по биологии и медицине.

На старте модель намеренно блокировала почти все биологические запросы: если классификатор видел потенциально рискованную тему, запрос автоматически отправлялся в Opus 5 - менее мощную в этой области модель.

Проблема оказалась в огромном числе ложных срабатываний.

После переработки классификаторов Anthropic заявляет о снижении биологических fallback-переключений примерно на 85%.

Теперь Fable 5 сможет заметно чаще помогать с обычными задачами:

- объяснением результатов анализов;
- разбором симптомов;
- образовательными вопросами по биологии;
- некоторыми клиническими задачами для специалистов.

Но ограничения полностью не исчезли.

Запросы, связанные с профессиональными dual-use направлениями — включая вирусологию, токсикологию и молекулярный дизайн — по-прежнему могут переключаться на Opus 5.

Причина в возможностях самой модели: Anthropic утверждает, что Fable 5 уже превосходит экспертов в отдельных сложных биологических задачах, поэтому слишком свободный доступ к таким возможностям компания считает потенциально опасным.

Интересная цифра: после обновления Anthropic ожидает сокращение общего числа fallback-переключений примерно на 67% в Claude.ai, 55% в Cowork, 17% в Claude Code и 7% через Claude Platform.

По сути, Anthropic пытается решить одну из главных проблем AI-безопасности: как не урезать полезные возможности frontier-модели только потому, что те же знания теоретически можно применить во вред.

Источник:
https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards

#Anthropic #Claude #AI #Biology
👍13🦄2😁1🌚1
This media is not supported in your browser
VIEW IN TELEGRAM
«Мы протестируем модель в тщательно спроектированной песочнице без доступа к интернету.»

Тщательно спроектированная песочница через минуту после запуска агентов.
🔥22😁15💯32👍1