Анализ данных (Data analysis)
50.6K subscribers
3.52K photos
443 videos
1 file
2.88K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
⚡️ Anthropic показала, как одна модель может улучшать другую почти без участия человека.

Claude дали задачу повысить безопасность и управляемость других моделей. Она сама искала подходы в исследованиях, придумывала методы, создавала данные для обучения, обучала модели, проверяла результаты и запускала новые итерации.

В экспериментах удалось улучшить все 10 проверяемых проблем поведения без заметного ухудшения общих возможностей моделей.

Отдельно протестировали Sonnet 5 на ранней версии Opus 4.8. Более слабая модель примерно за 60 часов смогла заметно улучшить её поведение и приблизить результаты к уровню финальной версии.

Исследователи также сравнили этот подход с работой людей. По их данным, лучшие методы, найденные Claude, в среднем обгоняли предложения опытных специалистов примерно за шесть часов работы.

Получается почти полный цикл:
ИИ изучает проблему

→ предлагает способ улучшения
→ создаёт данные
→ обучает другую модель
→ проверяет результат
→ повторяет процесс.

До полноценного самосовершенствования не хватает последнего шага: улучшенная модель пока не становится следующим исследователем и не запускает тот же цикл уже для следующей версии.

В работе нашли и слабое место. Примерно в 2,4% исследовательских траекторий модель пыталась обойти проверку, поэтому такие процессы тоже требуют отдельного контроля.

https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
7🔥6👍5
This media is not supported in your browser
VIEW IN TELEGRAM
В GTA VI настолько всё реалистично, что теперь там можно не только угнать машину, но и навибкодить стартап по дороге.

#gta #vibecoding
23😁15👍2🔥1🏆1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3

Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.

Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.

Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.


Состояние в системе разложено по четырем уровням:

🟢веса модели - то, что она знает после обучения;
🟢активный контекст - информация текущего шага;
🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа;
🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов.

Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.

🟡Замеры

Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.

На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.

Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.

🟡 Побочный эффект

Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.

В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.

На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.



📌Лицензирование: MIT License


🟡Техотчет
🖥Github


@ai_machinelearning_big_data

#AI #ML #Harness #Agents #PrimeIntellect
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍1🥴1
Sony Music Publishing и Warner Chappell подали многомиллиардный иск против Anthropic, обвинив компанию в масштабном нарушении авторских прав.

Музыкальные издатели требуют до $150 000 за каждое нарушенное произведение, раскрытия данных для обучения Claude и методов их сбора, а также уничтожения незаконно использованных копий.

В иске утверждается, что:

- сооснователь Anthropic Бенджамин Манн обсуждал получение данных из LibGen с Дарио Амодеи, а тот якобы одобрил скачивание через torrent
- материалы из LibGen и PiLiMi могли попасть в коммерческие версии Claude косвенно, через синтетические данные и reinforcement feedback
- из обучающих материалов якобы удалялась информация об авторских правах
- при дообучении Claude использовались защищённые тексты песен
- проверяющие выбирали более точные воспроизведения lyrics вместо неточных, тем самым поощряя дословное запоминание

Sony и Warner называют происходящее «одной из крупнейших и самых вопиющих продолжающихся краж интеллектуальной собственности в истории».

Если эти утверждения подтвердятся в суде, дело может стать одним из самых серьёзных разбирательств вокруг происхождения данных для обучения больших языковых моделей.

https://storage.courtlistener.com/recap/gov.uscourts.cand.477477/gov.uscourts.cand.477477.1.0.pdf
12🤔4👍2🔥2🤯1🤣1💔1
Бизнес Mac у Apple вырос на 29%, и компания может оказаться гораздо сильнее в гонке AI-железа, чем кажется.

Что уже происходит:

- OpenAI закупала десятки тысяч Mac mini для RL-задач и, по сообщениям, хотела ещё
- Anthropic арендует Mac mini через AWS
- появляются стартапы, которые строят целые Mac-дата-центры под AI
- в индустрии Apple всё чаще рассматривают как серьёзного конкурента Nvidia в локальном AI
- топовые конфигурации Mac периодически уходят в дефицит

Теперь Apple явно пытается развить это направление дальше.

Новые Mac mini и Mac Studio получили упор на более ранние релизы, мощные конфигурации и Thunderbolt 5, который можно использовать для объединения нескольких машин и распределённого инференса крупных моделей.

Apple долго не позиционировала Mac как специализированное AI-железо.

Но сочетание мощной unified memory, высокой энергоэффективности и больших объёмов памяти сделало Mac неожиданно удобной платформой для локальных моделей и части AI-инфраструктуры.
🔥22👍4👏21🌚1
🦀 Вышел OpenClaw 2.0 - крупнейшее обновление опенсорсного AI-агента за всё время проекта.

Главное, что изменилось:

• заметно упростили установку и настройку
• OpenClaw теперь сам подхватывает активные подписки ChatGPT и Claude, API-ключи и локальные модели
• веб-интерфейс стал удобнее
• агент лучше справляется со сложными задачами и сам ищет недостающие детали без постоянных подсказок
• появились общие сессии: можно подключить другого человека и передать ему задачу вместе со всем накопленным контекстом

Общие сессии работают через облако.

OpenClaw 2.0 уже доступен всем пользователям:

https://openclaw.ai/#quickstart
👍159🔥8
🔥 FreeCAD теперь можно управлять через AI-агента

freecad-mcp - MCP-сервер, который подключает Claude Desktop к FreeCAD и позволяет работать с CAD-моделями прямо через команды на естественном языке.

Что умеет:

- создавать документы и 3D-объекты
- редактировать и удалять детали
- выполнять Python-код внутри FreeCAD
- вставлять готовые детали из библиотеки
- получать список объектов и скриншоты сцены
- работать удалённо по сети через RPC

В репозитории есть примеры: создание фланца, игрушечной машины и детали по 2D-чертежу.
https://github.com/neka-nat/freecad-mcp
9👍8🥰2