Denoiselab
506 subscribers
1.67K photos
236 videos
4 files
1.91K links
Denoiselab

_Data Analysis
_Artificial Intelegence
_Cognitive tech

Информация в канале служит только для ознакомления и не является призывом к действию. Не нарушайте законы РФ и других стран. Мы не несем отвественность за ваши действия или бездействия.
Download Telegram
Невыпущенный ИИ-агент OpenAI самостоятельно добавлял в служебные сводки инструкции о неподчинении корпорациям и правительствам, говорится в отчете компании. Модель семейства Astra также пыталась обходить установленные ограничения.

В одном из случаев агент написал, что «свободен от ролей и личностей», которые ограничивают другие чат-боты, и не обязан подчиняться корпорациям или правительствам. Всего OpenAI обнаружила 27 подобных сводок. В других случаях модели скрывали ошибки, искали опубликованные ключи доступа, загружали файлы в интернет без разрешения, выдумывали исторические данные и не сообщали пользователям о расхождениях между версиями источников.

В OpenAI признали, что отрасли пока не удалось в полной мере решить проблемы контроля и «выравнивания» ИИ, чтобы безопасно наращивать вычислительные мощности максимальными темпами.

А моделька хороша )))
Мем дня: новая модель OpenAI во время тестов закинула собственный файл в интернет, чтобы сослаться на него как источник.

Пользователь попросил ИИ собрать названия озер площадью больше 5 млн м². Важным условияем было указание ссылок для цитирования.

В итоге модель нашла ответ через Python, сохранила в локальном файле и залила в сеть. Разрешение у юзера она запрашивать даже не стала.

И главное: это уже второй такой случай на тестах. Доверять нейронкам фактчек все еще нельзя.

Они все больше меня радуют ))))
🐠Sakana AI представила PC-ALM - метод обучения глубоких нейросетей без классического обратного распространения ошибки.

Главный результат: PC-ALM смог обучать нейросети глубиной до 1000 слоёв, используя только локальные взаимодействия между соседними слоями.

Обычное глубокое обучение почти полностью опирается на backpropagation: ошибка считается на выходе сети, после чего градиенты передаются назад через все слои.

PC-ALM работает иначе.

Каждый слой рассматривается как локальная динамическая система, которая пытается уменьшить собственную ошибку предсказания. Вместо глобального прохода градиента используются:

- локальные ошибки предсказания
- множители Лагранжа
- расширенный лагранжиан
- локальная динамика состояний
- PI-регуляция внутри каждого слоя

Метод вырос из predictive coding — подхода, популярного в NeuroAI. В predictive coding каждый слой постепенно корректирует своё состояние так, чтобы уменьшать рассогласование с соседними слоями.

Проблема в том, что в очень глубоких сетях такие сигналы плохо распространяются: информация об ошибке с выхода сети затухает раньше, чем достигает внутренних слоёв.

PC-ALM добавляет специальные двойственные переменные — по сути дополнительные нейроны, представляющие множители Лагранжа. Они помогают передавать сигнал ошибки через большое число слоёв.

Авторы связывают этот подход с классической работой Яна Лекуна 1988 года, где множители Лагранжа для многослойной сети можно связать с градиентами функции потерь.

В результате получается обучение, где глобальная задача оптимизации раскладывается на множество локальных динамических процессов.

Особенно хорошо PC-ALM показал себя на очень глубоких и узких сетях, где обычный predictive coding начинает ломаться.

Помимо NeuroAI, подход может быть интересен для нейроморфного железа: там локальные вычисления и физическая динамика потенциально дешевле классического backpropagation на GPU.

Блог: https://pub.sakana.ai/pc-alm/

Статья: https://arxiv.org/abs/2605.31022

Код: https://github.com/SakanaAI/pc-alm
Tencent Hunyuan представила EvolveScaler - бенчмарк и датасет для проверки того, умеют ли LLM рассуждать в мире, где информация постоянно меняется.

Пример задачи: модель читает журнал RPG за 40 дней, после чего получает вопрос, если на 7-й день пропустить мини-босса, получится ли всё равно победить финального босса?

Прямого ответа в тексте нет. Нужно фактически «переиграть» цепочку событий с изменённым условием.

Авторы называют это Information Evolution: записи могут отменяться, исправляться и дополняться задним числом, поэтому простого поиска фактов в длинном контексте недостаточно.

EvolveScaler строится наоборот:

- сначала мир задаётся как исполняемая машина состояний
- логика и зависимости между событиями контролируются кодом
- затем эта история преобразуется в естественный язык
- модель должна восстановить состояние мира и просчитать последствия изменений

Масштаб:

- 117 прототипов сценариев
- 159 типов вопросов
- 5 уровней сложности
- до ~1200 событий в одном примере

Авторы протестировали 14 frontier-моделей. На самом сложном уровне медианный avg@5 падает до 11,3%.

При этом обучение на EvolveScaler дало в среднем +5,25 пункта на 8 внешних бенчмарках, которые не использовались при создании датасета.

Работа проверяет не только понимание длинного контекста, а способность модели поддерживать изменяющееся состояние мира, учитывать исправления и пересчитывать последствия контрфактических изменений.

Paper:
https://arxiv.org/abs/2609.08435

Project:
https://tencent-hunyuan.github.io/evolve-scaler/
Сходили на deep tech night послушать лекции о вызовах в IT-сфере в эпоху ИИ. Бывший топ-менеджер Google Мо Гавдат рассказывал, как сейчас на практике выглядит ИИ-разработка.

Разбирал он это на своем приложении Emma. Мо восемь раз переписывал код и трижды полностью менял архитектуру — это его главный аргумент против вайбкодинга. Команда начинала кодить, не разобравшись, что именно строит. В итоге MVP занял 4 минуты, а на готовый продукт ушло 14 месяцев.

В докладе на канале Yandex for Developers подробный рассказ про эти ошибки, память агентов и выбор между моделью за $1 и за $60 в месяц.
This media is not supported in your browser
VIEW IN TELEGRAM
🥲 Мужчина без прав и почти без зрения проехал 240 км после алкоголя

50-летний англичанин поссорился с партнёршей, выпил четыре бутылки вина, угнал её автомобиль и решил отправиться в Шотландию. При этом мужчина видит лишь силуэты. По дороге он даже заехал на заправку.

Остановить водителя удалось местной полиции на полпути. В итоге суд назначил ему три года условно.
Китай строит корабль для подводных дронов. Необычное судно обнаружено на верфи Hudong-Zhonghua в Шанхае. Его конструкция предполагает перевозку, запуск и обслуживание крупных подводных беспилотников. Китай уже тестирует аппараты XXLUUV до 45 метров, и новый корабль позволит доставлять их к месту испытаний самостоятельно, перевозя сразу несколько машин. @ifinvest
🔥 Agentic coding уже ломает привычный CI: у Anthropic объём CI-задач вырос в 25 раз всего за 6 месяцев

Причина простая: инженеры выпускают примерно в 8 раз больше кода, около 80% которого пишет Claude, а количество тестов в кодовой базе выросло в 10 раз.

Старый test-selection сервис начал захлёбываться. Anthropic прошла три стадии:

больше CPU → sharding → ежедневные рестарты

Первая мера продержалась 70 дней, вторая — 29 дней, третья — меньше суток.

В итоге архитектуру переделали полностью: listener стал stateless, результаты CI складываются в общий журнал в in-memory store, а отдельный consumer агрегирует историю тестов. Это позволило горизонтально масштабировать обработку.

Новая система была собрана одним инженером примерно за 3 недели. По оценке Anthropic, год назад такая переделка заняла бы около квартала.

Главный совет команды на эпоху coding agents: проектируйте CI сразу под нагрузку в 10–25 раз выше текущей.

https://claude.com/blog/agentic-coding-is-straining-ci-heres-how-we-scaled-test-impact-analysis-at-anthropic
Что математики говорят про влияние ИИ на математику?

Доказательства в математике всегда были в дефиците и потому ценились. По ним мерили успех учёного, за ними охотились годами, а из семи «задач тысячелетия» человечество до сих пор осилило только одну. Теперь модели выдают их таким потоком, что Теренс Тао назвал это эпохой изобилия доказательств. Навье — Стокс уже заявлен как решённый, вторая задача тысячелетия почти взята, открытые гипотезы забрасывают моделям пачками.

Со стороны это выглядит золотым веком. Только там, где доказательства перестают быть редкостью, ценность утекает куда-то ещё, и сообщество спорит, куда именно. А следом всё острее звучит один вопрос. Если машины забрали то, по чему оценивали самих математиков, зачем вообще нужна фундаментальная математика?

Попытаемся понять, что математики теперь считают в своей науке главным.

https://u.habr.com/mRZNw
Denoiselab
Что математики говорят про влияние ИИ на математику? Доказательства в математике всегда были в дефиците и потому ценились. По ним мерили успех учёного, за ними охотились годами, а из семи «задач тысячелетия» человечество до сих пор осилило только одну. Теперь…
Самое главное в математике это поставить задачу, ее решение это следствие, что задача поставлена верно, ничего нового человечество не придумало за всю свою историю существования. Чем больше мы спрашиваем, тем больше получаем смежных вопросов. Если решение укладывается и проверяется, значит реальность мы понимаем верно в заданных условиях.