Compacting conversation...
140 subscribers
381 photos
19 videos
5 files
225 links
Станьте первым спонсором, от $1: https://github.com/sponsors/talkstream

Для связи: @nafigator
Download Telegram
Forwarded from Machinelearning
📌 Dream-RSI: агент улучшает стратегию поиска решений на основе прошлых запусков

Google опубликовала Dream-RSI - надстройку над агентами, которые ищут решения перебором: пишут код, прогоняют его через оценщик и дорабатывают лучшие варианты.

Концепт управляет стратегией исследования, решая, какие варианты развивать, сколько попыток запускать параллельно и когда остановиться. Модель, агент и оценщик при этом не меняются, самосовершенствуется только код стратегии.

🟡Механика

Каждый запуск сохраняется как дерево попыток, где узел хранит версию решения, диагностику и оценку.

Это дерево используется как симулятор - альтернативная стратегия проходит по записанным ветвям в другом порядке, с другой параллельностью и другими точками остановки, а результаты берутся из записей без новых вызовов агента.

Отдельный агент на базе языковой модели несколько раз переписывает код стратегии, каждую версию прогоняют по всем накопленным деревьям, и в следующий раунд уходит лучшая.

Оценка складывается из лучшего найденного результата, штрафа за число попыток и бонуса за параллельность. Прежняя стратегия тоже участвует в отборе, поэтому на записях прошлых запусков новая версия по оценке не уступает старой.

🟡Тесты

В задаче ускорения решателя Lasso версия на Gemini 3.1 Pro снизила среднее время работы на шести отложенных наборах данных с 3587 до 2931 мс и потратила 317 вызовов агента вместо 550.

В математических задачах результат смешанный: в задаче сумм и разностей 1,145427 против 1,143975 у SimpleTES, в упаковке кругов ничья, в неравенстве автокорреляции результат хуже собственной базы.

В третьей серии агент ускорял операции нейросетей на видеокарте из набора KernelBench. Для сети VGG16 и слоя нормализации LayerNorm Dream-RSI достиг той же скорости, что и база, за в 2,43 и 1,79 раза меньшее число попыток.

Для двух связок свёртки с делением и с выбором максимума он при том же числе попыток нашёл код быстрее базового в 2,09 и 1,44 раза.

Пока доступны только статья и страница проекта с интерактивной демонстрацией. 

Код и скрипты
 для воспроизведения Google обещает выложить позже.




🟡Страница проекта
🟡Техотчет
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #RSI #Agents #DreamRSI #Google
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Там Sonnet 5.5 вышла

А ничо тот факт, что он сильнее Opus 5.5 в агентном кодинге?

Чо ваще происходит)
🔥2👀2
Самый простой способ поучаствовать в IPO на самом старте — это официальный кошелёк Walt в телеграме. Который вообще-то Wallet, но сегодня решил переименоваться.

Например, SpaceX дал мне неплохой коэффициент при продаже потом на третий день (более 2х), ну и сейчас Oura собирается. Менее, чем через сутки старт, и потом, как вырастет через 1-2 дня, можно продавать :)

Если затянуть — эта история растянется очень надолго и с более низкими шансами на успех.

Больше всего жду Anthropic. Тоже будет в этом году. На Oura можно потренироваться, пройти там KYC пока, попробовать.
3👍2
Агент r13 сделал два коммита и сейчас гоняет полный Stryker по reconcile.ts и budget.ts, добивая выживших мутантов, но изменения пока не закоммичены.


Лексикон каэш растёт с этим вайбкодингом мама не горюй!

И не надо иностранные языки учить от г-на Альцгеймера. Удобно.
Google прислал рассылку о том, что начислил мне каких-то бонусов (в сумме оказалось на $40 четырьмя транзакциями, я про них не знал), а там что-то прям про вайбкодинг.

Я и нажал.
❤1
Фоновые процессы Bash и PowerShell теперь принудительно завершаются по таймауту (по умолчанию 30 минут, максимум 2 часа), предотвращая зависание «зомби»-задач.


Иногда чейнджлог Claude Code CLI читать всё же полезно. Так я узнал, что caffeinate (он не даёт уснуть ноутбуку) теперь будет убит через два часа. И за автономными сессиями на всю ночь присматривать придётся внимательнее.
👍1
Моим худшим решением последнего времени в инструкциях клода был выбор TDD в качестве техники разработки по-умолчанию. Потому что это нужно далеко не всегда. И это лучший момент для закидывания тапками вайбкодера традиционными кондовыми программистами. Тупанул-с.

Стыдно. Но как дорогой эмпирический урок — очень ценно.
👍2
0,57 — отношение медиан времени поиска Sonnet 5.5 low и Haiku 4.5 в одних волнах; быстрее в 8 парах из 8


Haiku у антропиков всё, больше не нужен (до обновления). Весь его функционал выполняет Sonnet 5.5 low вдвое быстрее.
👍2
Google Blog (unofficial)
Gemini 4 Argon: our next era of frontier intelligence https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
Ну начинается. Добро пожаловать в клуб, Google?

Пока что модель Gemini 4 Argon будет доступна на подписке Ultra. Её обладателей вряд ли много.
😢2👍1
⏺ Должен сообщить о своей ошибке. Удаление старых копий файлов произошло сегодня, а не 15.10, как вы решили.


Наконец-то и со мной это произошло!

Спасибо, что с копиями.
👀1
Я притих, потому что колдую над аналогом ru-text для дизайна.

Как в типичном вайбкодинговом проекте, я не знаю, получится ли нужный мне результат, и как именно он будет выглядеть в финале — иду интуитивно, по опыту, по фактам, по цифрам. Главное, что боязнь чистого листа снята, а дальше вырулим. В основе буквально библии дизайна, также правила в абстракциях от антропологии и физиологии до вполне себе конкретики 2026-го, включая фильтрацию нейрослопа в дизайне.

Дистилляции, дистилляции, упрощения, чистки, гайдлайны... Возможно, в конце вообще будет инструкция, состоящая из простого «42», если вы понимаете, о чём я. Но а пока — горите ж, токены :)

(И работаю, да. Веб-дизайнеры с хорошим вкусом и смелыми намерениями, берегите себя, без вас пока сложно.)
❤7👍2
Делюсь хорошим решением: подпись результата с fable 5.1 max effort (это готовый промпт, если что).

Если в целом ИИ-агенты чаще выполняют работу как бы «под» тобой и их приходится подтаскивать, контролировать и учить, то Fable помогает покрыть слепые для меня зоны. Я отсмотрел презу, она устроила меня целиком, но на подписи нашлись мелочи, за которые я этому проходу благодарен. Это хороший источник возвращаемого опыта из ИИ и реальное делегирование, в том числе проактивного внимания к мелочам.

Пример очень лёгкий, но я всё это просмотрел, внимательно разглядывая, а фейбл — нет:
⏺ Пятый круг Fable не подписал по двум находкам medium, обе в моей зоне:
- сноска слайда 10 после уточнения стала трёхстрочной и подошла к колонтитулу ближе, чем позволяет сетка;
- README в архиве исходника всё ещё говорит «11 слайдов».

Исправляю обе, заодно устаревшие ссылки на нумерацию в концепции и трассировке. Затем выкладываю и отдаю Fable шестой круг уже по текущей версии, где есть и новые слайды 7 и 9.
👍2
Бесплатный совет, повышающий качество жизни: когда коммерческое предложение или презентация готовы, сделайте ещё один проход, отсмотрев его с точки зрения промпта к себе: «как его дополнить или изменить, чтобы я точно получил удовольствие от этой работы».

Вариантов масса. От примитивных, типа умножения ценника, до нематериальной мотивации с дофамином и/или возвращаемым опытом на всех основных этапах. Чувствуете сопротивление — значит, ещё не готово.
❤4👍1
⏺ Гейт умеет краснеть


☺️
👀1
Compacting conversation...
⏺ Гейт умеет краснеть ☺️
Кстати. А когда adult перестал быть двигателем прогресса? Что такое произошло? Или нет?

Где все эти AI-технологии, которые идут впереди проприетарных тяжёлых моделей?..

Секс больше не продаёт? Или что?

Генерёнка есть неплохая, но это же жалкое подобие левой руки, самый кончик айсберга технологий, который может (мог бы) быть использован 🤷‍♂️

Где хотя бы поиск по промптам, где маски, где коррекция моделей, где AR/VR-прорыв?

Может, не туда смотрю? А куда надо? Подскажите, что я пропускаю.

(Картинка с клёвого канала @web1_0.)
💯5
Google Blog (unofficial)
EmbeddingGemma 2: an open, lightweight multimodal embedding model https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
Гугл только что зарелизил EmbeddingGemma 2 — маленькую высокоэффективную модель для офлайн-работы на мобильных устройствах.

На ней можно делать небольшие RAG, работает с 100+ языков, может запускаться на менее чем 200 Мб RAM с квантизацией.

Может быть полезна для интеграции прямо в собственные приложения, которым нужна быстрая работа с признаками ИИ без доступа в интернет.

Анонс модели на сайте гугла — вот. Он настолько свежий, что там даже плеер с ютуба вставлен с косяком :)
❤3🔥2