Compacting conversation...
Шо там гугл. Проснулся-потянулся? Возможно, продажи унылого по железу 11-го пикселя скоро подрастут, если всё это дело будет мощно интегрироваться в их мобилы эксклюзивно (хотя бы быстрее прочих). Gemini 4 Pro слишком уж сильно впереди лучших на сегодня.…
Google его agy сделал, конечно, запредельно быстрым, но это Flash, он таким является по-умолчанию.
Если Gemini 4 Pro сможет координировать агентов и держать длинные сессии, то это будет просто замечательно.
Точно стоит экспериментов.
(Все прошлые разы был разочарован, если что.)
Если Gemini 4 Pro сможет координировать агентов и держать длинные сессии, то это будет просто замечательно.
Точно стоит экспериментов.
(Все прошлые разы был разочарован, если что.)
❤1👍1
Forwarded from Machinelearning
Google опубликовала Dream-RSI - надстройку над агентами, которые ищут решения перебором: пишут код, прогоняют его через оценщик и дорабатывают лучшие варианты.
Концепт управляет стратегией исследования, решая, какие варианты развивать, сколько попыток запускать параллельно и когда остановиться. Модель, агент и оценщик при этом не меняются, самосовершенствуется только код стратегии.
Каждый запуск сохраняется как дерево попыток, где узел хранит версию решения, диагностику и оценку.
Это дерево используется как симулятор - альтернативная стратегия проходит по записанным ветвям в другом порядке, с другой параллельностью и другими точками остановки, а результаты берутся из записей без новых вызовов агента.
Отдельный агент на базе языковой модели несколько раз переписывает код стратегии, каждую версию прогоняют по всем накопленным деревьям, и в следующий раунд уходит лучшая.
Оценка складывается из лучшего найденного результата, штрафа за число попыток и бонуса за параллельность. Прежняя стратегия тоже участвует в отборе, поэтому на записях прошлых запусков новая версия по оценке не уступает старой.
В задаче ускорения решателя Lasso версия на Gemini 3.1 Pro снизила среднее время работы на шести отложенных наборах данных с 3587 до 2931 мс и потратила 317 вызовов агента вместо 550.
В математических задачах результат смешанный: в задаче сумм и разностей 1,145427 против 1,143975 у SimpleTES, в упаковке кругов ничья, в неравенстве автокорреляции результат хуже собственной базы.
В третьей серии агент ускорял операции нейросетей на видеокарте из набора KernelBench. Для сети VGG16 и слоя нормализации LayerNorm Dream-RSI достиг той же скорости, что и база, за в 2,43 и 1,79 раза меньшее число попыток.
Для двух связок свёртки с делением и с выбором максимума он при том же числе попыток нашёл код быстрее базового в 2,09 и 1,44 раза.
Пока доступны только статья и страница проекта с интерактивной демонстрацией.
Код и скрипты для воспроизведения Google обещает выложить позже.
@ai_machinelearning_big_data
#AI #ML #RSI #Agents #DreamRSI #Google
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Machinelearning
Прикиньте, вот это всё между собой и с новыми моделями Google скрестится?
Воот.
Воот.
👀1
Forwarded from Уставший техдир
Там Sonnet 5.5 вышла
А ничо тот факт, что он сильнее Opus 5.5 в агентном кодинге?
Чо ваще происходит)
А ничо тот факт, что он сильнее Opus 5.5 в агентном кодинге?
Чо ваще происходит)
🔥2👀2
Самый простой способ поучаствовать в IPO на самом старте — это официальный кошелёк Walt в телеграме. Который вообще-то Wallet, но сегодня решил переименоваться.
Например, SpaceX дал мне неплохой коэффициент при продаже потом на третий день (более 2х), ну и сейчас Oura собирается. Менее, чем через сутки старт, и потом, как вырастет через 1-2 дня, можно продавать :)
Если затянуть — эта история растянется очень надолго и с более низкими шансами на успех.
Больше всего жду Anthropic. Тоже будет в этом году. На Oura можно потренироваться, пройти там KYC пока, попробовать.
Например, SpaceX дал мне неплохой коэффициент при продаже потом на третий день (более 2х), ну и сейчас Oura собирается. Менее, чем через сутки старт, и потом, как вырастет через 1-2 дня, можно продавать :)
Если затянуть — эта история растянется очень надолго и с более низкими шансами на успех.
Больше всего жду Anthropic. Тоже будет в этом году. На Oura можно потренироваться, пройти там KYC пока, попробовать.
3👍2
Агент r13 сделал два коммита и сейчас гоняет полный Stryker по reconcile.ts и budget.ts, добивая выживших мутантов, но изменения пока не закоммичены.
Лексикон каэш растёт с этим вайбкодингом мама не горюй!
И не надо иностранные языки учить от г-на Альцгеймера. Удобно.
Google прислал рассылку о том, что начислил мне каких-то бонусов (в сумме оказалось на $40 четырьмя транзакциями, я про них не знал), а там что-то прям про вайбкодинг.
Я и нажал.
Я и нажал.
❤1
Фоновые процессы Bash и PowerShell теперь принудительно завершаются по таймауту (по умолчанию 30 минут, максимум 2 часа), предотвращая зависание «зомби»-задач.
Иногда чейнджлог Claude Code CLI читать всё же полезно. Так я узнал, что caffeinate (он не даёт уснуть ноутбуку) теперь будет убит через два часа. И за автономными сессиями на всю ночь присматривать придётся внимательнее.
👍1
Моим худшим решением последнего времени в инструкциях клода был выбор TDD в качестве техники разработки по-умолчанию. Потому что это нужно далеко не всегда. И это лучший момент для закидывания тапками вайбкодера традиционными кондовыми программистами. Тупанул-с.
Стыдно. Но как дорогой эмпирический урок — очень ценно.
Стыдно. Но как дорогой эмпирический урок — очень ценно.
👍1