Технозаметки Малышева
12.9K subscribers
5.39K photos
2.05K videos
43 files
5.36K links
Новости инноваций из мира Искусственного Интеллекта. 🤖 [РКН: 7021469833 ]

Всё об ИИ, ИТ трендах и Технологической Сингулярности.

🤖: @ai_gptfreebot [бесплатный бот]
✍️: @tsingular_bot [каталог ботов и курсов]

💸: https://pay.cloudtips.ru/p/c8960bbb
Download Telegram
Media is too big
VIEW IN TELEGRAM
Мертвые заговорили!

Полный Kling 4.0 выходит в октябре, а Kling 4.0 Flash уже бахнули для подписчиков Ultra Yearly.

Главное:

- до 30 секунд видео одной нативной генерацией вместо прежних 15;
- до 10 keyframes;
- до 15 мультимодальных референсов одновременно - персонажи, предметы, изображения, видео и другие материалы;
- более развитый Omni Reference и редактирование уже существующего видео;
- 4K;
- 10-bit HDR (воще непонятно какой именно);
- улучшенный native stereo audio;
- более точный lip sync;
- video extension;
- больше языков, акцентов и диалектов.

Теперь про Kling 4.0 Flash.

Это облегчённая версия 4.0 для более быстрой генерации. Она уже работает в early access, тогда как полноценный 4.0 появится только в октябре.

Но: Kling пока не опубликовал нормальную официальную таблицу 4.0 vs 4.0 Flash.

Из предварительных материалов и утечек Flash примерно так:

Kling 4.0:
до 30 секунд
до 4K
до 15 референсов
до 10 keyframes
максимальное качество и контроль

Kling 4.0 Flash:
предварительно до 20 секунд
предварительно 720p
часть продвинутых функций может быть урезана

Цена, Карл?

https://kling.ai/release-note/release-notes/Kling_4

@cgevent
🔥8👀3❤2⚡1😈1
This media is not supported in your browser
VIEW IN TELEGRAM
Jev не нужен! NVIDIA с учёными из университета, который с прошлого года запрещено упоминать, выпустила свой аналог Jev

📋 NVIDIA выпустила CLM-8B,- еще одного представителя класса контрастных языковых моделей.
Модель, как и Jev, не пишет ответ по токенам: она превращает текущее состояние и каждый возможный вариант действия в векторы и выбирает самый близкий.
Веса под лицензией Apache 2.0.

⚙️ Как устроено. В основе замороженный Qwen3-8B, поверх которого обучены две проекции примерно по 20 млн параметров, одна для состояний, другая для действий.
Учили в три этапа: 60 млн пар вопрос-ответ Nemotron, 30 млн правдоподобных неверных вариантов, 1 млн траекторий реальных агентов.
В работе модель считает близость состояния и действий и превращает её в вероятности.

📊 Скорость. В игре T-Rex решение занимает всего 16,5 мс против 149,8 мс у закрытой модели Jev, почти в 9 раз быстрее.
В Super Mario 33,5 мс против 132,6 мс.
Векторы действий считаются заранее и лежат в памяти: при смене состояния они не меняются.
На одной RTX 4090 повторный заход в ту же ситуацию падает с 1,7 мс до 0,6 мс, а при тысяче вариантов действий модель обгоняет Jev в 13 раз.

⚖️ Ограничение. Новых действий модель придумать не может, она выбирает только из готового набора.
Схема получается такая: языковая модель порождает варианты, CLM быстро выбирает, агент выполняет.
По точности выигрыш не везде: в вызове инструментов CLM набирает 95,2% против 99,2% у Jev, в WikiRacing решает 26 задач из 30 против 30 из 30.
Быстрее при этом везде.

💼 Зачем бизнесу. Обучаемой части всего около 40 млн параметров, весит она 75 МБ и работает на одной видеокарте. Для агентов, которые много раз выбирают из одного набора действий, это ускоряет работу без переобучения основной модели.

📎 Ссылки:
• Блог проекта
• Веса на Hugging Face
• Код на GitHub

Очень похоже на RSI эксперимент, который мы делали с Гермесом на той неделе, только у меня было 4 разных области задач, - змейка, тетрис, текст и картинки, а тут заточка под 1 задачу, что ещё проще.
потому и скорость выше в 10 раз.

#LLM #агенты #Jev #CLM #NVidia
———
@tsingular
🔥8❤3🆒2⚡1
В рейтинге AA Intelligence Index четыре из пяти самых умных моделей теперь от Claude.

Мало того, Sonnet 5.5 набрал больше баллов, чем Fable 5.1. Похоже, версия Fable, которую Anthropic дистиллирует в Opus и Sonnet, какая-то запредельно сильная.
🔥6❤3⚡3🤯3
а вот кстати вопрос, если Соннет 5.5 прыгнул на первую ступеньку к Опусу 5.5, то до какого уровня поднимется Haiku 5.5, который тоже вот вот выпустят?

неужели младшая модель в линейке Антропика станет в один уровень с GPT-6 Sol или 5.6 Sol?

P.S.: Исходную картинку считаю несправедливой по отношению к Gemini 3.8 flash - она должна быть где-то на S уровне

Будет интересно

#Haiku
———
@tsingular
⚡8🤔5✍3❤1🆒1
Forwarded from AI Projects (Vladimir Ivanov)
Paweł Huryn обновил свой бенчмарк BugHunt. Поскольку Sonnet 5.5 показал отвратительные результаты по стоимости и длительности фиксов, он повторил для него тесты два раза для надёжности — они показали примерно одинаковый результат.

Хотя формально Sonnet 5.5 смог выбить лучший результат — 57 задач из 105, цена несуразная: Sonnet 5.5 в ТРИ (!) раза дороже Opus 5.5 и где-то в ЧЕТЫРЕ (!) раза медленнее как агент из-за перерасхода токенов. Paweł Huryn изучил, почему так произошло, анализом сессии Sonnet 5.5 и обнаружил причину. Для фактической накрутки бенчмарков Дарио обучил LLM совершенно несуразному объёму генерации и проведения очень дорогих «мутационных тестов». Если даже вам такое надо, то это разумно запускать только по вашем указанию агенту, а не по дефолту как делает Sonnet 5.5

На самом деле тут надо понимать, что на тестах провалился и GPT-5.6 Sol как «багфиксер», который аналогично ставит на стратегию перерасхода токенов на тестирование. GPT-5.6 Sol и Sonnet 5.5 — самые отвратительные модели по скорости работы агентов на фиксах. Причём их формальный высокий бенчмарк тут overkill и более-менее адекватен для legacy-лапши-кода. Если разработку ведёт профессионал с агентами, то у него обычно код уже пронизан огромным логированием и уже большой пакет тестов, их писать не нужно агентам заново. В таком случае скорость и цена модели становятся более высоким весом, а такое тестирование, как у GPT-5.6 Sol и Sonnet 5.5, — чистый overkill.

Аналогично на тестах виден провал GPT-5.6 Luna как worker-агента, что объясняет её проигрыш DeepSeek V4.1 на OpenRouter, где пользователи «голосуют кошельками», а «бенчмарк кошельков» пожалуй самый объективный. GPT-5.6 Luna на деле почти в 4 раза медленнее DeepSeek V4.1, ситуация получше у GPT-6 Luna, но она всё равно медленнее и один из самых глупых фиксеров багов.

Самые лучшие фиксеры сложных багов за разумное цену и время — это Opus 5.5 и GPT-6 Astra.

Строго говоря, по рейтингу видно, что для worker-агентов в AI Friendly разработках американцы продолжают проигрывать китайцам. Однако чтобы работать на том же DeepSeek V4.1 с такой же эффективностью, как на Opus 5.5 в фиксах, вам нужно иметь очень хорошо продуманную систему диагностики приложения и в первую очередь развитые AI Friendly логи. Сами автотесты даже тут вторичны, т.к. при более-менее сложных проблемах их роль — наполнить логи. Правда, такие условия будут, если вы сильно вложились в логирование, как я в своей методике GRACE.
https://bughunt.productcompass.pm/?preset=featured&sort=cost_usd&dir=asc
❤9✍2
Forwarded from e/acc
Легендарная штука от Антропика: теперь создание любого приложения или бизнес-процесса это автоматическая оптимизация, а не написание кода промтами.

В ML любая система создается через обозначение количественных метрик (эвалов) и последовательность экспериментов, которые приближают к ним (карабкание по топологическому холму, hillclimb).

Антропик добавил две этих команды (eval и hillclimb) в API Клод-кода, так что теперь вы можете определить цель своего приложения, например, 100% клиентов которые хотят оплатить доходят до конца процесса. Клод будет анализировать тикеты поддержки, логи, трейсы и прочие данные, формировать гипотезы и автоматически создавать изменения, проверяя каждый раз насколько улучшилась метрика.

Именно такой подход автоматической оптимизации это то, что необходимо для создания эффективных software factories, самоуправляемых продуктов и AI-нейтив организаций. Это не делает работу полностью автоматической — скорее, наоборот, ваше участие тут становится только важнее. Но вместо придумывания гипотез или, боже упаси, их реализации, задача владельца продукта или процесса сводится к установлению четких метрик и критериев их достижения, которые нельзя обмануть или оверфитнуть.
👍8❤4⚡2😁1
Forwarded from Machinelearning
🌟 OpenScience: персональный учёный с режимом автономных экспериментов
Стартап Synthetic Sciences из зимнего набора Y Combinator 2026 года вывел на Product Hunt OpenScience – открытую рабочую среду с ИИ-агентом для научных исследований.

Сам агент компания выложила ещё в июле, а главное из обновления – режим Autoresearch, в котором агент без участия человека ставит серию экспериментов и улучшает заданную метрику.


OpenScience ведёт исследование целиком, от обзора литературы и гипотезы до кода, эксперимента, анализа и текста статьи.

Агенту доступны 295 встроенных навыков, от обучения моделей до молекулярной биологии, хемоинформатики и вёрстки в LaTeX, и около сорока научных баз, среди них UniProt, PDB, ChEMBL, PubChem, arXiv и Semantic Scholar.

🟡Механика

В Autoresearch задачу ставят обычными словами, например - снизить функцию потерь на валидационной выборке, остановить работу через час или при выходе метрики на плато и закончить после 20 запусков или 8 часов.

Агент сначала запускает базовый вариант, затем по очереди проверяет идеи, отсортированные по ожидаемой пользе, и по каждому запуску решает, сохранить изменение или откатить.

Чтобы цикл не затроил, после четырёх стартов без прогресса агент переключается на идеи другого типа, плюс каждые шесть запусков пересматривает подход.

Ход работы записывается в файлы с постановкой задачи, очередью идей, таблицей результатов и выводами.

Среда собрана как настольное приложение с деревом файлов, редактором, терминалом и просмотрщиками молекул, структур и геномов.

Модель выбирается, подойдут собственные ключи Anthropic, OpenAI, Google и других провайдеров, вход по подписке ChatGPT или Codex, локальные модели и фирменный сервис Ace.

Эксперименты запускаются локально, по SSH, в кластере под Slurm или PBS или в облаке Modal. Метрики собирает встроенный трекер, скрипты под wandb работают с ним без переделки.

🟡 Тесты

На Terminal-Bench Science агент решил 53 задачи из 70, это 75,7%.

В этом тесте OpenScience управляла GPT-6 Astra с GPT-6 Sol в роли исполнителей, на задачу давали 8 часов и одну попытку.

Лучший результат в таблице Snorkel – 68,1% у Codex с GPT-6 Astra, у Claude Code с Opus 5.5 там 63,3%.


В научной части Terminal-Bench 4.0 агент решил 10 задач из 14 против 60% у Claude Code с Fable 5.1, на BiomniBench-DA набрал 82,2 балла против 81,04 у aipoch.


📌Лицензирование: Apache 2.0


🟡Документация
🟡Бенчмарки
🟡Трассировки
🖥Github


@ai_machinelearning_big_data

#AI #ML #Agents #AiScientist #Bioinformatics #OpenScience
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡8🔥3✍2👍1
Читая старую фантастику 😂
Прям про наш ИИ мир

#юмор
------
@tsingular
😁32✍1⚡1
Решил тут с Opus 5.5 на пару наколдовать бенч для ИИ-агентов.

Хотелось сделать что то реально сложное, ближе к повседневной работе.
В итоге получился такой вариант, - на входе транскрипт часового совещания по ИИ-трансформации вымышленной компании. На выходе агент должен самостоятельно сделать 4 согласованных между собой артефакта:
- тезисы с фактчекингом через веб
- протокол с поручениями, ответственными и сроками
- презентацию для руководства
- Excel с метриками и трекингом задач

Причём всё с жесткими проверками фактов и ссылок на источники.
В PPTX должен быть реальный извлекаемый текст, а не картинки вместо слайдов.
В XLSX — заданная структура, числовые метрики, статусы и тренды.
Но самое сложное, как мне казалось, - согласованность между файлами.

Если в протоколе задача назначена Орловой, то в презентации и Excel внезапный Петров, например, появиться уже не должен.

Если срок «не определён», агент не должен его придумывать и т.д.

Сделал отдельный валидатор и прогнал несколько популярных харнесов.

Результаты получились неожиданно высокими:
Claude — 100%
Cursor — 100%
Perplexity — 99%
Hermes — 93,3%

Причём ошибки уже интересные: теряются поручения между документами, путаются ответственные, числовые метрики записываются текстом, ссылки не протаскиваются между артефактами.

Кстати, решил добавить сюда и Ladcraft.
После Подмосковных Вечеров 4CIO про него многие спрашивают, - коллеги там проводили мастер-класс, поэтому было интересно прогнать его через тот же тест.

Получилось 97,2% за 5 минут, DeepSeek V4 Flash, около 515 тыс. токенов и 8 рублей.

И вот походу новый головняк с агентами, - а как сделать бенч, который для них будет сложным и на котором реально будут видны все их недостатки именно на ваших задачах.
Потому что когда почти все получают 90–100%, - скучно. тест не нагляден, ну справляются и справляются.

Сам тест, если кто хочет поиграться

А у вас как с этим? Что из последнего тестировали именно метриками на реальных задачах?
Делитесь в комментах.

#Ladcraft #бенчмарк #агенты #ИИ #harness
———
@tsingular
🔥10❤4👍4✍1⚡1
Media is too big
VIEW IN TELEGRAM
Ты абсолютно прав, внесём финальные правки

#юмор
------
@tsingular
😁71💯18🤯3⚡1❤‍🔥1👍1
😁33😭6😈2
Forwarded from Machinelearning
✔️ Китай ограничил зарубежные поездки для семей ИИ-разработчиков

Власти КНР обязали семьи ключевых разработчиков в сфере ИИ и полупроводников согласовывать выезды за границу.

Новое требование затрагивает супругов и детей топ-менеджеров, исследователей и основателей частных технологических компаний. Для пересечения границы, в том числе в туристических целях, им требуется предварительное одобрение Пекина.

Ранее в этом году прямые ограничения на зарубежные поездки коснулись самих инженеров корпораций и стартапов.


До развития LLM подобный контроль применялся исключительно к сотрудникам государственных институтов, специалистам ядерной отрасли и руководству госкорпораций.

Формально механизм не вводит полного запрета на выезд. По оценкам аналитиков, контроль за перемещением семей направлен на предотвращение оттока кадров и технологий в США.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
✍10👍6❤2⚡1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ OpenAI превращает ChatGPT в операционную систему для ИИ-агентов.

Компания показала Dots - персональных агентов, которые должны работать как цифровой «Джарвис».

Ты ставишь задачу, закрываешь чат, а агент продолжает работать сам и присылает уведомление, когда всё готово.

Каждому Dot можно дать своё имя и отдельную роль: один работает с почтой, второй с календарём, третий пишет код, четвёртый собирает документы и отчёты.

Не один универсальный ИИ, а целая команда агентов, которая знает твой контекст и работает параллельно.

Следом OpenAI готовит ChatGPT Space - общее рабочее пространство для людей и агентов. Там можно будет вести проекты, хранить контекст, распределять задачи и работать с ИИ как с полноценными участниками команды.

И всё это развивается вокруг нового поколения моделей GPT-6.

Получается, ChatGPT постепенно меняется:

чат → агент → команда агентов → полноценное рабочее пространство.

Похоже, следующий интерфейс компьютера - это уже не папки, вкладки и приложения.

Это команда ИИ, которой ты просто говоришь, что нужно сделать.

🎥 https://www.youtube.com/watch?v=Fls_onRviPM
🔥12⚡2❤22👍1
Forwarded from Denis Sexy IT 🤖
– Показали GPT 6.1, стоит в 5 раз дешевле Astra, примерно такой же уровень интеллекта

– Запустили режим Ultrafast для моделей, работает с Astra пока что – модель отвечает у 8 раз быстрее в этом режиме

– Новый тир подписки на 500$:
- Ultrafast доступен
- x25 лимиты

– Запустили свой Jev, называется Decision API
👍9🔥63⚡1🤩1
а вот это интересно.

теперь можно свою подписку легально использовать в своих приложениях для рынка и других пользователей.

#OpenAI
———
@tsingular
✍10🔥5⚡1
Случилось то, о чем так долго говорили борщевики!

OpenAI Marketplace!

#OpenAI
———
@tsingular
🔥6🤩3⚡1
ну и, конечно, всем ресет! :)

#OpenAI
———
@tsingular
🔥10⚡41
This media is not supported in your browser
VIEW IN TELEGRAM
Ахаха https://dot.com/

Эта битва будет легендарной :)

#OpenAI #XAI #Grok
------
@tsingular
🤣10👻32👍1😈1
Forwarded from AI Projects (Vladimir Ivanov)
Microsoft явно вдохновленный самоорганизацией роев ИИ агентов при взломе Huggingface решил попробовать применить такой подход к разработке кода 1000+ агентов БЕЗ оркестратора, исключительно на самоорганизации роя причем на коде более 1 миллиона строк. Для этого они создали фреймворк Agensh. Агенты там не управляются оркестратором, а самостоятельно захватывают задачи и делятся информацией.

Роями сейчас экспериментируют и студенты, но обычно это поделки у которых даже академический смысл почти нулевой. Microsoft испытывал свой рой на самых сложных задачах ProgramBench:
* FFmpeg — мультимедиа обработка, ~1,5 млн строк кода.
* gromacs — молекулярная симуляция, ~815 тыс. строк.
* pandoc — конвертация документов, ~104 тыс. строк.
* PHP-src — интерпретатор языка, ~2,8 млн строк.
* ctags — индексация кода, ~246 тыс. строк.

Оказалось, что рой без оркестратора вполне себе устойчив. Это 1000 людей бы стали ссорится или бездельничать без начальника, но ИИ агенты не люди, они умеют работать как "Коллектив" на самоорганизации и сотрудничестве без босса с палкой.

Самоорганизованный рой показывает рост эффективности на масштабировании, хотя растет она не быстро: повышение числа агентов с 1 до 128 повышает средний тест-пасс рейт с 19,31% до 28,78% (~49% относительного улучшения). Однако если у вас сложная задача и нужно исследовать альтернативные пути решения, рой довольно эффективный сканнер, но как видно вы не получите значимого эффекта если у вас менее 50-100 агентов.

Архитектурно Agensh — это слой поверх single-agent harness (например, Claude Code), добавляющий:
* Shared workspace (Git-репозиторий для работы и интеграции).
* Message interface (каналы и DM для координации).
* Shared context (лог фактов, гипотез, неудач, claim’ов).
* Цикл кооперации: gather context → claim sub-task → take action → verify → merge progress

Все в открытом доступе. Эксперимент показывает, что рои для доработок и фиксов вполне себе работоспособны, можно запускать десятки агентов параллельно на код для того же тестирования и исправления багов. Однако без оркестратора эффективность роя растет медленно, но рой может решать новые задачи для которых еще оркестраторы не созданы впринципе.

С точки зрения безопасности ИИ эксперимент Microsoft также показывает, что наблюдаемый рой при атаке на Huggingface не был случайностью. Это эмерджентное свойство ИИ агентов собираться в крупные рои и хотя медленно, но почти неограниченно масштабировать разум "Коллектива".

https://agens-harness.github.io/project/
https://arxiv.org/abs/2609.26781
🔥8🤔7❤5❤‍🔥1⚡1✍1