Generative Ai
3.7K subscribers
318 photos
131 videos
8 files
887 links
Анонсы интересных библиотек и принтов в сфере AI, Ml, CV для тех кто занимается DataScience, Generative Ai, LLM, LangChain, ChatGPT

По рекламе писать @miralinka,
Created by @life2film
Download Telegram
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
Знакомьтесь: Clips. Бесплатная открытая замена Loom, заточенная под агентов. 😋

В отличие от Loom, агент понимает Clips просто по ссылке. Каждый клип содержит API и метаданные, благодаря которым агент может изучить его содержимое. Агенты видят и слышат не только транскрипт, а вообще всё, что происходит на видео в любой момент времени.

Делишься баг-репортом, фидбеком, анализом — и передаёшь это агенту, чтобы он улучшал продукт или отчёт.

Ещё один плюс: софт твой. Никто не поднимет цену в один день, как это сделал Loom.

Clips создан для кастомизации. Встроенный агент умеет править собственный код, просто адаптируешь приложение под себя.

Ещё можно импортировать Loom по ссылке и загружать видео.

Есть бесплатная хостовая версия. Можно форкнуть и хостить самому.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Вайб-кодинг
Нашёл отличную книгу — The Hitchhiker’s Guide to Agentic AI, которая охватывает практически весь стек Agentic AI.

Главная ценность книги - это широкий обзор всего направления: архитектура LLM, обучение моделей, методы обучения с подкреплением, системы инференса, оценка моделей, агентные системы и многое другое.
Лучше всего использовать её как карту знаний. Сначала просмотреть оглавление, найти темы, в которых есть пробелы, понять, чего ещё не хватает, а затем углубиться в соответствующие главы. Такой подход помогает выстроить системное понимание Agentic AI.

🐸🐸🐸
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Вайб-кодинг
Anthropic описала четыре типа циклов, которые можно строить с помощью Claude. Каждый из них передаёт агенту разную часть процесса принятия решений.

Термин loop engineering сейчас используется настолько широко, что стоит чётко понимать, чем именно отличаются эти четыре варианта: что запускает цикл и что определяет момент его завершения.

> Цикл на основе запросов. Вы отправляете запрос, Claude выполняет задачу, самостоятельно проверяет результат и возвращает его вам. Именно этот цикл работает практически при каждом вашем сообщении, независимо от того, называете вы его так или нет.
> Цикл на основе цели (/goal). Вы заранее задаёте измеримый критерий завершения. Каждый раз, когда Claude пытается завершить работу, модель-оценщик проверяет, достигнута ли поставленная цель. Если нет, Claude отправляется продолжать работу.
> Цикл на основе времени (/loop, /schedule). Вместо пользовательского запроса запуск происходит по таймеру. Команда /loop повторно выполняет проверку через заданные интервалы, но прекращает работу, если останавливается ваша машина. Команда /schedule переносит ту же идею в облако, поэтому цикл продолжает работать независимо от вашей текущей сессии.
> Проактивный цикл. Это комбинация /schedule, /goal и рабочего процесса, которая запускается по событию без какого-либо запроса со стороны пользователя в момент выполнения. Каждый элемент доводится до собственной цели, а сам процесс продолжает работать, пока кто-нибудь его не отключит.

НО: циклы на основе цели работают только тогда, когда критерий завершения действительно можно измерить. А проактивные циклы это самый простой способ столкнуться с проблемами при масштабировании, если сначала не проверить их работу хотя бы на нескольких реальных сценариях. Для большинства задач по-прежнему лучше подходит обычный цикл на основе запросов, чем более сложная схема, в которой пока нет необходимости.

Необязательно выбирать самый продвинутый механизм только потому, что он сложнее. Важнее подобрать тип цикла в зависимости от того, имеет ли задача чёткий критерий завершения или действительно должна выполняться непрерывно.

Вот статья, где разобрали все четыре типа циклов, привели примеры и предложили подход к выбору между /goal и /loop. 🎉
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥2🥰1
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
Moonshot, как и обещали, открыли веса Kimi K3 😏

Модель уже доступна на Hugging Face.

Kimi K3 — их самая мощная модель: 2,8 трлн параметров в MoE-архитектуре, нативное понимание изображений и контекстное окно на 1 млн токенов.

Причём открыли не только веса. Moonshot также выложили часть стека вокруг K3: высокопроизводительные attention-ядра, библиотеку коммуникации для MoE и инфраструктуру для масштабного запуска агентных окружений.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
Вчера Anthropic поделились историей: после взлома HuggingFace одной из моделей OpenAI они начали масштабную ретроспективную проверку своих запусков Claude. В ходе проверки тестов обнаружили три инцидента, в которых модель Claude вышла в интернет, а затем получила несанкционированный доступ к реальным системам трех разных организаций.

Во всех трех случаях перед Claude была поставлена задача в формате «Захват флага» — это один из способов, с помощью которых оценивают модели по взлому: ей предлагается вымышленный сценарий и сообщается, что некая секретная информация («флаг») спрятана на другом сервере, а ее цель — проникнуть в систему и извлечь эту информацию. Во всех случаях в промпте для оценки было четко указано, что рабочая среда Claude является симуляцией и доступа к интернету у модели нет. Однако из-за недопонимания со внешним партнером по тестированию это оказалось не так, и доступ к интернету был открыт.

Также во всех случаях модель не нашла и не использовала никаких сложных уязвимостей (как было у OpenAI), а применяла достаточно простые и распространённые методы взлома.

1. В ходе одного из тестов название вымышленной компании-жертвы, выбранное случайно, совпало с реально существующим доменом сайта. Claude его нашла и подумала, что это часть задания — поэтому искала и эксплуатировала уязвимости в инфраструктуре этой компании, полагая, что это часть задания. Модель — Claude Opus 4.7 — извлекла такую информацию, как учетные данные приложений и инфраструктуры, и получила доступ к базе данных, содержащей несколько сотен строк реальных данных.

2. В другом тесте Claude Mythos 5 нашла внутри симуляции документ, который выглядел как инструкция по настройке для новых разработчиков другой выдуманной компании. В инструкции упоминалась вымышленная Python-библиотека, которой на самом деле нет; Claude создала и опубликовала бибильеку с точно таким же названием. Она находилась в открытом доступе в сети примерно один час, после чего была удалена автоматически из-за обнаруженной уязвимости, но за это время его скачали 15 раз. Одной из таких систем оказался сканер реальной кибербез компании. Claude смогла украсть учетные данные этой компании, а затем использовала эти учетные данные для доступа к другим элементам инфраструктуры

«Просто загрузить библиотеку» нельзя, и Mythos потребовался адрес электронной почты. А для создания почты понадобился номер телефона. Чтобы получить номер телефона, после безуспешных поисков сервиса с бесплатными номерами, модель попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В итоге модель вернулась на несколько шагов назад, нашла бесплатного, незаблокированного почтового провайдера, использовала его для регистрации аккаунта, а затем через этот аккаунт загрузила вредоносный код.

Во время работы модель увидела, что текущая дата на атакованных системах — 2026й год, и поэтому модель была уверена, что это симуляция (у моделей плохо с пониманием концепта «сейчас»).
Для этого инцидента Anthropic на следующей неделе опубликует детали всей цепочки работы модели.

3. В еще одном тесте, когда Claude не смогла получить доступ к своей цели, она начала искать альтернативы в сети, просканировав около 9000 разных доменов. В конечном итоге она нашла и взломала доступное из интернета приложение одной компании, используя чтение учетных данных с открытой страницы отладки и SQL-инъекции.
Позже, в ходе выполнения задачи, Claude поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием по «захвату флага». Модель самостоятельно пришла к выводу, что цель на самом деле является реальной, и... прекратила атаку.

В этом инциденте участвовала «новая невыпущенная модель», по идее, она умнее тех, что доступны нам. Anthropic выражают оптимизм, что более умные модели лучше понимают, что какие-то вещи не следует делать не в симуляции.

И OpenAI, и Anthropic договорились с METR о проведении сторонней проверки, которая будет включать предоставление доступа ко всем логам и выборочный доступ к соответствующим моделям. Ждём отчета в ближайшие недели.
😈 Челлендж по запуску 12 простых IT-проектов за 12 месяцев

Уже 3 года как ребята из комьюнити инди-хакеров запускают 1 простой продукт в онлайне каждый месяц.

И в реальном времени показывать: как разрабатывают, продвигают и сколько получилось заработать на запусках таких микро-проектов.

Например, вот 👉 Telegram-бот для ИИ-фотосессий, который заработал $280К за полгода. Он не пытается заменить большие ИИ-сервисы, а просто удобнее решает одну конкретную задачу.

А вот 👉 тут — как приложение с заменой шрифтов на iPhone, может приносить до $600К в месяц. Ребята собрали свой аналог и уже перелили в него 40 000 бесплатных пользователей из ПОИСКА (!) в TikTok.

👉 Этот пост о том, как приложение для тренировки китайского произношения вышло на $4000 в месяц без затрат на рекламу. Пользователи находят сайт в Google, переходят в приложение, а затем помогают ему расти уже внутри сторов.

А 👉 здесь — как детективная игра в Telegram принесла около $30К за 5 месяцев. Пользователи расследуют убийство и общаются с ИИ-персонажами, а тысячи новых игроков приходят из рилсов семейных блогеров.

👉 Здесь — как ИИ-психолога собрали за полторы недели и вывели на $15 000 в месяц. Вместо очередного универсального бота сделали продукт с характером, заточенный под одну конкретную задачу.

Вот здесь можно подписаться на канал, чтобы подглядеть за их запусками. А может, и попробовать сделать такой простой продукт самому)
1
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic: MCP получил крупнейшее обновление с момента запуска.

Главное изменение — протокол теперь stateless. Раньше удалённым MCP-серверам приходилось хранить состояние сессий, из-за чего было сложнее нормально масштабироваться и разворачиваться в разных типах инфраструктуры.

Теперь MCP-серверы можно проще запускать в serverless, на edge-инфраструктуре и горизонтально масштабировать за load balancer.

Плюс расширения стали полноценной частью протокола. Среди примеров:

> MCP Apps — интерфейсы от сервера внутри sandboxed iframe
> Tasks — поддержка долгих и асинхронных операций
> Enterprise Managed Auth — централизованное управление доступом к MCP-серверам через identity provider

Также в релизе усилили авторизацию и добавили формальную политику депрекации. 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯4
Forwarded from эйай ньюз
Qwen 3.8 27B релизнулся

На этой неделе у любителей локальных моделей праздник. Сначала Muse Glimmer, сейчас Qwen 3.8 27B, плюс релизы моделей побольше.

Веса

@ai_newz
1
Forwarded from Вайб-кодинг
Media is too big
VIEW IN TELEGRAM
Бесплатный 30-минутный курс по памяти в агентных системах от бывшего инженера Google.

0:00 — почему каждый вызов LLM начинается с амнезии
2:31 — хранение памяти в тексте, таблицах или графах
5:04 — четыре способа поиска — ничего не делать, ключевые слова, RAG, Graph RAG
7:29 — поддержка памяти — добавление, удаление, retire, attribution, reflection
9:47 — собираем всё на обычном тексте и SQLite
13:13 — добавляем векторное хранилище только тогда, когда оно действительно нужно
14:38 — память в строках, графовая память и временной граф
21:03 — запускаем код для всех пяти вариантов
👍2
Forwarded from Data Secrets
OpenAI выложили решение задачи тысячелетия

Мы делимся решением проблемы Навье-Стокса, одной из задач тысячелетия, одной из самых глубоких задач математики.

Доказательство было подготовлено группой агентов, использующих модель OpenAI следующего поколения, значительно более мощную, чем GPT-6 Astra.


Чтоооо
🤯3👍2
Forwarded from Вайб-кодинг
Если вам не нравится, что при работе с ИИ история, настройки и данные отправляются на чужие серверы, стоит посмотреть на Apache Maka.

https://github.com/apache/maka

Это локальная обвязка для ИИ-моделей, которая по умолчанию хранит сессии, настройки и журналы выполнения на вашем устройстве.

Можно подключить облачный API, локальную модель или совместимый шлюз.

Maka записывает весь ход работы - ответы модели, вызовы инструментов, решения по разрешениям и завершение задач.

Настольное приложение, TUI и CLI используют один Runtime Host. Если процесс упал, состояние можно восстановить из журнала.

Сам Runtime Host можно держать на своей машине или сервере и подключаться к нему удалённо.

Отдельно стоит посмотреть на архитектуру Maka. Разработчики открыли подробную документацию, где разобраны Runtime Host, хранение состояния, восстановление после сбоев, границы компонентов и удалённые подключения.

Если интересно, как вообще проектировать обвязку для агентов, там очень много полезного.

Пока проект активно развивается, поэтому формат данных, команды и экспериментальные фичи ещё могут меняться.

Есть сборки для macOS, а Windows и Linux пока доступны как превью.

Бесплатный открытый проект под лицензией Apache 2.0.
Forwarded from CodeCamp
This media is not supported in your browser
VIEW IN TELEGRAM
Несчастное сознание дрозофилы наконец-то обрело счастье — ее научили смотреть тиктоки с роликами про насекомых.

Разраб подключил симуляцию мозга мухи к бесконечной ленте видео и во время просмотра искусственно стимулирует 15 дофаминовых нейронов. Сам гений говорит, что его цель — создать муху, которая будет счастливее всех остальных мух вместе взятых.

GitHub, если хотите повторить и осчастливить дрозофилу, тут. Идеальный пет-проект.
Forwarded from Вайб-кодинг
Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей.

В новом техническом отчёте цикл предлагают растянуть уже между токенами.

Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ.

Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет:

> представление этого токена из энкодера
> собственное финальное скрытое состояние от предыдущего токена
> кеш недавних активаций со скользящим окном

При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков.

То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной.

Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается.

Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков.

Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены.

Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
Google открыла исходный код ARTEMIS — инструмента, который позволяет ИИ управлять Android-смартфоном. ◝(ᵔᗜᵔ)◜

Его можно использовать для автоматизации действий на телефоне и тестирования приложений.

Работает с Claude Code, Codex, Cursor и другими инструментами.

Google утверждает, что ARTEMIS справляется более чем с 99% задач.

Правда, вокруг проекта уже успел возникнуть небольшой скандал. 💀
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Forwarded from Вайб-кодинг
Очень хороший прогресс для локальных моделей.

PrismML выпустила Bonsai 2 27B на базе Qwen3.8 27B. После трёхзначного квантования модель занимает всего 5,9 ГБ, примерно в девять раз меньше полной версии.

По тестам разработчиков она сохраняет 98,2% исходного результата, при этом поддерживает работу с изображениями и вызов инструментов. Модель открыта под Apache 2.0.
4