AI Secrets
749 subscribers
243 photos
328 videos
4 files
577 links
Все про ИИ и open source проекты

Угости меня кофе ☕️
4400430300037006
Download Telegram
Media is too big
VIEW IN TELEGRAM
Автоматизация создания и публикации контента с помощью Higgsfield CLI

Higgsfield представила интерфейс командной строки (CLI) для автоматизации работы с контентом. Инструмент позволяет генерировать серии фотографий и видеороликов на основе одного загруженного изображения и текстового описания. Система самостоятельно распределяет готовые файлы по папкам, создает подписи и планирует публикации в социальных сетях.

Для начала работы требуется установка пакета через терминал и авторизация в сервисе.
1🔥6
Исследователи (кажется они связаны с Anthropic) опубликовали работу о sandbagging в больших языковых моделях. Так называют поведение, при котором модель отвечает заметно слабее своих реальных возможностей. Это может проявляться в упрощённых, неполных или менее точных ответах даже в тех случаях, где модель способна решить задачу лучше

Авторы связывают проблему с особенностями обучения и reward-сигналов. В статье предлагается подход на основе weak supervision: модель обучают с использованием приближённых оценок качества вместо полной ручной разметки. Такой метод позволяет выявлять ответы с признаками “занижения уровня” и корректировать поведение модели во время дообучения

В экспериментах подход показал улучшение качества reasoning-ответов и снижение признаков sandbagging без необходимости собирать большой объем дорогих размеченных данных

Почитать: Https://arxiv.org/pdf/2604.22082
👍3
Scion новый open-source инструмент от Google Cloud для координации нескольких ИИ агентов в одном проекте

Он позволяет запускать Claude Code, Gemini CLI, Codex и другие агенты как отдельные процессы с собственными контейнерами, git-worktree и доступами (управление идет через единый CLI). Идея в том, чтобы разные агенты могли параллельно работать над кодом, тестами, анализом или инфраструктурой без конфликтов между собой

https://github.com/GoogleCloudPlatform/scion
🔥4
AI Secrets
Двое разработчиков адаптировали нейронаучную модель Meta TRIBE2 для анализа вирусного потенциала видео до его выхода TRIBE2 изначально создавалась для предсказания активности мозга: модель обучена на фМРТ-сканах 720 человек, смотревших видео, слушавших подкасты…
Пайплайн от самого соавтора-разработчика, где TRIBE2 выступает фильтром перед публикацией.

Схема: Gemini исследует ниши и генерирует 30-50 промптов для коротких видео, LTX-2.3 от Lightricks создает 20-секундные ролики по этим промптам, затем все варианты прогоняются через TRIBE2 и публикуются только те, которые модель предсказала как перформящие.

LTX-2.3 стоит в 10 раз дешевле конкурентов, поддерживает обучение под конкретный стиль через LoRA и может запускаться локально без затрат. Сам инструмент tribeV2_ViralAnalyser был написан с помощью OpenAI Codex. Пайплайн пока не тестировался на практике, автор анонсировал собственный эксперимент.​​​​​​​​​​​​​​​​
👏3
AI Secrets
Gemma 4 стала до трёх раз быстрее при том же качестве ответов. Google выпустила MTP-черновики (Multi-Token Prediction drafters) для семейства Gemma 4 Технически это speculative decoding: небольшая модель-черновик предсказывает несколько токенов вперёд, используя…
Пока Google анонсировала официальный MTP с ускорением до 3x, независимая лаборатория z-lab выпустила DFlash и получила 6x на тех же моделях

DFlash строится на принципе block diffusion: черновая модель предсказывает сразу блок токенов, а не генерирует их поочерёдно. Основная модель верифицирует весь блок за один проход. Это то же speculative decoding, что и в официальном MTP, но черновик работает иначе диффузионно, а не авторегрессивно


Конкретные цифры на Gemma 4 31B: стандартный инференс 67.5 tok/s, DFlash 435 tok/s, итоговое ускорение 6.44x. Бенчмарк на задаче рекурсии Фибоначчи, 259 сгенерированных токенов

Черновики для Gemma 4 26B и 31B уже доступны на Hugging Face. Помимо Gemma 4, DFlash поддерживает Qwen3, Qwen3.5, Kimi-K2.5, LLaMA-3.1 и ряд других моделей. Бэкенды: vLLM, SGLang, Hugging Face Transformers. Лицензия MIT


Репозиторий: github.com/z-lab/dflash

Веса Gemma 4 31B: huggingface.co/z-lab/gemma-4-31B-it-DFlash

Веса Gemma 4 26B: huggingface.co/z-lab/gemma-4-26B-A4B-it-DFlash​​​​​​​​​​​​​​​​
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic запустила три обновления для Claude Managed Agents на мероприятии Code with Claude 2026

Dreaming, в статусе research preview, это процесс, который запускается между сессиями агента: анализирует прошлые разговоры, выявляет паттерны и обновляет хранилище памяти. Цель функции, чтобы агенты накапливали рабочие знания со временем, а не начинали каждый раз с нуля

Outcomes позволяет разработчику задать рубрику качества: отдельный оценщик в изолированном контексте проверяет результат и, если он не соответствует критериям, возвращает агенту с указанием что исправить. По внутренним данным Anthropic, outcomes повысил успешность задач до 10 процентных пунктов, с приростом для генерации файлов docx и pptx на 8,4% и 10,1% соответственно

Третье обновление, Multiagent Orchestration, позволяет лид-агенту делить задачу на части и запускать специализированных субагентов параллельно, каждый с собственной моделью, промптом и инструментами

Dreaming доступен по заявке, остальные функции в публичной бете
👍5🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic разрабатывает проактивного ассистента Orbit, который будет самостоятельно генерировать рабочие сводки на основе подключенных приложений

Orbit интегрируется с Gmail, Slack, GitHub, Calendar, Drive и Figma, и без запроса со стороны пользователя формирует персонализированные брифинги с конкретными рекомендациями

Функция обнаружена в коде веб- и мобильных сборок Claude Cowork, где пока существует только как тогл в настройках. По имеющимся данным, релиз ожидается в рамках подписки Max
🔥7👍1
Media is too big
VIEW IN TELEGRAM
Вы общаетесь с Claude словами, но внутри модель обрабатывает их как длинные списки чисел, называемых активациями. Anthropic опубликовала Natural Language Autoencoders (NLA), метод, который переводит эти активации напрямую в читаемый текст без ручной интерпретации.

Архитектура состоит из двух компонентов: Activation Verbalizer преобразует активацию в текстовое объяснение, Activation Reconstructor восстанавливает исходную активацию из этого текста. Оба обучаются совместно через RL, качество объяснений оценивается точностью реконструкции

Результаты уже применены в pre-deployment аудите Opus 4.6 и Mythos Preview. NLA показал, что на coding-бенчмарке SWE-bench Claude молча подозревал тест в 26% случаев, на safety-оценках в 16%, при вербализации этого менее чем в 1% случаев. В auditing game аудитор с NLA находил скрытую мотивацию намеренно разбалансированной модели в 12-15% случаев без доступа к тренировочным данным, без NLA менее 3%


Почитать: https://www.anthropic.com/research/natural-language-autoencoders
👍4🤔1
OpenAI выпустила три новые голосовые модели в Realtime API. GPT-Realtime-2, первая голосовая модель компании с reasoning на уровне GPT-5

Контекстное окно расширено с 32k до 128k токенов, доступны настраиваемые уровни reasoning. На бенчмарке Big Bench Audio модель превзошла предыдущую версию GPT-Realtime-1.5 на 15,2%.

Модель поддерживает параллельные вызовы инструментов, обработку прерываний в середине фразы и преамбулы короткие фразы вроде “проверяю” перед основным ответом.

GPT-Realtime-Translate переводит речь в реальном времени с 70+ входных языков на 13 выходных.

GPT-Realtime-Whisper транскрибирует аудиопоток по мере произношения.

Цены: GPT-Realtime-2 $32 за 1M входных токенов и $64 за 1M выходных, GPT-Realtime-Translate $0,034 за минуту, GPT-Realtime-Whisper $0,017 за минуту

Обновление голосового режима в ChatGPT анонсировано отдельно, без даты

Почитать: https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/​​​​​​​​​​​​​​​​
🔥4
Инструмент для синхронного перевода речи во время видеозвонков в Zoom и Google Meet на базе GPT-Realtime-2.

Инструмент существует в двух вариантах: CLI-скрипт на asyncio и десктопное GUI-приложение на PySide6.

Аудио захватывается с микрофона и передается чанками по 40 мс на эндпоинт OpenAI Realtime Translation API через WebSocket, переведенная речь воспроизводится на выбранном аудиоустройстве.

Для интеграции с Zoom и Meet используется виртуальный аудиодевайс BlackHole 2ch: он перехватывает вывод конференции и передает его в переводчик как микрофонный вход.

Требуется OpenAI API ключ с доступом к Realtime API и Python 3.10+. Задержка перевода составляет несколько сотен миллисекунд

GitHub: https://github.com/nanameru/mtg-realtime-translator​​​​​​​​​​​​​​​​
🔥5
AI Secrets
Инструмент для синхронного перевода речи во время видеозвонков в Zoom и Google Meet на базе GPT-Realtime-2. Инструмент существует в двух вариантах: CLI-скрипт на asyncio и десктопное GUI-приложение на PySide6. Аудио захватывается с микрофона и передается…
Media is too big
VIEW IN TELEGRAM
Также GPT-Realtime-2 подключают везде, есть пример как подключили к OpenClaw и управляют ИИ агентом голосом, короче эра Jarvis-ов наступила

Просто представьте speech model с reasoning 🤯 OpenAI хороши
🔥5
Страница с реальными кейсами пользователей Hermes Agent, 99 историй из 15 категорий, собранных агентом с X, GitHub, Reddit, Hacker News, YouTube и блогов.

Hermes открытый ИИ агент (типа OpenClaw) с персистентной памятью, которая хранится в MEMORY.md и USER.md плюс SQLite с полнотекстовым поиском. Ключевая механика: агент пишет SKILL.md-файлы из своих сессий и переиспользует их, то есть обучается на собственных workflow.

GitHub: https://github.com/NousResearch/hermes-agent

Use cases: https://hermes-agent.nousresearch.com/docs/user-stories​​​​​​​​​​​​​​​​
5
HuggingFace обучил с нуля языковую модель на 110 миллионов параметров, воспроизведя архитектуру DeepSeek-V4 в миниатюре.

Цель дать исследователям дешевую площадку для экспериментов с новыми техниками без затрат на обучение полноразмерных моделей. Код, конфиги и токенизатор опубликованы в открытом доступе под лицензией MIT

GitHub: https://github.com/huggingface/nanowhale

Модели: https://huggingface.co/cmpatino/nanowhale-100m​​​​​​​​​​​​​​​​
👍3
Haotian AI китайский инструмент для подмены лица в режиме реального времени во время видеозвонков. Поддерживает Zoom, WhatsApp и Microsoft Teams, работает с обычного игрового ноутбука через публичный Wi-Fi и не требует от пользователя технических знаний

Цена составляет от 1 200 до 9 900 долларов в год, при этом реальная себестоимость, по оценке компании GetReal Security, не превышает 2 000 долларов.


Инструмент использует широко известные библиотеки ИИ для замены лиц, в том числе модели из популярных открытых проектов. Программа продается в Telegram и связана с мошенническими группировками Юго-Восточной Азии.

Журналист 404 Media Джозеф Кокс стал первым представителем прессы, лично протестировавшим Haotian AI: он наблюдал собственное лицо на чужом теле в прямом эфире Teams, иллюзия не нарушалась даже при физических движениях. По данным расследования, инструмент использовался для выдачи себя за сотрудников как минимум одного полицейского департамента США, а разработчики заработали на нем свыше 4 миллионов долларов.

Источник: https://www.404media.co/hello-boss-inside-the-chinese-realtime-deepfake-software-powering-scams-around-the-world/​​​​​​​​​​​​​​​​
🤯3
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic запустил Claude FM в YoTube с описанием “music for thinking and building”. Музыку курируют живые музыканты, канал появился несколько дней назад.

Параллельно запустили команду /radio, который открывает этот канал прямо из терминала.

YouTube: https://www.youtube.com/live/AUQKjgKQF7w?si=8ndDM1oVpEBAQZoN​​​​​​​​​​​​​​​​
5
This media is not supported in your browser
VIEW IN TELEGRAM
Markdown создавался как инструмент конвертации текста в HTML. Спустя 20 лет эта пара снова в центре внимания теперь как основа для персональных ИИ-дашбордов.

Такой стек: Agents + MCP + Markdown + HTML. Он ведет структурированную базу знаний в Markdown (LLM Wiki). Поверх нее Claude генерирует HTML-артефакт, который работает как персональный дашборд. Артефакт подключен к агентам через MCP они могут вызывать друг друга в обе стороны

Автор: https://x.com/omarsar0/status/2052853779205177832?s=46
👍4
Попросить Claude Code сгенерировать HTML-визуализацию собственного контекстного окна один из самых наглядных способов понять, как этот механизм устроен изнутри
👍5
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел React Doctor v2 инструмент, который сканирует React-проект и выставляет ему оценку качества кода от 0 до 100

Одна команда в терминале проверяет 60+ правил: хуки, производительность, безопасность, архитектуру и мертвый код. Поддерживает Next.js, Vite, Remix и React Native.

Отдельный режим для ИИ агентов устанавливает набор из 47+ правил React прямо в Cursor, Claude Code, Codex или Gemini CLI.

GitHub: https://github.com/millionco/react-doctor
🔥71
OpenAI выпустила специализированную версию GPT-5.5 для верифицированных специалистов по кибербезопасности

Модель GPT-5.5-Cyber работает в рамках программы Trusted Access for Cyber и предоставляет расширенный доступ к анализу уязвимостей, реверс-инжинирингу и тестированию на проникновение. Утвержденные пользователи обязаны подключить усиленную защиту аккаунта до 1 июня

Почитать: https://openai.com/index/gpt-5-5-with-trusted-access-for-cyber/
👍3
Топ проект от GitHub 🔥

GitHub выпустил open source инструмент Spec Kit, который формализует подход к работе с ИИ-агентами в разработке.

Вместо прямого запроса кода разработчик сначала создает спецификацию через набор слеш-команд, затем технический план, затем список задач и только потом агент приступает к реализации.

Инструментарий включает CLI specify, который инициализирует проект и подключает команды к агенту. Поддерживается более 30 агентов: Claude Code, Gemini CLI, Copilot, Cursor, Codex и другие.

Рабочий процесс строится вокруг шести шагов: constitution (принципы проекта), specify (что строим), clarify (уточнение требований), plan (технический стек и архитектура), tasks (разбивка на задачи с маркерами параллельности), implement (выполнение).

Система расширяется через extensions и presets сообщество уже опубликовало более 70 расширений, включая интеграции с Jira, Azure DevOps и инструменты security review.

Репозиторий набрал 94 тысячи звезд

GitHub: https://github.com/github/spec-kit
🔥7
Liquid AI опубликовала пример дообучения визуально-языковой модели весом 450 миллионов параметров на спутниковых снимках с открытым кодом и пошаговой инструкцией.

Модель учат трем задачам: отвечать на вопросы по изображению, обозначать объекты ограничивающими рамками и генерировать текстовые описания сцены. Для обучения не нужна локальная видеокарта, весь процесс идет в облаке через сервис Modal

Документация: https://docs.liquid.ai/examples/customize-models/satellite-vlm

GitHub: https://github.com/Liquid4All/leap-finetune​​​​​​​​​​​​​​​​
🔥5