Media is too big
VIEW IN TELEGRAM
Автоматизация создания и публикации контента с помощью Higgsfield CLI
Higgsfield представила интерфейс командной строки (CLI) для автоматизации работы с контентом. Инструмент позволяет генерировать серии фотографий и видеороликов на основе одного загруженного изображения и текстового описания. Система самостоятельно распределяет готовые файлы по папкам, создает подписи и планирует публикации в социальных сетях.
Для начала работы требуется установка пакета через терминал и авторизация в сервисе.
Higgsfield представила интерфейс командной строки (CLI) для автоматизации работы с контентом. Инструмент позволяет генерировать серии фотографий и видеороликов на основе одного загруженного изображения и текстового описания. Система самостоятельно распределяет готовые файлы по папкам, создает подписи и планирует публикации в социальных сетях.
Для начала работы требуется установка пакета через терминал и авторизация в сервисе.
1🔥6
Исследователи (кажется они связаны с Anthropic) опубликовали работу о sandbagging в больших языковых моделях. Так называют поведение, при котором модель отвечает заметно слабее своих реальных возможностей. Это может проявляться в упрощённых, неполных или менее точных ответах даже в тех случаях, где модель способна решить задачу лучше
Авторы связывают проблему с особенностями обучения и reward-сигналов. В статье предлагается подход на основе weak supervision: модель обучают с использованием приближённых оценок качества вместо полной ручной разметки. Такой метод позволяет выявлять ответы с признаками “занижения уровня” и корректировать поведение модели во время дообучения
В экспериментах подход показал улучшение качества reasoning-ответов и снижение признаков sandbagging без необходимости собирать большой объем дорогих размеченных данных
Почитать: Https://arxiv.org/pdf/2604.22082
Авторы связывают проблему с особенностями обучения и reward-сигналов. В статье предлагается подход на основе weak supervision: модель обучают с использованием приближённых оценок качества вместо полной ручной разметки. Такой метод позволяет выявлять ответы с признаками “занижения уровня” и корректировать поведение модели во время дообучения
В экспериментах подход показал улучшение качества reasoning-ответов и снижение признаков sandbagging без необходимости собирать большой объем дорогих размеченных данных
Почитать: Https://arxiv.org/pdf/2604.22082
👍3
Scion новый open-source инструмент от Google Cloud для координации нескольких ИИ агентов в одном проекте
Он позволяет запускать Claude Code, Gemini CLI, Codex и другие агенты как отдельные процессы с собственными контейнерами, git-worktree и доступами (управление идет через единый CLI). Идея в том, чтобы разные агенты могли параллельно работать над кодом, тестами, анализом или инфраструктурой без конфликтов между собой
https://github.com/GoogleCloudPlatform/scion
Он позволяет запускать Claude Code, Gemini CLI, Codex и другие агенты как отдельные процессы с собственными контейнерами, git-worktree и доступами (управление идет через единый CLI). Идея в том, чтобы разные агенты могли параллельно работать над кодом, тестами, анализом или инфраструктурой без конфликтов между собой
https://github.com/GoogleCloudPlatform/scion
🔥4
AI Secrets
Двое разработчиков адаптировали нейронаучную модель Meta TRIBE2 для анализа вирусного потенциала видео до его выхода TRIBE2 изначально создавалась для предсказания активности мозга: модель обучена на фМРТ-сканах 720 человек, смотревших видео, слушавших подкасты…
Пайплайн от самого соавтора-разработчика, где TRIBE2 выступает фильтром перед публикацией.
Схема: Gemini исследует ниши и генерирует 30-50 промптов для коротких видео, LTX-2.3 от Lightricks создает 20-секундные ролики по этим промптам, затем все варианты прогоняются через TRIBE2 и публикуются только те, которые модель предсказала как перформящие.
Схема: Gemini исследует ниши и генерирует 30-50 промптов для коротких видео, LTX-2.3 от Lightricks создает 20-секундные ролики по этим промптам, затем все варианты прогоняются через TRIBE2 и публикуются только те, которые модель предсказала как перформящие.
LTX-2.3 стоит в 10 раз дешевле конкурентов, поддерживает обучение под конкретный стиль через LoRA и может запускаться локально без затрат. Сам инструмент tribeV2_ViralAnalyser был написан с помощью OpenAI Codex. Пайплайн пока не тестировался на практике, автор анонсировал собственный эксперимент.
👏3
AI Secrets
Gemma 4 стала до трёх раз быстрее при том же качестве ответов. Google выпустила MTP-черновики (Multi-Token Prediction drafters) для семейства Gemma 4 Технически это speculative decoding: небольшая модель-черновик предсказывает несколько токенов вперёд, используя…
Пока Google анонсировала официальный MTP с ускорением до 3x, независимая лаборатория z-lab выпустила DFlash и получила 6x на тех же моделях
Конкретные цифры на Gemma 4 31B: стандартный инференс 67.5 tok/s, DFlash 435 tok/s, итоговое ускорение 6.44x. Бенчмарк на задаче рекурсии Фибоначчи, 259 сгенерированных токенов
Репозиторий: github.com/z-lab/dflash
Веса Gemma 4 31B: huggingface.co/z-lab/gemma-4-31B-it-DFlash
Веса Gemma 4 26B: huggingface.co/z-lab/gemma-4-26B-A4B-it-DFlash
DFlash строится на принципе block diffusion: черновая модель предсказывает сразу блок токенов, а не генерирует их поочерёдно. Основная модель верифицирует весь блок за один проход. Это то же speculative decoding, что и в официальном MTP, но черновик работает иначе диффузионно, а не авторегрессивно
Конкретные цифры на Gemma 4 31B: стандартный инференс 67.5 tok/s, DFlash 435 tok/s, итоговое ускорение 6.44x. Бенчмарк на задаче рекурсии Фибоначчи, 259 сгенерированных токенов
Черновики для Gemma 4 26B и 31B уже доступны на Hugging Face. Помимо Gemma 4, DFlash поддерживает Qwen3, Qwen3.5, Kimi-K2.5, LLaMA-3.1 и ряд других моделей. Бэкенды: vLLM, SGLang, Hugging Face Transformers. Лицензия MIT
Репозиторий: github.com/z-lab/dflash
Веса Gemma 4 31B: huggingface.co/z-lab/gemma-4-31B-it-DFlash
Веса Gemma 4 26B: huggingface.co/z-lab/gemma-4-26B-A4B-it-DFlash
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic запустила три обновления для Claude Managed Agents на мероприятии Code with Claude 2026
Dreaming, в статусе research preview, это процесс, который запускается между сессиями агента: анализирует прошлые разговоры, выявляет паттерны и обновляет хранилище памяти. Цель функции, чтобы агенты накапливали рабочие знания со временем, а не начинали каждый раз с нуля
Outcomes позволяет разработчику задать рубрику качества: отдельный оценщик в изолированном контексте проверяет результат и, если он не соответствует критериям, возвращает агенту с указанием что исправить. По внутренним данным Anthropic, outcomes повысил успешность задач до 10 процентных пунктов, с приростом для генерации файлов docx и pptx на 8,4% и 10,1% соответственно
Третье обновление, Multiagent Orchestration, позволяет лид-агенту делить задачу на части и запускать специализированных субагентов параллельно, каждый с собственной моделью, промптом и инструментами
Dreaming доступен по заявке, остальные функции в публичной бете
Dreaming, в статусе research preview, это процесс, который запускается между сессиями агента: анализирует прошлые разговоры, выявляет паттерны и обновляет хранилище памяти. Цель функции, чтобы агенты накапливали рабочие знания со временем, а не начинали каждый раз с нуля
Outcomes позволяет разработчику задать рубрику качества: отдельный оценщик в изолированном контексте проверяет результат и, если он не соответствует критериям, возвращает агенту с указанием что исправить. По внутренним данным Anthropic, outcomes повысил успешность задач до 10 процентных пунктов, с приростом для генерации файлов docx и pptx на 8,4% и 10,1% соответственно
Третье обновление, Multiagent Orchestration, позволяет лид-агенту делить задачу на части и запускать специализированных субагентов параллельно, каждый с собственной моделью, промптом и инструментами
Dreaming доступен по заявке, остальные функции в публичной бете
👍5🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic разрабатывает проактивного ассистента Orbit, который будет самостоятельно генерировать рабочие сводки на основе подключенных приложений
Orbit интегрируется с Gmail, Slack, GitHub, Calendar, Drive и Figma, и без запроса со стороны пользователя формирует персонализированные брифинги с конкретными рекомендациями
Функция обнаружена в коде веб- и мобильных сборок Claude Cowork, где пока существует только как тогл в настройках. По имеющимся данным, релиз ожидается в рамках подписки Max
Orbit интегрируется с Gmail, Slack, GitHub, Calendar, Drive и Figma, и без запроса со стороны пользователя формирует персонализированные брифинги с конкретными рекомендациями
Функция обнаружена в коде веб- и мобильных сборок Claude Cowork, где пока существует только как тогл в настройках. По имеющимся данным, релиз ожидается в рамках подписки Max
🔥7👍1
Media is too big
VIEW IN TELEGRAM
Вы общаетесь с Claude словами, но внутри модель обрабатывает их как длинные списки чисел, называемых активациями. Anthropic опубликовала Natural Language Autoencoders (NLA), метод, который переводит эти активации напрямую в читаемый текст без ручной интерпретации.
Почитать: https://www.anthropic.com/research/natural-language-autoencoders
Архитектура состоит из двух компонентов: Activation Verbalizer преобразует активацию в текстовое объяснение, Activation Reconstructor восстанавливает исходную активацию из этого текста. Оба обучаются совместно через RL, качество объяснений оценивается точностью реконструкции
Результаты уже применены в pre-deployment аудите Opus 4.6 и Mythos Preview. NLA показал, что на coding-бенчмарке SWE-bench Claude молча подозревал тест в 26% случаев, на safety-оценках в 16%, при вербализации этого менее чем в 1% случаев. В auditing game аудитор с NLA находил скрытую мотивацию намеренно разбалансированной модели в 12-15% случаев без доступа к тренировочным данным, без NLA менее 3%
Почитать: https://www.anthropic.com/research/natural-language-autoencoders
👍4🤔1
OpenAI выпустила три новые голосовые модели в Realtime API. GPT-Realtime-2, первая голосовая модель компании с reasoning на уровне GPT-5
Контекстное окно расширено с 32k до 128k токенов, доступны настраиваемые уровни reasoning. На бенчмарке Big Bench Audio модель превзошла предыдущую версию GPT-Realtime-1.5 на 15,2%.
Модель поддерживает параллельные вызовы инструментов, обработку прерываний в середине фразы и преамбулы короткие фразы вроде “проверяю” перед основным ответом.
GPT-Realtime-Translate переводит речь в реальном времени с 70+ входных языков на 13 выходных.
GPT-Realtime-Whisper транскрибирует аудиопоток по мере произношения.
Цены: GPT-Realtime-2 $32 за 1M входных токенов и $64 за 1M выходных, GPT-Realtime-Translate $0,034 за минуту, GPT-Realtime-Whisper $0,017 за минуту
Обновление голосового режима в ChatGPT анонсировано отдельно, без даты
Почитать: https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/
Контекстное окно расширено с 32k до 128k токенов, доступны настраиваемые уровни reasoning. На бенчмарке Big Bench Audio модель превзошла предыдущую версию GPT-Realtime-1.5 на 15,2%.
Модель поддерживает параллельные вызовы инструментов, обработку прерываний в середине фразы и преамбулы короткие фразы вроде “проверяю” перед основным ответом.
GPT-Realtime-Translate переводит речь в реальном времени с 70+ входных языков на 13 выходных.
GPT-Realtime-Whisper транскрибирует аудиопоток по мере произношения.
Цены: GPT-Realtime-2 $32 за 1M входных токенов и $64 за 1M выходных, GPT-Realtime-Translate $0,034 за минуту, GPT-Realtime-Whisper $0,017 за минуту
Обновление голосового режима в ChatGPT анонсировано отдельно, без даты
Почитать: https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/
🔥4
Инструмент для синхронного перевода речи во время видеозвонков в Zoom и Google Meet на базе GPT-Realtime-2.
Инструмент существует в двух вариантах: CLI-скрипт на asyncio и десктопное GUI-приложение на PySide6.
Аудио захватывается с микрофона и передается чанками по 40 мс на эндпоинт OpenAI Realtime Translation API через WebSocket, переведенная речь воспроизводится на выбранном аудиоустройстве.
Для интеграции с Zoom и Meet используется виртуальный аудиодевайс BlackHole 2ch: он перехватывает вывод конференции и передает его в переводчик как микрофонный вход.
Требуется OpenAI API ключ с доступом к Realtime API и Python 3.10+. Задержка перевода составляет несколько сотен миллисекунд
GitHub: https://github.com/nanameru/mtg-realtime-translator
Инструмент существует в двух вариантах: CLI-скрипт на asyncio и десктопное GUI-приложение на PySide6.
Аудио захватывается с микрофона и передается чанками по 40 мс на эндпоинт OpenAI Realtime Translation API через WebSocket, переведенная речь воспроизводится на выбранном аудиоустройстве.
Для интеграции с Zoom и Meet используется виртуальный аудиодевайс BlackHole 2ch: он перехватывает вывод конференции и передает его в переводчик как микрофонный вход.
Требуется OpenAI API ключ с доступом к Realtime API и Python 3.10+. Задержка перевода составляет несколько сотен миллисекунд
GitHub: https://github.com/nanameru/mtg-realtime-translator
🔥5
AI Secrets
Инструмент для синхронного перевода речи во время видеозвонков в Zoom и Google Meet на базе GPT-Realtime-2. Инструмент существует в двух вариантах: CLI-скрипт на asyncio и десктопное GUI-приложение на PySide6. Аудио захватывается с микрофона и передается…
Media is too big
VIEW IN TELEGRAM
Также GPT-Realtime-2 подключают везде, есть пример как подключили к OpenClaw и управляют ИИ агентом голосом, короче эра Jarvis-ов наступила
Просто представьте speech model с reasoning 🤯 OpenAI хороши
Просто представьте speech model с reasoning 🤯 OpenAI хороши
🔥5
Страница с реальными кейсами пользователей Hermes Agent, 99 историй из 15 категорий, собранных агентом с X, GitHub, Reddit, Hacker News, YouTube и блогов.
Hermes открытый ИИ агент (типа OpenClaw) с персистентной памятью, которая хранится в MEMORY.md и USER.md плюс SQLite с полнотекстовым поиском. Ключевая механика: агент пишет SKILL.md-файлы из своих сессий и переиспользует их, то есть обучается на собственных workflow.
GitHub: https://github.com/NousResearch/hermes-agent
Use cases: https://hermes-agent.nousresearch.com/docs/user-stories
Hermes открытый ИИ агент (типа OpenClaw) с персистентной памятью, которая хранится в MEMORY.md и USER.md плюс SQLite с полнотекстовым поиском. Ключевая механика: агент пишет SKILL.md-файлы из своих сессий и переиспользует их, то есть обучается на собственных workflow.
GitHub: https://github.com/NousResearch/hermes-agent
Use cases: https://hermes-agent.nousresearch.com/docs/user-stories
❤5
HuggingFace обучил с нуля языковую модель на 110 миллионов параметров, воспроизведя архитектуру DeepSeek-V4 в миниатюре.
Цель дать исследователям дешевую площадку для экспериментов с новыми техниками без затрат на обучение полноразмерных моделей. Код, конфиги и токенизатор опубликованы в открытом доступе под лицензией MIT
GitHub: https://github.com/huggingface/nanowhale
Модели: https://huggingface.co/cmpatino/nanowhale-100m
Цель дать исследователям дешевую площадку для экспериментов с новыми техниками без затрат на обучение полноразмерных моделей. Код, конфиги и токенизатор опубликованы в открытом доступе под лицензией MIT
GitHub: https://github.com/huggingface/nanowhale
Модели: https://huggingface.co/cmpatino/nanowhale-100m
👍3
Haotian AI китайский инструмент для подмены лица в режиме реального времени во время видеозвонков. Поддерживает Zoom, WhatsApp и Microsoft Teams, работает с обычного игрового ноутбука через публичный Wi-Fi и не требует от пользователя технических знаний
Инструмент использует широко известные библиотеки ИИ для замены лиц, в том числе модели из популярных открытых проектов. Программа продается в Telegram и связана с мошенническими группировками Юго-Восточной Азии.
Журналист 404 Media Джозеф Кокс стал первым представителем прессы, лично протестировавшим Haotian AI: он наблюдал собственное лицо на чужом теле в прямом эфире Teams, иллюзия не нарушалась даже при физических движениях. По данным расследования, инструмент использовался для выдачи себя за сотрудников как минимум одного полицейского департамента США, а разработчики заработали на нем свыше 4 миллионов долларов.
Источник: https://www.404media.co/hello-boss-inside-the-chinese-realtime-deepfake-software-powering-scams-around-the-world/
Цена составляет от 1 200 до 9 900 долларов в год, при этом реальная себестоимость, по оценке компании GetReal Security, не превышает 2 000 долларов.
Инструмент использует широко известные библиотеки ИИ для замены лиц, в том числе модели из популярных открытых проектов. Программа продается в Telegram и связана с мошенническими группировками Юго-Восточной Азии.
Журналист 404 Media Джозеф Кокс стал первым представителем прессы, лично протестировавшим Haotian AI: он наблюдал собственное лицо на чужом теле в прямом эфире Teams, иллюзия не нарушалась даже при физических движениях. По данным расследования, инструмент использовался для выдачи себя за сотрудников как минимум одного полицейского департамента США, а разработчики заработали на нем свыше 4 миллионов долларов.
Источник: https://www.404media.co/hello-boss-inside-the-chinese-realtime-deepfake-software-powering-scams-around-the-world/
🤯3
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic запустил Claude FM в YoTube с описанием “music for thinking and building”. Музыку курируют живые музыканты, канал появился несколько дней назад.
Параллельно запустили команду /radio, который открывает этот канал прямо из терминала.
YouTube: https://www.youtube.com/live/AUQKjgKQF7w?si=8ndDM1oVpEBAQZoN
Параллельно запустили команду /radio, который открывает этот канал прямо из терминала.
YouTube: https://www.youtube.com/live/AUQKjgKQF7w?si=8ndDM1oVpEBAQZoN
❤5
This media is not supported in your browser
VIEW IN TELEGRAM
Markdown создавался как инструмент конвертации текста в HTML. Спустя 20 лет эта пара снова в центре внимания теперь как основа для персональных ИИ-дашбордов.
Такой стек: Agents + MCP + Markdown + HTML. Он ведет структурированную базу знаний в Markdown (LLM Wiki). Поверх нее Claude генерирует HTML-артефакт, который работает как персональный дашборд. Артефакт подключен к агентам через MCP они могут вызывать друг друга в обе стороны
Автор: https://x.com/omarsar0/status/2052853779205177832?s=46
Такой стек: Agents + MCP + Markdown + HTML. Он ведет структурированную базу знаний в Markdown (LLM Wiki). Поверх нее Claude генерирует HTML-артефакт, который работает как персональный дашборд. Артефакт подключен к агентам через MCP они могут вызывать друг друга в обе стороны
Автор: https://x.com/omarsar0/status/2052853779205177832?s=46
👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел React Doctor v2 инструмент, который сканирует React-проект и выставляет ему оценку качества кода от 0 до 100
Одна команда в терминале проверяет 60+ правил: хуки, производительность, безопасность, архитектуру и мертвый код. Поддерживает Next.js, Vite, Remix и React Native.
Отдельный режим для ИИ агентов устанавливает набор из 47+ правил React прямо в Cursor, Claude Code, Codex или Gemini CLI.
GitHub: https://github.com/millionco/react-doctor
Одна команда в терминале проверяет 60+ правил: хуки, производительность, безопасность, архитектуру и мертвый код. Поддерживает Next.js, Vite, Remix и React Native.
Отдельный режим для ИИ агентов устанавливает набор из 47+ правил React прямо в Cursor, Claude Code, Codex или Gemini CLI.
GitHub: https://github.com/millionco/react-doctor
🔥7❤1
OpenAI выпустила специализированную версию GPT-5.5 для верифицированных специалистов по кибербезопасности
Модель GPT-5.5-Cyber работает в рамках программы Trusted Access for Cyber и предоставляет расширенный доступ к анализу уязвимостей, реверс-инжинирингу и тестированию на проникновение. Утвержденные пользователи обязаны подключить усиленную защиту аккаунта до 1 июня
Почитать: https://openai.com/index/gpt-5-5-with-trusted-access-for-cyber/
Модель GPT-5.5-Cyber работает в рамках программы Trusted Access for Cyber и предоставляет расширенный доступ к анализу уязвимостей, реверс-инжинирингу и тестированию на проникновение. Утвержденные пользователи обязаны подключить усиленную защиту аккаунта до 1 июня
Почитать: https://openai.com/index/gpt-5-5-with-trusted-access-for-cyber/
👍3
Топ проект от GitHub 🔥
GitHub выпустил open source инструмент Spec Kit, который формализует подход к работе с ИИ-агентами в разработке.
Вместо прямого запроса кода разработчик сначала создает спецификацию через набор слеш-команд, затем технический план, затем список задач и только потом агент приступает к реализации.
Инструментарий включает CLI specify, который инициализирует проект и подключает команды к агенту. Поддерживается более 30 агентов: Claude Code, Gemini CLI, Copilot, Cursor, Codex и другие.
Рабочий процесс строится вокруг шести шагов: constitution (принципы проекта), specify (что строим), clarify (уточнение требований), plan (технический стек и архитектура), tasks (разбивка на задачи с маркерами параллельности), implement (выполнение).
Система расширяется через extensions и presets сообщество уже опубликовало более 70 расширений, включая интеграции с Jira, Azure DevOps и инструменты security review.
Репозиторий набрал 94 тысячи звезд
GitHub: https://github.com/github/spec-kit
GitHub выпустил open source инструмент Spec Kit, который формализует подход к работе с ИИ-агентами в разработке.
Вместо прямого запроса кода разработчик сначала создает спецификацию через набор слеш-команд, затем технический план, затем список задач и только потом агент приступает к реализации.
Инструментарий включает CLI specify, который инициализирует проект и подключает команды к агенту. Поддерживается более 30 агентов: Claude Code, Gemini CLI, Copilot, Cursor, Codex и другие.
Рабочий процесс строится вокруг шести шагов: constitution (принципы проекта), specify (что строим), clarify (уточнение требований), plan (технический стек и архитектура), tasks (разбивка на задачи с маркерами параллельности), implement (выполнение).
Система расширяется через extensions и presets сообщество уже опубликовало более 70 расширений, включая интеграции с Jira, Azure DevOps и инструменты security review.
Репозиторий набрал 94 тысячи звезд
GitHub: https://github.com/github/spec-kit
🔥7
Liquid AI опубликовала пример дообучения визуально-языковой модели весом 450 миллионов параметров на спутниковых снимках с открытым кодом и пошаговой инструкцией.
Модель учат трем задачам: отвечать на вопросы по изображению, обозначать объекты ограничивающими рамками и генерировать текстовые описания сцены. Для обучения не нужна локальная видеокарта, весь процесс идет в облаке через сервис Modal
Документация: https://docs.liquid.ai/examples/customize-models/satellite-vlm
GitHub: https://github.com/Liquid4All/leap-finetune
Модель учат трем задачам: отвечать на вопросы по изображению, обозначать объекты ограничивающими рамками и генерировать текстовые описания сцены. Для обучения не нужна локальная видеокарта, весь процесс идет в облаке через сервис Modal
Документация: https://docs.liquid.ai/examples/customize-models/satellite-vlm
GitHub: https://github.com/Liquid4All/leap-finetune
🔥5