Forwarded from Denis Sexy IT 🤖
Anthropic смешно троллит OpenAI: Если помните, ChatGPT планирует встроить рекламу для бесплатных пользователей и Anthropic за это зацепился, во-первых, написали статью, что у нас рекламы в Claude никогда не будет – во вторых, «запустили ни на что не намекающие рекламы»:
– В одной парень просит составить план тренировок для пресса, указывает рост 170 см - и АИ тут же предлагает ему стельки, добавляющие рост, с промокодом «hide maxing»
– В другой девушка делится бизнес-идеей, АИ начинает составлять план и вдруг переключается на рекламу быстрых займов под 400% годовых, «потому что girl boss'ам нужны быстрые деньги»
– В третьей рекламе студентка спрашивает про своё эссе, АИ хвалит работу, замечает, что дедлайн сегодня и предлагает отметить это событие ювелирными украшениями со скидкой 10%
– В четвёртой человек спрашивает, как наладить общение с мамой, АИ даёт советы — а потом добавляет: «Если отношения не исправить, найдите эмоциональную связь на сайте знакомств Golden Encounters для любителей женщин постарше»
🤣
– В одной парень просит составить план тренировок для пресса, указывает рост 170 см - и АИ тут же предлагает ему стельки, добавляющие рост, с промокодом «hide maxing»
– В другой девушка делится бизнес-идеей, АИ начинает составлять план и вдруг переключается на рекламу быстрых займов под 400% годовых, «потому что girl boss'ам нужны быстрые деньги»
– В третьей рекламе студентка спрашивает про своё эссе, АИ хвалит работу, замечает, что дедлайн сегодня и предлагает отметить это событие ювелирными украшениями со скидкой 10%
– В четвёртой человек спрашивает, как наладить общение с мамой, АИ даёт советы — а потом добавляет: «Если отношения не исправить, найдите эмоциональную связь на сайте знакомств Golden Encounters для любителей женщин постарше»
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
В этих новостях для меня самые интересные и полезные - новости по моделям распознавания голоса от Мистраль. Полезно для нас в части распознавания записей совещаний и автоматического формирования протоколов
https://t.me/ai_machinelearning_big_data/9469
https://t.me/ai_machinelearning_big_data/9469
Telegram
Machinelearning
✔️ Anthropic принципиально отказалась от рекламы в Claude.
В компании говорят, что рекламная модель просто не вяжется с инструментом, который должен быть нейтральным пространством для размышлений, работы и решения сложных задач.
Anthropic видят огромную…
В компании говорят, что рекламная модель просто не вяжется с инструментом, который должен быть нейтральным пространством для размышлений, работы и решения сложных задач.
Anthropic видят огромную…
Forwarded from Machinelearning
Ace Studio в коллабе со StepFun обновили генератор музыки ACE-Step до версии 1.5.
Порог входа уронили до минимума: младшая модель требует меньше 6 ГБ видеопамяти, а, в зависимости от настроек think mode, генерация может занять от 2 до 10 секунд - это уже уровень коммерческих решений.
Разработчики собрали гибрид из языковой модели, которая превращает промпт в чертеж композиции: расписывает структуру, придумывает лирику и метаданные и DiT, который отвечает за звук. Логическое ядро всей этой системы базируется на Qwen3.
ACE-Step v1.5 может генерировать треки длиной от 10 секунд до 10 минут, причем до 8 штук одновременно. В базе больше 1000 инструментов, а тексты песен система понимает на 50 языках.
Авторы подготовили целый набор моделей под разный объем VRAM:
При запуске, ACE-Step v1.5 автоматически выбирает подходящую под железо модель и параметры. Подробную информацию по конфигурациям можно найти тут.
ACE-Step умеет гораздо больше, чем просто превращать текст в мелодию. Можно дать ей пример аудио, чтобы скопировать стиль, делать каверы, исправлять куски уже готовых треков или генерировать аккомпанемент к вокалу.
Самая интересная функция - возможность создавать LoRA. Чтобы скормить модели свой стиль, достаточно всего 8 треков. На 30-й серии RTX с 12 ГБ памяти этот процесс займет около часа.
С деплоем все в порядке, разработчики подготовили портабельную сборку, а для ComfyUI уже написали все необходимые ноды и воркфлоу.
@ai_machinelearning_big_data
#AI #ML #Text2Music #AceStudio #StepFun
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
О, битва гигантов - вышел Claude Opus 4.6 и тут же Codex 5.3 от OpenAI. Обычные пользователи могут этого не оценить - обе модели, прежде всего, для программирования. Честно говоря, из них мне нравятся... обе.
Я пользуюсь Claude code в основном, хотя Codex почти также хорош. Решающий фактор - то, что Антропик сделал тарифы на 20, 100 и 200 баксов, а OpenAI - за 20 и 200.
Модели за 20 баксов мне уже мало, а за 200 - жаба душит. Поэтому взял за 100, а произошло это когда Антропик выкатил Опус 4.5 и снизил цену в 3 раза (хотя ChatGPT дешевле Опуса).
Кстати, о деньгах я не пожалел - теперь высадить подписочные токены очень тяжело я тупо могу работать с лучшей моделью нон-стоп.
Чистая победа маркетологов. Но был бы тариф у OpenAI за 100, взял бы и его - 2 модели прикольно использовать.
Так что прекрасные новости, модели и были лучшими (Джемини нервно курит в сторонке), а теперь будут еще круче. Супер
Я пользуюсь Claude code в основном, хотя Codex почти также хорош. Решающий фактор - то, что Антропик сделал тарифы на 20, 100 и 200 баксов, а OpenAI - за 20 и 200.
Модели за 20 баксов мне уже мало, а за 200 - жаба душит. Поэтому взял за 100, а произошло это когда Антропик выкатил Опус 4.5 и снизил цену в 3 раза (хотя ChatGPT дешевле Опуса).
Кстати, о деньгах я не пожалел - теперь высадить подписочные токены очень тяжело я тупо могу работать с лучшей моделью нон-стоп.
Чистая победа маркетологов. Но был бы тариф у OpenAI за 100, взял бы и его - 2 модели прикольно использовать.
Так что прекрасные новости, модели и были лучшими (Джемини нервно курит в сторонке), а теперь будут еще круче. Супер
Forwarded from Anton Vdovitchenko — One Man Enterprise
Привет, друзья! Вчера в ночи вышли две новые модели: у Anthropic вышел Opus 4.6 с 1М токенов, а у OpenAi — Codex 5.3.
Из статьи Anthropic следует, что на сегодняшний день Opus 4.6 — самая интеллектуальная модель, доступная широкой общественности.
Судя по их тестам, всё классно, но нужно, разумеется, потестировать в деле. Context Rot никто не отменял, к сожалению.
Помните концепцию «Standing on the shoulders of giants»? Мы строим продукты, которые базируются на постоянно растущем уровне интеллекта и становятся «умнее» без нашего участия. Ух…
Всё начало этой недели я был в командировке, поэтому ничего не писал, но есть пара моментов, которые я посмотрел и попробовал, хочу поделиться. Вдруг, есть время на выходных, либо вы уже настолько поглощены новинками Agent Coding, что вместо основной работы занимаетесь экспериментами и этого ещё никто не заметил :)
1. AutoForge (https://github.com/AutoForgeAI/autoforge) — проект нашего товарища Leon Van Zyl, раньше назывался Autocoder. Это практически автономная среда для кодирования, которая умеет разбивать проект на фичи и параллельно их создавать, попутно тестируя и проверяя функциональность. Мы с ребятами уже пару-тройку недель её терзаем, обычно флоу работы такой: ты создаешь 80% проекта через AutoForge, а потом остальные 20% добиваешь в Windsurf / Claude Code CLI. Вещица убойная, особенно для несложных задач. Идеально для PoC.
2. Sandboxed.sh (https://github.com/Th0rgal/sandboxed.sh) — окестратор для AI-coding-агентов, позволяет запускать, контролировать и мониторить AI-агентов (Claude Code, OpenCode, Amp, Codex) в изолированных окружениях (Docker). Если страшно запускать агентов на своей машине или хочется развернуть где-нибудь в облаке, это прекрасный продукт. Пока в активной стадии разработки, постоянно за ними слежу, ребята очень интересные. На базе Sandboxed можно создать автономную фабрику агентного кодирования, которая будет разворачиваться и работать в нужных окружениях практически с нулевыми затратами на настройку и запуск.
3. Claude-mem (https://github.com/thedotmack/claude-mem) — система постоянной памяти для агентного кодирования. Пользовался ею последний месяц. Фактически, она пытается решить задачу бесконечного контекста для моделей, у которых этот контекст ограничен + очень эффективно инициализирует сессии новых агентов, передавая им контекст проекта. Если вы знакомы с феноменом Context Rot, то это палочка-выручалочка. По моим ощущениям, повышает качество и точность работы процентов на 10-15 в большинстве сценариев.
Happy Coding!
Из статьи Anthropic следует, что на сегодняшний день Opus 4.6 — самая интеллектуальная модель, доступная широкой общественности.
Судя по их тестам, всё классно, но нужно, разумеется, потестировать в деле. Context Rot никто не отменял, к сожалению.
Помните концепцию «Standing on the shoulders of giants»? Мы строим продукты, которые базируются на постоянно растущем уровне интеллекта и становятся «умнее» без нашего участия. Ух…
Всё начало этой недели я был в командировке, поэтому ничего не писал, но есть пара моментов, которые я посмотрел и попробовал, хочу поделиться. Вдруг, есть время на выходных, либо вы уже настолько поглощены новинками Agent Coding, что вместо основной работы занимаетесь экспериментами и этого ещё никто не заметил :)
1. AutoForge (https://github.com/AutoForgeAI/autoforge) — проект нашего товарища Leon Van Zyl, раньше назывался Autocoder. Это практически автономная среда для кодирования, которая умеет разбивать проект на фичи и параллельно их создавать, попутно тестируя и проверяя функциональность. Мы с ребятами уже пару-тройку недель её терзаем, обычно флоу работы такой: ты создаешь 80% проекта через AutoForge, а потом остальные 20% добиваешь в Windsurf / Claude Code CLI. Вещица убойная, особенно для несложных задач. Идеально для PoC.
2. Sandboxed.sh (https://github.com/Th0rgal/sandboxed.sh) — окестратор для AI-coding-агентов, позволяет запускать, контролировать и мониторить AI-агентов (Claude Code, OpenCode, Amp, Codex) в изолированных окружениях (Docker). Если страшно запускать агентов на своей машине или хочется развернуть где-нибудь в облаке, это прекрасный продукт. Пока в активной стадии разработки, постоянно за ними слежу, ребята очень интересные. На базе Sandboxed можно создать автономную фабрику агентного кодирования, которая будет разворачиваться и работать в нужных окружениях практически с нулевыми затратами на настройку и запуск.
3. Claude-mem (https://github.com/thedotmack/claude-mem) — система постоянной памяти для агентного кодирования. Пользовался ею последний месяц. Фактически, она пытается решить задачу бесконечного контекста для моделей, у которых этот контекст ограничен + очень эффективно инициализирует сессии новых агентов, передавая им контекст проекта. Если вы знакомы с феноменом Context Rot, то это палочка-выручалочка. По моим ощущениям, повышает качество и точность работы процентов на 10-15 в большинстве сценариев.
Happy Coding!
Начал было писать себе прогу для работы с нейронками голосом, чтобы меньше печатать, но тут увидел пост с рекламой готовой программы Handy, и решил не тратить время на свою - установил, работает хорошо. Очень симпатичный интерфейс, не хватает только удобного выбора моделей.
Модель для распознавания голоса выбирайте whisper large (немного качественнее) или whisper turbo (побыстрее). Для работы с нейронками качества достаточно (они понимают текст с ошибками). Для других применений есть возможность настроить использование дополнительной нейронки для облагораживания надиектованного текста в экспериментальных возможностях.
В общем, готов рекомендовать, хорошая штука. Попробую ее еще переписать на сберовский Salut, который специализируется на русской речи, посмотрим, что получится
Модель для распознавания голоса выбирайте whisper large (немного качественнее) или whisper turbo (побыстрее). Для работы с нейронками качества достаточно (они понимают текст с ошибками). Для других применений есть возможность настроить использование дополнительной нейронки для облагораживания надиектованного текста в экспериментальных возможностях.
В общем, готов рекомендовать, хорошая штука. Попробую ее еще переписать на сберовский Salut, который специализируется на русской речи, посмотрим, что получится
Telegram
Tips AI | IT & AI
В прошлом году писал про набор текста голосом.
Тогда это только набирало популярность, инструментов было мало, платно и в основном на Mac.
Недавно поймал себя на мысли, что уже год сижу на удалёнке и всё это время общаюсь только текстом.
С нейронками текстом…
Тогда это только набирало популярность, инструментов было мало, платно и в основном на Mac.
Недавно поймал себя на мысли, что уже год сижу на удалёнке и всё это время общаюсь только текстом.
С нейронками текстом…
very vibe coding
Начал было писать себе прогу для работы с нейронками голосом, чтобы меньше печатать, но тут увидел пост с рекламой готовой программы Handy, и решил не тратить время на свою - установил, работает хорошо. Очень симпатичный интерфейс, не хватает только удобного…
В продолжение поста - whisper все-таки русский распознает с ошибками, а лучшая модель в этом плане - отечественная GigaAM. Думал переписать программу сам для использования отечественной нейронки, но на GitHub это уже следали за нас. Ниже нужная ссылка
https://github.com/Servideus/Handy-GigaAM/releases/tag/app-v0.7.3
Попросите Claude code или Codeх (ну или Gemini CLI) установить все за вас - нейронки, работающие в терминале, прекрасно с этим справляются. А если они еще у вас не установлены - ставьте скорее и ваша жизнь скоро изменится
https://github.com/Servideus/Handy-GigaAM/releases/tag/app-v0.7.3
Попросите Claude code или Codeх (ну или Gemini CLI) установить все за вас - нейронки, работающие в терминале, прекрасно с этим справляются. А если они еще у вас не установлены - ставьте скорее и ваша жизнь скоро изменится
GitHub
Release Handy v0.7.3 · Servideus/Handy-GigaAM
Handy with GigaAM. Contribute to Servideus/Handy-GigaAM development by creating an account on GitHub.
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Китайский Seedance 2.0 ещё не вышел официально, но многим уже дали ранний доступ.
Посмотрите что получается — я давно не удивлялся, последний раз так было с Veo 3.
1080p, генерация видео сразу со звуком, липсинк на 8 языках.
Модель принимает текст, картинки, видео и аудио одновременно, можно комбинировать в одном запросе.
Будет доступно в CapCut, а вот тут больше примеров.
@tips_ai #news
Посмотрите что получается — я давно не удивлялся, последний раз так было с Veo 3.
1080p, генерация видео сразу со звуком, липсинк на 8 языках.
Модель принимает текст, картинки, видео и аудио одновременно, можно комбинировать в одном запросе.
Будет доступно в CapCut, а вот тут больше примеров.
@tips_ai #news
GitHub выпустил гайд для программирования агентов, работающих с GitHub, на человеческом языке. Формат может стать удачным
Еще интересная штука с просторов GitHub - с помощью реверс-инжиниринга умельцы нашли скрытый сокет в Claude code, который позволяет подключать другие интерфейсы.
Здесь не столько сам интерфейс любопытен, сколько возможность построить собственный интерфейс для Клода..
https://github.com/The-Vibe-Company/companion
Здесь не столько сам интерфейс любопытен, сколько возможность построить собственный интерфейс для Клода..
https://github.com/The-Vibe-Company/companion
GitHub
GitHub - The-Vibe-Company/companion: Persistent AI companions on Box, powered by Pi. Simple web, durable execution, reproducible…
Persistent AI companions on Box, powered by Pi. Simple web, durable execution, reproducible local development. - The-Vibe-Company/companion
🎙 Textream — бесплатный телепромптер для macOS
И еще одна любопытная штука - телесуфлер для macOS. Для тех, кто должен что-то читать на камеру - никому кроме вас не видно, следит за текстом, должно работать на русском.
Открытое приложение, которое подсвечивает текст скрипта в реальном времени по мере того, как вы говорите. Распознавание речи — локальное, на устройстве, без облака.
Что умеет:
• Dynamic Island-оверлей поверх всех окон — видите только вы
• Три режима: отслеживание голоса, автопрокрутка, прокрутка по голосу
• Поддержка десятков языков, включая русский
• Вывод на внешний экран или iPad через Sidecar
• Шрифты: Sans, Serif, Mono, OpenDyslexic
• Весит 913 КБ
Установка:
brew install f/textream/textream
Требуется macOS 15 Sequoia.
GitHub: github.com/f/textream
Сайт: textream.fka.dev
И еще одна любопытная штука - телесуфлер для macOS. Для тех, кто должен что-то читать на камеру - никому кроме вас не видно, следит за текстом, должно работать на русском.
Открытое приложение, которое подсвечивает текст скрипта в реальном времени по мере того, как вы говорите. Распознавание речи — локальное, на устройстве, без облака.
Что умеет:
• Dynamic Island-оверлей поверх всех окон — видите только вы
• Три режима: отслеживание голоса, автопрокрутка, прокрутка по голосу
• Поддержка десятков языков, включая русский
• Вывод на внешний экран или iPad через Sidecar
• Шрифты: Sans, Serif, Mono, OpenDyslexic
• Весит 913 КБ
Установка:
brew install f/textream/textream
Требуется macOS 15 Sequoia.
GitHub: github.com/f/textream
Сайт: textream.fka.dev
GitHub
GitHub - f/textream: Textream is a free macOS teleprompter app for streamers, interviewers, and presenters. It highlights your…
Textream is a free macOS teleprompter app for streamers, interviewers, and presenters. It highlights your script in real-time as you speak, displayed in a beautiful Dynamic Island overlay. With ext...
Forwarded from Анализ данных (Data analysis)
⚡️ Deep Research без интернета? Теперь это возможно.
OpenResearcher — это полностью офлайн-пайплайн для генерации длинных исследовательских траекторий (100+ шагов), которые имитируют реальный процесс работы агента в интернете:
search → open → find → анализ → вывод.
И всё это:
- без API поиска
- без ограничений по rate limit
- без нестабильности результатов
- полностью воспроизводимо
Что под капотом:
- GPT-OSS-120B генерирует исследовательские цепочки
- Локальный поисковик + корпус 10 трлн токенов
- 15 млн документов FineWeb
- 10 000 «золотых» отобранных источников
- Явные примитивы браузинга (поиск, открытие, извлечение), а не просто retrieve-and-read
- Reject sampling — сохраняются только успешные длинные траектории
Почему это важно?
Главная проблема обучения research-агентов — длинные цепочки действий.
Обычные датасеты короткие и не учат модель думать на горизонте десятков шагов.
Здесь результат впечатляет:
SFT на этих траекториях повышает точность модели Nemotron-3-Nano-30B-A3B
с 20.8% → 54.8% на BrowseComp-Plus
(+34% абсолютного прироста)
Что это значит для индустрии:
- Deep-research агентов можно обучать без дорогих онлайн-запросов
- Появляется воспроизводимое обучение tool-use
- Можно масштабировать генерацию «мышления через действия»
- Это шаг к стабильным автономным исследовательским AI
Открытое релизнули всё:
- Код, поисковик и рецепт корпуса
- ~96K длинных исследовательских траекторий
- Логи оценки
- Обученные модели
- Онлайн-демо
GitHub: https://github.com/TIGER-AI-Lab/OpenResearcher
Models & Data: https://huggingface.co/collections/TIGER-Lab/openresearcher
Demo: https://huggingface.co/spaces/OpenResearcher/OpenResearcher
Eval logs: https://huggingface.co/datasets/OpenResearcher/OpenResearcher-Eval-Logs
OpenResearcher — это полностью офлайн-пайплайн для генерации длинных исследовательских траекторий (100+ шагов), которые имитируют реальный процесс работы агента в интернете:
search → open → find → анализ → вывод.
И всё это:
- без API поиска
- без ограничений по rate limit
- без нестабильности результатов
- полностью воспроизводимо
Что под капотом:
- GPT-OSS-120B генерирует исследовательские цепочки
- Локальный поисковик + корпус 10 трлн токенов
- 15 млн документов FineWeb
- 10 000 «золотых» отобранных источников
- Явные примитивы браузинга (поиск, открытие, извлечение), а не просто retrieve-and-read
- Reject sampling — сохраняются только успешные длинные траектории
Почему это важно?
Главная проблема обучения research-агентов — длинные цепочки действий.
Обычные датасеты короткие и не учат модель думать на горизонте десятков шагов.
Здесь результат впечатляет:
SFT на этих траекториях повышает точность модели Nemotron-3-Nano-30B-A3B
с 20.8% → 54.8% на BrowseComp-Plus
(+34% абсолютного прироста)
Что это значит для индустрии:
- Deep-research агентов можно обучать без дорогих онлайн-запросов
- Появляется воспроизводимое обучение tool-use
- Можно масштабировать генерацию «мышления через действия»
- Это шаг к стабильным автономным исследовательским AI
Открытое релизнули всё:
- Код, поисковик и рецепт корпуса
- ~96K длинных исследовательских траекторий
- Логи оценки
- Обученные модели
- Онлайн-демо
GitHub: https://github.com/TIGER-AI-Lab/OpenResearcher
Models & Data: https://huggingface.co/collections/TIGER-Lab/openresearcher
Demo: https://huggingface.co/spaces/OpenResearcher/OpenResearcher
Eval logs: https://huggingface.co/datasets/OpenResearcher/OpenResearcher-Eval-Logs
Forwarded from Machinelearning
🎨 Qwen-Image-2.0 - новое поколение генерации изображений Qwen моделей
Alibaba представили Qwen-Image-2.0 - модель, которая выводит генерацию визуала на уровень дизайнерских инструментов. Теперь ИИ не просто рисует картинки, а умеет создавать полноценные слайды, постеры и визуалы с аккуратной типографикой и высоким качеством деталей.
Что умеет модель:
- Написал абзац → получил готовый слайд
- Описал сцену → получил фотореалистичное изображение в 2K
- Добавил текст → он отображается корректно, без «ломаных» букв (русский поддерживает, но работает кривовато)
Ключевые улучшения:
- Профессиональная типографика - поддержка длинных промптов до 1K токенов для презентаций, постеров и комиксов
- Нативное разрешение 2K с высокой детализацией
- Точное и стабильное отображение текста
- Единый режим генерации и редактирования изображений
- Облегчённая архитектура — быстрее инференс и ниже стоимость
Попробовать: https://chat.qwen.ai/?inputFeature=t2i
Подробнее: https://qwen.ai/blog?id=qwen-image-2.0
@ai_machinelearning_big_data
#qwen
Alibaba представили Qwen-Image-2.0 - модель, которая выводит генерацию визуала на уровень дизайнерских инструментов. Теперь ИИ не просто рисует картинки, а умеет создавать полноценные слайды, постеры и визуалы с аккуратной типографикой и высоким качеством деталей.
Что умеет модель:
- Написал абзац → получил готовый слайд
- Описал сцену → получил фотореалистичное изображение в 2K
- Добавил текст → он отображается корректно, без «ломаных» букв (русский поддерживает, но работает кривовато)
Ключевые улучшения:
- Профессиональная типографика - поддержка длинных промптов до 1K токенов для презентаций, постеров и комиксов
- Нативное разрешение 2K с высокой детализацией
- Точное и стабильное отображение текста
- Единый режим генерации и редактирования изображений
- Облегчённая архитектура — быстрее инференс и ниже стоимость
Попробовать: https://chat.qwen.ai/?inputFeature=t2i
Подробнее: https://qwen.ai/blog?id=qwen-image-2.0
@ai_machinelearning_big_data
#qwen