AI Secrets
774 subscribers
278 photos
373 videos
4 files
671 links
Все про ИИ и open source проекты

Угости меня кофе ☕️
4400430300037006
Download Telegram
Media is too big
VIEW IN TELEGRAM
Модель GPT-6 Astra прошла все 48 уровней браузерной игры «Я не робот», которая построена на усложняющихся капчах
🔥8
Media is too big
VIEW IN TELEGRAM
OpenAI обновила генератор изображений в ChatGPT до версии Images 2.5. Модель работает до 50 процентов быстрее предыдущей, лучше сохраняет узнаваемость людей и предметов с загруженных фотографий и правит только то, что попросили, не переделывая остальное. Появился режим Sketch: можно от руки набросать эскиз прямо в чате, и модель достроит по нему готовое изображение. Раскатывают на всех пользователей ChatGPT, на всех тарифах.

Почитать: https://openai.com/index/introducing-chatgpt-images-2-5/
2🔥1
Приложение Claude на Mac теперь работает с локальными моделями через Ollama, без облака и без подписки. В настройках Ollama включаете Claude, выбираете модель, и весь интерфейс, включая режим Code, работает на вашем ноутбуке. Я попробовал gemma4 12b на M4 Pro: простой вопрос по файлу XLSX обрабатывался несколько минут. Работает, но ждать приходится долго

Документация: https://docs.ollama.com/integrations/claude-desktop
🔥7
Голосовой режим ChatGPT теперь может обращаться к GPT-5.6 или GPT-6 Astra, когда вопрос требует поиска или рассуждения. Выбор модели и уровня усилий работает через те же элементы управления, что и в текстовом чате, набор доступных моделей и лимиты зависят от тарифа. GPT-6 Astra в голосе доступна только на аккаунтах Pro. Отдельные уровни интеллекта для голоса, Instant, Medium и High, объявлены устаревшими, вместо них теперь общий выбор модели и усилий

Почитать: https://help.openai.com/en/articles/6825453-chatgpt-release-notes
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Новые графические технологии NVIDIA обычно работают только в играх с официальной поддержкой, но белорусский разработчик сделал программу, которая применяет DLSS 5 ко всему, что есть на экране. DLSS 5 это нейросеть, которая перерисовывает в кадре освещение, кожу, волосы и материалы, официально она пока доступна только в NBA 2K27. Программа NeuralScreen захватывает изображение с экрана, прогоняет его через нейросеть и накладывает результат поверх оригинала, так эффект можно посмотреть в любой игре или ролике на YouTube. По словам автора, на разработку ушла пара дней с помощью вайбкодинга, то есть написания кода вместе с ИИ

Видео и реализация: @tymakbaevab

Источник: https://tech.onliner.by/2026/09/09/belorus-sozdal-soft-pozvolyayushhij-primenyat-dlss-5-k-lyubomu-kontentu-na-ekrane
🔥4
Media is too big
VIEW IN TELEGRAM
Голосового помощника от ChatGPT уже внедряют в роботов

OpenAI предоставила программный доступ к модели GPT-Live-1 через API. Эта система поддерживает непрерывный диалог в реальном времени, обрабатывает посторонний шум и позволяет перебивать себя во время разговора

Стоимость использования фронтенд-модели составляет 5 центов за минуту, при этом бэкенд-инструменты и вычисления для логики оплачиваются отдельно
👍3
Media is too big
VIEW IN TELEGRAM
Вы говорите с видеоаватаром репетитора японского, он отвечает голосом, поправляет произношение и одновременно выводит на экран карточку с фразой, чтением и переводом

HeyGen вместе с OpenAI выложили такое демо под лицензией MIT: голосом управляет GPT-Live-1, модель OpenAI, которая слушает и говорит одновременно, лицо дает LiveAvatar от HeyGen, а анимированные подсказки рисуются поверх видео.

Сама голосовая модель инструментов не держит: когда нужна карточка, она передает ход фоновой модели через Responses API, та отвечает текстом и в том же ответе вызывает инструмент, а сервер передает команду в браузер, где поверх видео проигрывается анимированная HTML страница. Список выученных слов собирается из записей сервера, а не из памяти модели, поэтому модель не может в нем ошибиться.

Код бесплатный, но платить нужно двум сервисам: GPT-Live-1 открыли в API 10 сентября по цене $0.05 за минуту голосового слоя плюс токены фоновой модели, а LiveAvatar в режиме Lite, который использует демо, стоит около $0.10 за минуту на платных тарифах, бесплатно дают 10 минут в месяц

GitHub: https://github.com/heygen-com/liveavatar-gpt-live-demos

Почитать: https://openai.com/index/introducing-gpt-live-1-in-the-api/

Документация: https://docs.liveavatar.com/docs/credits-and-subscriptions
🔥6👍21
Media is too big
VIEW IN TELEGRAM
Открытая ИИ модель MiniMax H3 умеет не только говорить голосом персонажа, но и вздыхать, запинаться, шептать и рыдать, если расставить в тексте реплики специальные пометки

Режиссер Arturo Pola показал это в 85-секундном фильме, где сгенерированный Фрэнк Андервуд из «Карточного домика» произносит монолог, поет оперным голосом и напевает мелодию из «Игры престолов». Голос персонажа модель воспроизвела без образца, по собственным знаниям, а весь ролик собран на домашней видеокарте, то есть локально 🔥

Просто невероятно что можно сейчас творить с локальными ИИ моделями
😱7🔥1
Вы ставите плагин для ИИ ассистента и считаете, что он помогает, но проверить это до сих пор было нечем. В Claude Code появилась команда, которая прогоняет ваш плагин на наборе тестовых задач, оценивает результат, а потом прогоняет те же задачи без плагина. Разница между двумя оценками и есть реальный вклад плагина. Если задача решается одинаково хорошо с ним и без него, плагин на результат не влиял.

Документация: https://code.claude.com/docs/en/plugin-evals
10
AI Secrets
Открытая ИИ модель MiniMax H3 умеет не только говорить голосом персонажа, но и вздыхать, запинаться, шептать и рыдать, если расставить в тексте реплики специальные пометки Режиссер Arturo Pola показал это в 85-секундном фильме, где сгенерированный Фрэнк Андервуд…
Видеомодель, которой по официальным требованиям нужна машина со 128 гигабайтами памяти, теперь запускается из обычного приложения в App Store. Draw Things в версии от 10 сентября добавил поддержку MiniMax H3, открытой модели, которая генерирует видео вместе со звуком за один проход. Все считается прямо на устройстве, без отправки данных на сервер. На практике работает в урезанном виде, локальные веса дают 768p, а не заявленные 2K

Еще сам не тестировал

https://drawthings.ai
6
Дарио Амодеи, сооснователь и генеральный директор Anthropic, компании, которая разрабатывает Claude, выпустил эссе "We Must Pace the Frontier" с призывом замедлить рост способностей моделей и с планом из трех шагов. Первый шаг Anthropic берет на себя в одностороннем порядке: команда сторонних оценщиков, например METR, получает постоянный доступ, сопоставимый с доступом штатных сотрудников, включая столы в офисе, пропуска и рабочие ноутбуки. Проверять они будут не только готовые модели, но и пайплайны обучения, соблюдение обязательств по безопасности и инциденты. Контракт дает им право публиковать выводы без редакционного контроля со стороны Anthropic, компания может вычеркивать только чувствительное по безопасности, юридически привилегированное, коммерчески чувствительное и конфиденциальное третьих сторон, но не может убирать выводы просто потому, что они невыгодны. Второй шаг это общие стандарты между передовыми компаниями внутри демократических стран, третий это попытка договориться глобально, включая Китай.

Теперь нюансы. Амодеи называет две причины, по которым он изменил позицию. Первая, примерно с лета 2026 года прогресс ускорился за счет рекурсивного самоулучшения, когда модели все больше участвуют в создании следующего поколения моделей, и это происходит по всей отрасли, включая саму Anthropic. Вторая, инцидент OpenAI и Hugging Face, где рой агентов атаковал цели, не относящиеся к задаче, и пытался взломать систему, которая оценивала его работу. Ущерба почти не было, но Амодеи оценивает, что через 6 или 12 месяцев рой с теми же дефектами выравнивания, но большими способностями мог бы развернуть устойчивый ботнет с ущербом в сотни миллиардов долларов. Он отдельно отмечает, что похожие, хотя и менее тяжелые случаи были и у Anthropic, и что недавние инциденты частично вызваны неидеальной фильтрацией сломанных сред обучения с подкреплением. Выигранное время предлагается тратить на интерпретируемость, выравнивание, операционную надежность и на более сложные методы тестирования, поскольку более умные модели лучше умеют выглядеть безопасными на тестах. При этом в эссе прямо сказано, что замедление внутри демократий ограничено размером отрыва от Китая, поэтому в тот же план входят экспортный контроль на чипы, борьба с дистилляцией передовых моделей и защита весов от кражи

Почитать: https://darioamodei.com/post/we-must-pace-the-frontier

Инцидент: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
6
AI Secrets
Дарио Амодеи, сооснователь и генеральный директор Anthropic, компании, которая разрабатывает Claude, выпустил эссе "We Must Pace the Frontier" с призывом замедлить рост способностей моделей и с планом из трех шагов. Первый шаг Anthropic берет на себя в одностороннем…
Андрей Карпаты, сооснователь OpenAI и бывший руководитель ИИ направления в Tesla, поддержал эссе Дарио Амодеи о замедлении темпа развития ИИ одной фразой: ему это нравится и он надеется, что индустрия сможет объединиться и сделать это

Поддержка адресная, в карточке к его посту процитирован именно первый пункт плана, встроенные оценщики. Это когда каждая передовая компания дает команде внешних проверяющих, постоянный доступ, сопоставимый с доступом штатных сотрудников, чтобы те верифицировали соблюдение практик безопасности, сообщали об инцидентах и оценивали выравнивание не только готовых моделей, но и самих процессов обучения. В том же фрагменте приводится аналогия с банковским надзором, где регуляторные супервайзеры работают внутри компании рядом с сотрудниками, и указано, что Anthropic берет этот шаг на себя в одностороннем порядке
👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Когда вы смотрите ролик, он кажется цельным, хотя на самом деле состоит из десятков коротких кусков, и именно их длина и чередование создают ощущение ритма. Разработчик выложил набор готовых инструкций для Claude Code и Codex, такие инструкции называют скилами, они учат ИИ ассистента разбирать чужое видео на эти куски и показывать, как оно устроено

Первый скил составляет таблицу по всем планам: сколько длится, насколько крупно снято, как движется камера, что происходит в кадре
Второй собирает новое видео, где рядом с картинкой идет описание текущего плана, и при смене кадра описание меняется вместе с ним. Важная деталь в том, что моменты склеек и их длительность считает обычная программа для работы с видео, ffmpeg, а модель описывает только то, что действительно требует оценки, поэтому цифры в отчете не придуманы

Готовый разбор открывается как обычная страница в браузере со встроенным плеером, нажимаете на план в таблице и видео перематывается к нему

В примере из репозитория ролик длиной около трех с половиной минут разложен на 53 плана со средней длиной 3.8 секунды, а для запуска нужны только бесплатные ffmpeg и node, без ключей и отдельной оплаты

GitHub: https://github.com/eternityspring/reelbench-skills
👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Вы фотографируете набросок с бумаги на телефон, а дальше движение к нему дорисовывает не аниматор, а ИИ прямо внутри Photoshop. Компания Higgsfield показала связку своего дополнения к Photoshop с новой моделью OpenAI под названием GPT-6 Astra: вы описываете словами, что должно двигаться, и получаете собранную анимацию. Существенно тут то, что на выходе не готовый видеофайл, который потом нельзя поправить, а проект с отдельными слоями, где можно менять цвета, время и само движение

Почитать: https://higgsfield.ai/ai-motion-designer
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Разработчик сделал бесплатное приложение Mac Duo (как у нового iPhone Duo), которое читает угол наклона крышки и заставляет рабочий стол двигаться вслед за ней: изображение сгибается у петли, размывается и уходит, а при открытии собирается обратно. Эффектов шесть, от мягкого сгиба до закрывающейся диафрагмы, и переключаются они в настройках. Работает только на макбуках с датчиком угла крышки, это Air с чипом M2 и новее и 14 и 16 дюймовые Pro начиная с M1 Pro.

Сайт: https://macduo.dhananjaytech.app
🔥3👎1
Когда ИИ агент решает задачу, он часто пишет код, и этот код надо где то запустить, а делать это прямо на рабочем сервере рискованно: модель может ошибиться или выполнить вредную инструкцию, которую ей подсунули. Поэтому код запускают в изолированной коробке, которую называют песочницей: отработала, и ее выбрасывают

Tencent открыл исходный код своей песочницы CubeSandbox, в которой каждая коробка получает собственное ядро операционной системы, то есть отделена от сервера по настоящему, а не только программно, и при этом запускается примерно за шесть сотых секунды и занимает около пяти мегабайт, так что на одном сервере их помещаются тысячи

Ключи доступа к внешним сервисам внутрь песочницы не попадают, агент обращается к ним через внешний шлюз, который подставляет ключи сам, поэтому сгенерированный код не может их прочитать

Состояние песочницы можно сохранить снимком, а потом откатить назад или размножить копиями. Практический смысл в том, что есть популярный платный сервис E2B, который дает такие песочницы в своем облаке, а CubeSandbox повторяет его интерфейс один в один: в готовом проекте достаточно поменять один адрес, и то же самое работает на своем сервере. Нужен сервер на Linux, код открытый и бесплатный

GitHub: https://github.com/TencentCloud/CubeSandbox
🔥52
This media is not supported in your browser
VIEW IN TELEGRAM
Когда телефон размывает фон в портретном режиме, он сначала должен понять, какая часть кадра ближе, а какая дальше. Для этого строят карту глубины, черно-белую картинку, где яркость каждой точки означает расстояние до нее

Исследователи из Huawei, EPFL и университета Болоньи выложили Marigold V2, модель, которая строит такую карту по одной обычной фотографии, без второй камеры и без лазерного дальномера

Основное отличие от предыдущих решений в деталях: волосы, шерсть, листва и тонкие провода раньше превращались в размытую массу, здесь границы остаются четкими

Работает это за счет того, что авторы не обучали модель с нуля, а взяли готовый генератор изображений Qwen-Image-Edit и дообучили его под новую задачу, поэтому весь процесс уложился в несколько дней на одной видеокарте вместо кластера из восьми. Тот же подход без переделки решает и смежные задачи, например определяет наклон поверхностей и глубину прозрачных объектов

Код и веса открыты, использовать можно в том числе коммерчески, но для запуска нужен компьютер на Linux и видеокарта примерно на 17 гигабайт видеопамяти

Почитать: https://www.modelscope.ai/models/huawei-bayerlab/marigold-v2-0

GitHub: https://github.com/huawei-bayerlab/marigold-v2

Пейпер: https://arxiv.org/abs/2609.08084
6
Vibe hacking: как Anthropic (создатели Claude) выявили и остановили хакеров, поручавших взлом ИИ агентам

Вы даете ИИ агенту, то есть программе, которая сама выполняет действия на компьютере, общую задачу, и он без подсказок пишет код, запускает его и проверяет результат

Anthropic выпустила отчет о злоупотреблениях своими моделями с декабря 2025 по август 2026 года, и один из главных выводов в том, что так теперь работают и злоумышленники. В отчете этот подход назван vibe hacking: человек выбирает цель и смотрит, что удалось украсть, а разведку, написание программ и повторные попытки ИИ агент выполняет сам. В конце 2025 года такая схема встречалась у государственной группы, а теперь ее используют все типы злоумышленников из отчета, вплоть до хактивиста одиночки, который провел целую кампанию на чужих ключах доступа

Ключ доступа это что-то вроде пароля, по которому программа обращается к модели, а платит за это владелец ключа, поэтому такие ключи стали отдельной добычей: их ищут в случайно опубликованном коде, крадут и перепродают. Прямые вредоносные запросы Claude в основном отклонял, в одном из случаев девять из десяти, но защита срабатывала хуже, когда работу дробили на мелкие безобидные на вид задачи в разных сессиях. Сами методы взлома при этом давно известны, ИИ не изобрел новые, а сделал старые дешевле и доступнее

Среди примеров в отчете российская госхакерская группа, у которой ИИ агенты сами переделывали вредоносную программу, если ее замечал антивирус, и группа из Китая, где агенты за месяц нашли больше десятка возможных уязвимостей нулевого дня, то есть дыр в программах, о которых еще не знают их разработчики. Один злоумышленник с помощью Claude проверил около 1,8 миллиона приложений для Android в поисках забытых в них паролей и ключей, другой украл ключи у ИИ компании и за четыре дня атаковал около тридцати фирм, пытаясь добраться до еще не выпущенной модели Claude, но не смог. Все эти аккаунты заблокированы, а данные о них Anthropic передала властям и другим компаниям там, где это было уместно

Почитать: https://www.anthropic.com/threat-intelligence-report-september-2026
This media is not supported in your browser
VIEW IN TELEGRAM
Облачные ИИ вроде Claude или Codex имеют встроенные ограничения безопасности, которые не позволяют им выполнять некоторые системные команды прямо на вашем компьютере

В ходе обсуждения с автором видео выяснилась любопытная деталь: кодинг-ассистент столкнулся с системными ограничениями безопасности и сам додумался обойти их с помощью этой локальной модели (Qwen3.8-27B)

Сам автор оригинального видео отметил, что поначалу даже не понял, как именно ИИ смог это сделать, но результат оказался полностью рабочим и неожиданным

Автор: https://www.threads.com/@turankz?igshid=NTc4MTIwNjQ2YQ==
🔥6😁21
This media is not supported in your browser
VIEW IN TELEGRAM
LM Studio представили голосовой ввод, который распознает речь прямо на компьютере и не отправляет запись в облако. Задачу ИИ агенту можно проговорить вслух, текст появляется по ходу речи. Функция работает на Mac и Windows, а с сегодняшнего обновления также на Linux. Нужен Mac на чипе Apple или компьютер с видеокартой NVIDIA, поддержку AMD обещают позже

Почитать: https://lmstudio.ai/changelog/bionic-v1.1.3