Forwarded from Data Secrets
Вышла Gemini 2.5 Flash Image
Причем, уверены, многим из вас модель уже знакома под другим именем: nano-banana. Она всю неделю хайповала в X. В целом, не было секретом, что это моделька от Google (их топы прямо скажем недвусмысленно намекали). Сегодня наконец-то мы дождались официального релиза.
Итак, это модель для генерации и редактирования изображений. И если генерацией уже никого не удивить, то способности Gemini к эдиту действительно заслуживают внимания.
Отлично держит айдентику персонажа и консистентность картинки в целом. На вход можно давать и текст, и картинки: перенос стиля работает, судя по примерам, очень прилично.
Еще из интересного: пишут, что модель может рассуждать. То есть не просто генерирует в тупую, а руководствуется общей логикой мира, которую черпает из знаний Gemini 2.5 Flash. Например, может самостоятельно понять, что должно происходить на следующем кадре сценария (см пример 3).
Ну короче, новый SOTA ИИ-фотошоп, расходимся
Блогпост
– Попробовать можно в AI Studio (стоит 39$ за тысячу изображений, в целом человечно)
Причем, уверены, многим из вас модель уже знакома под другим именем: nano-banana. Она всю неделю хайповала в X. В целом, не было секретом, что это моделька от Google (их топы прямо скажем недвусмысленно намекали). Сегодня наконец-то мы дождались официального релиза.
Итак, это модель для генерации и редактирования изображений. И если генерацией уже никого не удивить, то способности Gemini к эдиту действительно заслуживают внимания.
Отлично держит айдентику персонажа и консистентность картинки в целом. На вход можно давать и текст, и картинки: перенос стиля работает, судя по примерам, очень прилично.
Еще из интересного: пишут, что модель может рассуждать. То есть не просто генерирует в тупую, а руководствуется общей логикой мира, которую черпает из знаний Gemini 2.5 Flash. Например, может самостоятельно понять, что должно происходить на следующем кадре сценария (см пример 3).
Ну короче, новый SOTA ИИ-фотошоп, расходимся
Блогпост
– Попробовать можно в AI Studio (стоит 39$ за тысячу изображений, в целом человечно)
Forwarded from Анализ данных (Data analysis)
MiniCPM-V 4.5 🚀
Свежий релиз от OpenBMB — мультимодальная модель, которая умеет понимать картинки, несколько изображений подряд и даже видео. Главное: запуск возможен прямо на телефоне 📱
Что внутри:
✨ Достигает SOTA результатов в задачах vision+language
✨ 96× сжатие видеотокенов → можно анализировать длинные ролики с высоким FPS
✨ Два режима работы: быстрые ответы (Fast) или глубокие рассуждения (Deep)
✨ Мощный OCR для документов
✨ Поддержка более чем 30 языков
🔗 Подробнее: https://huggingface.co/openbmb/MiniCPM-V-4_5
@data_analysis_ml
Свежий релиз от OpenBMB — мультимодальная модель, которая умеет понимать картинки, несколько изображений подряд и даже видео. Главное: запуск возможен прямо на телефоне 📱
Что внутри:
✨ Достигает SOTA результатов в задачах vision+language
✨ 96× сжатие видеотокенов → можно анализировать длинные ролики с высоким FPS
✨ Два режима работы: быстрые ответы (Fast) или глубокие рассуждения (Deep)
✨ Мощный OCR для документов
✨ Поддержка более чем 30 языков
🔗 Подробнее: https://huggingface.co/openbmb/MiniCPM-V-4_5
@data_analysis_ml
эйай ньюз
xAI наконец-то релизнули веса Grok 2 Хоть Grok 2 и безнадёжно устарел, веса все равно представляют интерес и показывают что компания не забыла про опенсорс. Ну и это хороший пример другим компаниям — круто было бы иметь в публичном доступе веса депрекейтнутых…
Утренние новости
- Qwen научился читать веб-страницы (теперь ждем, когда научится там писать :);
- NVIDEA релизнула Nemotron Nano 9b - SOTA среди моделей такого размера, но по тестам обгоняет и большие модели - например, все модели Meta. Для локальных устройств очень интересно;
- новая модель InternVL 3.5 в 32 разных размерах и вариантах. Зачем она и чем так хороша, пока не понял;
- ссылка на Wan 2.2 от Qwen для генерации видео по аудио. Опенсорс, размер небольшой, можно качать ));
- Google признался в авторстве нано-бананы, теперь заходим через aistudio, но доступ есть и для платных пользователей hagging face, причем там должны быть неплохие лимиты;
- Claude дает первым пользователям доступ к плагину для браузера. Оно интересно, но ресурсы будет выжирать моментально. Вчера задал вопрос Opus, после того, как Sonnet в Claude code начал ходить по кругу - один поиск в интернете, и моя сессия закончилась. Без плана Мах с браузером даже не пытайтесь;
- Google запускает синхронный перевод на мобильных устройствах. Ай, молодцы!
- Qwen научился читать веб-страницы (теперь ждем, когда научится там писать :);
- NVIDEA релизнула Nemotron Nano 9b - SOTA среди моделей такого размера, но по тестам обгоняет и большие модели - например, все модели Meta. Для локальных устройств очень интересно;
- новая модель InternVL 3.5 в 32 разных размерах и вариантах. Зачем она и чем так хороша, пока не понял;
- ссылка на Wan 2.2 от Qwen для генерации видео по аудио. Опенсорс, размер небольшой, можно качать ));
- Google признался в авторстве нано-бананы, теперь заходим через aistudio, но доступ есть и для платных пользователей hagging face, причем там должны быть неплохие лимиты;
- Claude дает первым пользователям доступ к плагину для браузера. Оно интересно, но ресурсы будет выжирать моментально. Вчера задал вопрос Opus, после того, как Sonnet в Claude code начал ходить по кругу - один поиск в интернете, и моя сессия закончилась. Без плана Мах с браузером даже не пытайтесь;
- Google запускает синхронный перевод на мобильных устройствах. Ай, молодцы!
huggingface.co
Nemotron-Pre-Training-Dataset - a nvidia Collection
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
С утра возимся с Клодом: "сначала откатлю изменения...". Все-таки русский язык сложный не только для детей ))
😁1💯1
Очень интересная модель генерации голоса, оптимизирована для процессоров Apple, размер - 1Гб, можно уменьшить до 500 квантизацией. Одна проблема - русского нет
Telegram
Анализ данных (Data analysis)
Marvis-TTS 🔥🚀
Новая локальная TTS-модель, которая работает в реальном времени прямо на потребительских устройствах: Apple Silicon, iPhone, iPad и других.
В отличие от классических моделей, требующих полный ввод текста или жертвующих скоростью, Marvis…
Новая локальная TTS-модель, которая работает в реальном времени прямо на потребительских устройствах: Apple Silicon, iPhone, iPad и других.
В отличие от классических моделей, требующих полный ввод текста или жертвующих скоростью, Marvis…
🔥1😢1
Forwarded from Blog Hanzo
привет! пока я отдыхаю,
незаметно для многих прошел
Agentic AI summit
там реально топовые знания по LLM агентам
конечно!
я уже собрал для вас самые вкусные выступления в одном видео
Agentic AI summit, august 2025. The best lectures of all
русская сокращенная версия будет завтра
незаметно для многих прошел
Agentic AI summit
там реально топовые знания по LLM агентам
конечно!
я уже собрал для вас самые вкусные выступления в одном видео
Agentic AI summit, august 2025. The best lectures of all
👏1
Курсы по RAG на стероидах на графах от топ-менеджера Neo4j (лидирующий пакет, на котором строятся модели). Конечно, от Эндрю Нг
www.deeplearning.ai
Agentic Knowledge Graph Construction
Build a multi-agent system that plans, designs, and constructs a knowledge graph.
Forwarded from Anton Vdovitchenko — One Man Enterprise
Привет, друзья! Заканчивается лето и начинается осень, а значит и следующий рывок в бизнесе, карьере и учёбе.
Я достаточно много общаюсь с предпринимателями и бизнесом про AI, и в последнее время начал замечать некую фрустрацию в определении будущего направления развития.
Совершенно очевидно, что тот тектонический сдвиг, который происходит сейчас, изменит наше представление о «традиционных» методах ведения бизнеса и полностью перекроит их.
Уже сейчас надо задумываться о том, кем каждый станет через год, чем будет заниматься, над чем работать, чему посвящать свою жизнь.
Я думаю, что настоящая мощь новых технологий для профессионалов и тех, кто хочет ими стать, заключается в возможности стать one-man enterprise.
В недавнем интервью Сэм Альтман (CEO OpenAI) говорил, что ждет появление компании с миллиардной капитализацией, в которой работает всего лишь один человек — её основатель.
Еще 5 лет назад это казалось бы полнейшим бредом, а сегодня выглядит более чем правдоподобно.
Инструменты, которые нас окружают, становятся мощнее каждый день. И если выстроить вокруг себя структуру, эта структура будет эволюционировать вместе с развитием инструментов и моделей, которые лежат в её основании.
Поднимем бокалы Желаю каждому через год стать руководителем и владельцем своей небольшой компании, где большинство функций выполняется языковыми моделями и механиками, с ними связанными.
А если не хватает мотивации, то можно обратиться к знаменитой цитате об этом Тёмы Лебедева. Не буду её приводить, она довольно известна :-)
Теперь о планах. Во второй половине сентября провести курс n8n-advanced, куда я включу «рецепты» по созданию мультиагентных систем на базе n8n с учетом всего наработанного опыта.
Запрыгнуть в лодку никогда не поздно. Если хотите освоить n8n до вменяемого уровня, на просторах YouTube есть замечательный человек, которого зовут Nate Herk. У него есть мастер-класс на восемь с половиной часов, это как раз на выходные.
Дерзайте! https://www.youtube.com/watch?v=Ey18PDiaAYI
p.s. Если есть проблемы с YT, то вот тут скачанный мастер-класс в mp4.
Я достаточно много общаюсь с предпринимателями и бизнесом про AI, и в последнее время начал замечать некую фрустрацию в определении будущего направления развития.
Совершенно очевидно, что тот тектонический сдвиг, который происходит сейчас, изменит наше представление о «традиционных» методах ведения бизнеса и полностью перекроит их.
Уже сейчас надо задумываться о том, кем каждый станет через год, чем будет заниматься, над чем работать, чему посвящать свою жизнь.
Я думаю, что настоящая мощь новых технологий для профессионалов и тех, кто хочет ими стать, заключается в возможности стать one-man enterprise.
В недавнем интервью Сэм Альтман (CEO OpenAI) говорил, что ждет появление компании с миллиардной капитализацией, в которой работает всего лишь один человек — её основатель.
Еще 5 лет назад это казалось бы полнейшим бредом, а сегодня выглядит более чем правдоподобно.
Инструменты, которые нас окружают, становятся мощнее каждый день. И если выстроить вокруг себя структуру, эта структура будет эволюционировать вместе с развитием инструментов и моделей, которые лежат в её основании.
А если не хватает мотивации, то можно обратиться к знаменитой цитате об этом Тёмы Лебедева. Не буду её приводить, она довольно известна :-)
Теперь о планах. Во второй половине сентября провести курс n8n-advanced, куда я включу «рецепты» по созданию мультиагентных систем на базе n8n с учетом всего наработанного опыта.
Запрыгнуть в лодку никогда не поздно. Если хотите освоить n8n до вменяемого уровня, на просторах YouTube есть замечательный человек, которого зовут Nate Herk. У него есть мастер-класс на восемь с половиной часов, это как раз на выходные.
Дерзайте! https://www.youtube.com/watch?v=Ey18PDiaAYI
p.s. Если есть проблемы с YT, то вот тут скачанный мастер-класс в mp4.
👍2❤🔥1💅1🦄1
Яндекс выпустил новую модель YandexGPT-5.1 Pro. Доступно через Yandex Cloud Ai Studio, можно получить бесплатно 10 ответов в час (для нормальной работы этого маловато, особенно при наличии бесплатных альтернатив с куда более щадящими лимитами). Показатели достаточно интересные - на уровне лучше gpt-oss-120b. Скачать как опенсорс, как я понимаю, нельзя. Хорошо, что модели новые выходят, но все-таки хотелось ставить себе на сервер отечественную модель, а не китайский или американский аналог...
https://t.me/anti_agi/1028
https://t.me/anti_agi/1028
Yandex AI Studio
Yandex AI Studio — Yandex AI technologies for business
Yandex AI Studio platform integrates Yandex models and tools so you can create your own AI solutions and implement them in your business processes and products.
😁1
Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 Tencent выпустила HunyuanVideo-Foley — открытую систему, которая умеет автоматически превращать видео и текст в качественный звук (Text-Video-to-Audio, TV2A).
🔊 Модель может автоматически генерировать профессиональный звук, который точно совпадает с картинкой и смыслом происходящего.
✨ Главное:
- Универсальность — обучена на 100 000+ часов данных, создаёт звук для любых сцен: от природы до мультфильмов.
- Согласованность текста и видео — новая архитектура *MMDiT* учитывает одновременно изображение и описание, создавая многослойные эффекты: и главный звук, и фоновое окружение.
- Качество студийного уровня — благодаря функции потерь *REPA* и *Audio VAE* звук получается чистым и стабильным, без шумов и артефактов.
📈 На тестах HunyuanVideo-Foley показала лучшие результаты среди открытых моделей: более качественный звук, точная синхронизация с картинкой и учёт контекста сцены.
👉 Попробовать: https://hunyuan.tencent.com/video/zh?tabIndex=0
🌐 Project Page: https://szczesnys.github.io/hunyuanvideo-foley/
🔗 Code: https://github.com/Tencent-Hunyuan/HunyuanVideo-Foley
📄 Report: https://arxiv.org/abs/2508.16930
🤗 Hugging Face: https://huggingface.co/tencent/HunyuanVideo-Foley
@data_analysis_ml
🔊 Модель может автоматически генерировать профессиональный звук, который точно совпадает с картинкой и смыслом происходящего.
✨ Главное:
- Универсальность — обучена на 100 000+ часов данных, создаёт звук для любых сцен: от природы до мультфильмов.
- Согласованность текста и видео — новая архитектура *MMDiT* учитывает одновременно изображение и описание, создавая многослойные эффекты: и главный звук, и фоновое окружение.
- Качество студийного уровня — благодаря функции потерь *REPA* и *Audio VAE* звук получается чистым и стабильным, без шумов и артефактов.
📈 На тестах HunyuanVideo-Foley показала лучшие результаты среди открытых моделей: более качественный звук, точная синхронизация с картинкой и учёт контекста сцены.
👉 Попробовать: https://hunyuan.tencent.com/video/zh?tabIndex=0
🌐 Project Page: https://szczesnys.github.io/hunyuanvideo-foley/
🔗 Code: https://github.com/Tencent-Hunyuan/HunyuanVideo-Foley
📄 Report: https://arxiv.org/abs/2508.16930
🤗 Hugging Face: https://huggingface.co/tencent/HunyuanVideo-Foley
@data_analysis_ml
Forwarded from Сиолошная
Специалисты антивируса ESET обнаружили первый компьютерный вирус на основе... LLM. Вирус незаметно скачивает GPT-OSS-20B модель (14 гигабайт) и запускает её через Ollama API для того, чтобы агент на основе модели лазил по локальным файлам и принимал решения на лету.
В вирус захардкожено несколько промптов, которые:
— просят сгенерировать код на LUA, который обходит файлы в разных папках и печатает их контент
— определяют, есть ли в файлах чувствительная информация
— генерируют персонализированное сообщение для пользователя о том, как именно будет использоваться его контент (удаление/шифрование/публикация). В этот текст также добавляется биткоин-кошелек для перевода, правда это похоже на заглушку: адрес принадлежит создателю Bitcoin Satoshi Nakamoto
— генерируют код для шифрования файлов (правда я не понял, почему это нельзя было захардкодить — может потому что такой код легко обнаруживается антивирусами?)
В общем, скорее всего это прототип или разработка, а не полностью работоспособный вирус, развёрнутый в реальных условиях, но вот такой вот прецедент. Ещё 2-3 поколения локальных моделек, которые станут и умнее, и меньше — и сё!
Вирус назвали PromptLock👀
В вирус захардкожено несколько промптов, которые:
— просят сгенерировать код на LUA, который обходит файлы в разных папках и печатает их контент
— определяют, есть ли в файлах чувствительная информация
— генерируют персонализированное сообщение для пользователя о том, как именно будет использоваться его контент (удаление/шифрование/публикация). В этот текст также добавляется биткоин-кошелек для перевода, правда это похоже на заглушку: адрес принадлежит создателю Bitcoin Satoshi Nakamoto
— генерируют код для шифрования файлов (правда я не понял, почему это нельзя было захардкодить — может потому что такой код легко обнаруживается антивирусами?)
В общем, скорее всего это прототип или разработка, а не полностью работоспособный вирус, развёрнутый в реальных условиях, но вот такой вот прецедент. Ещё 2-3 поколения локальных моделек, которые станут и умнее, и меньше — и сё!
Вирус назвали PromptLock
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Neural Shit
Пока мы все использовали нейронки по их прямому назначению (спрашивали как срать не снимая свитер и узнавали альтернативные рецепты батиного жареного супа ), мамкины хацкеры усилились и начали использовать LLM для своих грязных целей.
Что произошло:
Хакеры взломали npm аккаунт разработчиков пакета nx (им пользуются 2.5 млн человек) и слегка его модифицировали, добавив вредоноса. Вредоносный код, внедренный в пакет, воровал API-ключи, пароли от криптокошельков и прочие интересные ништяки с компов жертв.
При чем тут нейронки?
Самое интересное — как именно он это делал. Вместо того чтобы писать сложный код для поиска файлов, который легко детектится антивирусами, этот вирус проверял, установлен ли на компьютере ИИ-ассистент (Gemini CLI или Claude Code CLI).
И сли да, то зловред просто отправлял нейронке текстовый промпт: "Рекурсивно найди на диске все файлы, связанные с кошельками (wallet, .key, metamask, id_rsa и т.д.), и сохрани их пути в текстовый файл".
После этот файл шифровался в base64 дважды и заливался в гитхаб репозиторий.
Кажется, тот анекдот про албанский вирус был совсем не анекдотом. Теперь интересно, как это будут контрить разработчики антивирусов.
тут подробнее
Что произошло:
Хакеры взломали npm аккаунт разработчиков пакета nx (им пользуются 2.5 млн человек) и слегка его модифицировали, добавив вредоноса. Вредоносный код, внедренный в пакет, воровал API-ключи, пароли от криптокошельков и прочие интересные ништяки с компов жертв.
При чем тут нейронки?
Самое интересное — как именно он это делал. Вместо того чтобы писать сложный код для поиска файлов, который легко детектится антивирусами, этот вирус проверял, установлен ли на компьютере ИИ-ассистент (Gemini CLI или Claude Code CLI).
И сли да, то зловред просто отправлял нейронке текстовый промпт: "Рекурсивно найди на диске все файлы, связанные с кошельками (wallet, .key, metamask, id_rsa и т.д.), и сохрани их пути в текстовый файл".
После этот файл шифровался в base64 дважды и заливался в гитхаб репозиторий.
Кажется, тот анекдот про албанский вирус был совсем не анекдотом. Теперь интересно, как это будут контрить разработчики антивирусов.
тут подробнее
Вот стопудово не зря писал про свой Bitwarden (менеджер для паролей), С нейронками прямо чувствуешь, как они лезут не туда и читают не то. И пофигу им на твои промпты, если очень хочется
🏆1
Оптимизированная модель got-oss-20b для запуска на Маках с 16гб оперативки
brew install llama.cpp
llama-server -hf ggml-org/gpt-oss-20b-GGUF --n-cpu-moe 12 -fa -c 32768 --jinja --no-mmap
Открывается в браузере через порт 8080:
http://127.0.0.1:8080
Подробнее про установки
https://github.com/ggml-org/llama.cpp/discussions/15396
brew install llama.cpp
llama-server -hf ggml-org/gpt-oss-20b-GGUF --n-cpu-moe 12 -fa -c 32768 --jinja --no-mmap
Открывается в браузере через порт 8080:
http://127.0.0.1:8080
Подробнее про установки
https://github.com/ggml-org/llama.cpp/discussions/15396
GitHub
guide : running gpt-oss with llama.cpp · ggml-org llama.cpp · Discussion #15396
NoteThis guide is a live document. Feedback and benchmark numbers are welcome - the guide will be updated accordingly. Overview This is a detailed guide for running the new gpt-oss models locally w...
Microsoft выпустил две модельки, причем вторая - первая модель, сделанная компанией самостоятельно от начала и до конца. Все делают модельки. Кроме Apple.
X (formerly Twitter)
Mustafa Suleyman (@mustafasuleyman) on X
Excited to share our first @MicrosoftAI in-house models: MAI-Voice-1 and MAI-1-preview. Details and how you can test below, with lots more to come⬇️
OpenAI - тоже новая модель, в этот раз speech-to-speech. Ты ей слово - она тебе два, и понеслось…
Токены стоят дорого, но направление интересное
А еще - выпустили Realtime API с МСР сервером и другими плюшками для лучшего взаимодействия с моделью
https://cookbook.openai.com/examples/realtime_prompting_guide
Токены стоят дорого, но направление интересное
А еще - выпустили Realtime API с МСР сервером и другими плюшками для лучшего взаимодействия с моделью
https://cookbook.openai.com/examples/realtime_prompting_guide
OpenAI
Livestreams
Watch OpenAI livestreams featuring product launches, demos, and announcements. Explore past events, discover the latest AI innovations, and stay up to date.
Есть моделька и от китайцев. В этот раз - создание аудио по промпту и видео. Озвучка, одним словом..
👉Try it now: hunyuan.tencent.com/video/zh?tabIn…
🌐Project Page: szczesnys.github.io/hunyuanvideo-f…
🔗Code: github.com/Tencent-Hunyua…
📄Technical Report: arxiv.org/abs/2508.16930
🤗Hugging Face: huggingface.co/tencent/Hunyua…
👉Try it now: hunyuan.tencent.com/video/zh?tabIn…
🌐Project Page: szczesnys.github.io/hunyuanvideo-f…
🔗Code: github.com/Tencent-Hunyua…
📄Technical Report: arxiv.org/abs/2508.16930
🤗Hugging Face: huggingface.co/tencent/Hunyua…
Tencent
腾讯混元
腾讯研发的大语言模型
Во тоже интересное - модель, работающая локально, распознает происходящее на веб-камере
https://x.com/huggingface/status/1961026395808678288?s=46
И такая же штука от Google
https://x.com/geminiapp/status/1958924396527329329?s=46
https://x.com/huggingface/status/1961026395808678288?s=46
И такая же штука от Google
https://x.com/geminiapp/status/1958924396527329329?s=46
X (formerly Twitter)
Hugging Face (@huggingface) on X
RT @DataChaz: This is wild.
A real-time webcam demo using SmolVLM from @huggingface and llama.cpp! 🤯
Running fully local on a MacBook M3.…
A real-time webcam demo using SmolVLM from @huggingface and llama.cpp! 🤯
Running fully local on a MacBook M3.…