Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Китайский Seedance 2.0 ещё не вышел официально, но многим уже дали ранний доступ.
Посмотрите что получается — я давно не удивлялся, последний раз так было с Veo 3.
1080p, генерация видео сразу со звуком, липсинк на 8 языках.
Модель принимает текст, картинки, видео и аудио одновременно, можно комбинировать в одном запросе.
Будет доступно в CapCut, а вот тут больше примеров.
@tips_ai #news
Посмотрите что получается — я давно не удивлялся, последний раз так было с Veo 3.
1080p, генерация видео сразу со звуком, липсинк на 8 языках.
Модель принимает текст, картинки, видео и аудио одновременно, можно комбинировать в одном запросе.
Будет доступно в CapCut, а вот тут больше примеров.
@tips_ai #news
GitHub выпустил гайд для программирования агентов, работающих с GitHub, на человеческом языке. Формат может стать удачным
Еще интересная штука с просторов GitHub - с помощью реверс-инжиниринга умельцы нашли скрытый сокет в Claude code, который позволяет подключать другие интерфейсы.
Здесь не столько сам интерфейс любопытен, сколько возможность построить собственный интерфейс для Клода..
https://github.com/The-Vibe-Company/companion
Здесь не столько сам интерфейс любопытен, сколько возможность построить собственный интерфейс для Клода..
https://github.com/The-Vibe-Company/companion
GitHub
GitHub - The-Vibe-Company/companion: Persistent AI companions on Box, powered by Pi. Simple web, durable execution, reproducible…
Persistent AI companions on Box, powered by Pi. Simple web, durable execution, reproducible local development. - The-Vibe-Company/companion
🎙 Textream — бесплатный телепромптер для macOS
И еще одна любопытная штука - телесуфлер для macOS. Для тех, кто должен что-то читать на камеру - никому кроме вас не видно, следит за текстом, должно работать на русском.
Открытое приложение, которое подсвечивает текст скрипта в реальном времени по мере того, как вы говорите. Распознавание речи — локальное, на устройстве, без облака.
Что умеет:
• Dynamic Island-оверлей поверх всех окон — видите только вы
• Три режима: отслеживание голоса, автопрокрутка, прокрутка по голосу
• Поддержка десятков языков, включая русский
• Вывод на внешний экран или iPad через Sidecar
• Шрифты: Sans, Serif, Mono, OpenDyslexic
• Весит 913 КБ
Установка:
brew install f/textream/textream
Требуется macOS 15 Sequoia.
GitHub: github.com/f/textream
Сайт: textream.fka.dev
И еще одна любопытная штука - телесуфлер для macOS. Для тех, кто должен что-то читать на камеру - никому кроме вас не видно, следит за текстом, должно работать на русском.
Открытое приложение, которое подсвечивает текст скрипта в реальном времени по мере того, как вы говорите. Распознавание речи — локальное, на устройстве, без облака.
Что умеет:
• Dynamic Island-оверлей поверх всех окон — видите только вы
• Три режима: отслеживание голоса, автопрокрутка, прокрутка по голосу
• Поддержка десятков языков, включая русский
• Вывод на внешний экран или iPad через Sidecar
• Шрифты: Sans, Serif, Mono, OpenDyslexic
• Весит 913 КБ
Установка:
brew install f/textream/textream
Требуется macOS 15 Sequoia.
GitHub: github.com/f/textream
Сайт: textream.fka.dev
GitHub
GitHub - f/textream: Textream is a free macOS teleprompter app for streamers, interviewers, and presenters. It highlights your…
Textream is a free macOS teleprompter app for streamers, interviewers, and presenters. It highlights your script in real-time as you speak, displayed in a beautiful Dynamic Island overlay. With ext...
Forwarded from Анализ данных (Data analysis)
⚡️ Deep Research без интернета? Теперь это возможно.
OpenResearcher — это полностью офлайн-пайплайн для генерации длинных исследовательских траекторий (100+ шагов), которые имитируют реальный процесс работы агента в интернете:
search → open → find → анализ → вывод.
И всё это:
- без API поиска
- без ограничений по rate limit
- без нестабильности результатов
- полностью воспроизводимо
Что под капотом:
- GPT-OSS-120B генерирует исследовательские цепочки
- Локальный поисковик + корпус 10 трлн токенов
- 15 млн документов FineWeb
- 10 000 «золотых» отобранных источников
- Явные примитивы браузинга (поиск, открытие, извлечение), а не просто retrieve-and-read
- Reject sampling — сохраняются только успешные длинные траектории
Почему это важно?
Главная проблема обучения research-агентов — длинные цепочки действий.
Обычные датасеты короткие и не учат модель думать на горизонте десятков шагов.
Здесь результат впечатляет:
SFT на этих траекториях повышает точность модели Nemotron-3-Nano-30B-A3B
с 20.8% → 54.8% на BrowseComp-Plus
(+34% абсолютного прироста)
Что это значит для индустрии:
- Deep-research агентов можно обучать без дорогих онлайн-запросов
- Появляется воспроизводимое обучение tool-use
- Можно масштабировать генерацию «мышления через действия»
- Это шаг к стабильным автономным исследовательским AI
Открытое релизнули всё:
- Код, поисковик и рецепт корпуса
- ~96K длинных исследовательских траекторий
- Логи оценки
- Обученные модели
- Онлайн-демо
GitHub: https://github.com/TIGER-AI-Lab/OpenResearcher
Models & Data: https://huggingface.co/collections/TIGER-Lab/openresearcher
Demo: https://huggingface.co/spaces/OpenResearcher/OpenResearcher
Eval logs: https://huggingface.co/datasets/OpenResearcher/OpenResearcher-Eval-Logs
OpenResearcher — это полностью офлайн-пайплайн для генерации длинных исследовательских траекторий (100+ шагов), которые имитируют реальный процесс работы агента в интернете:
search → open → find → анализ → вывод.
И всё это:
- без API поиска
- без ограничений по rate limit
- без нестабильности результатов
- полностью воспроизводимо
Что под капотом:
- GPT-OSS-120B генерирует исследовательские цепочки
- Локальный поисковик + корпус 10 трлн токенов
- 15 млн документов FineWeb
- 10 000 «золотых» отобранных источников
- Явные примитивы браузинга (поиск, открытие, извлечение), а не просто retrieve-and-read
- Reject sampling — сохраняются только успешные длинные траектории
Почему это важно?
Главная проблема обучения research-агентов — длинные цепочки действий.
Обычные датасеты короткие и не учат модель думать на горизонте десятков шагов.
Здесь результат впечатляет:
SFT на этих траекториях повышает точность модели Nemotron-3-Nano-30B-A3B
с 20.8% → 54.8% на BrowseComp-Plus
(+34% абсолютного прироста)
Что это значит для индустрии:
- Deep-research агентов можно обучать без дорогих онлайн-запросов
- Появляется воспроизводимое обучение tool-use
- Можно масштабировать генерацию «мышления через действия»
- Это шаг к стабильным автономным исследовательским AI
Открытое релизнули всё:
- Код, поисковик и рецепт корпуса
- ~96K длинных исследовательских траекторий
- Логи оценки
- Обученные модели
- Онлайн-демо
GitHub: https://github.com/TIGER-AI-Lab/OpenResearcher
Models & Data: https://huggingface.co/collections/TIGER-Lab/openresearcher
Demo: https://huggingface.co/spaces/OpenResearcher/OpenResearcher
Eval logs: https://huggingface.co/datasets/OpenResearcher/OpenResearcher-Eval-Logs
Forwarded from Machinelearning
🎨 Qwen-Image-2.0 - новое поколение генерации изображений Qwen моделей
Alibaba представили Qwen-Image-2.0 - модель, которая выводит генерацию визуала на уровень дизайнерских инструментов. Теперь ИИ не просто рисует картинки, а умеет создавать полноценные слайды, постеры и визуалы с аккуратной типографикой и высоким качеством деталей.
Что умеет модель:
- Написал абзац → получил готовый слайд
- Описал сцену → получил фотореалистичное изображение в 2K
- Добавил текст → он отображается корректно, без «ломаных» букв (русский поддерживает, но работает кривовато)
Ключевые улучшения:
- Профессиональная типографика - поддержка длинных промптов до 1K токенов для презентаций, постеров и комиксов
- Нативное разрешение 2K с высокой детализацией
- Точное и стабильное отображение текста
- Единый режим генерации и редактирования изображений
- Облегчённая архитектура — быстрее инференс и ниже стоимость
Попробовать: https://chat.qwen.ai/?inputFeature=t2i
Подробнее: https://qwen.ai/blog?id=qwen-image-2.0
@ai_machinelearning_big_data
#qwen
Alibaba представили Qwen-Image-2.0 - модель, которая выводит генерацию визуала на уровень дизайнерских инструментов. Теперь ИИ не просто рисует картинки, а умеет создавать полноценные слайды, постеры и визуалы с аккуратной типографикой и высоким качеством деталей.
Что умеет модель:
- Написал абзац → получил готовый слайд
- Описал сцену → получил фотореалистичное изображение в 2K
- Добавил текст → он отображается корректно, без «ломаных» букв (русский поддерживает, но работает кривовато)
Ключевые улучшения:
- Профессиональная типографика - поддержка длинных промптов до 1K токенов для презентаций, постеров и комиксов
- Нативное разрешение 2K с высокой детализацией
- Точное и стабильное отображение текста
- Единый режим генерации и редактирования изображений
- Облегчённая архитектура — быстрее инференс и ниже стоимость
Попробовать: https://chat.qwen.ai/?inputFeature=t2i
Подробнее: https://qwen.ai/blog?id=qwen-image-2.0
@ai_machinelearning_big_data
#qwen
Почитайте про skills от человека, который сделал самый популярный репозиторий с ними в сети. Это может принести очень много пользы и радикально изменить то, как вы работаете с моделью, и что получаете на выходе
X (formerly Twitter)
Shubham Saboo (@Saboo_Shubham_) on X
The Only Skills that Matter in 2026
Для любителей Obsidian (а я с третьего захода стал поклонником программы - это такой опенсорсный Notion) плагин для работы через терминал. Дополнительное удобство для агентов
https://x.com/obsdmd/status/2021241386268233897?s=46
https://x.com/obsdmd/status/2021241386268233897?s=46
X (formerly Twitter)
Obsidian (@obsdmd) on X
Obsidian CLI
https://t.co/bHkoyv3pYs
https://t.co/bHkoyv3pYs
Еще одна любопытная программа - «концентрированная текстовая память». Не RAG, просто суммаризация только важного в тексте. Любопытно
https://x.com/mastra/status/2021280193273336131?s=46
https://x.com/mastra/status/2021280193273336131?s=46
X (formerly Twitter)
Mastra (@mastra) on X
Observational Memory: A Human-Inspired Memory System for AI Agents
Forwarded from Machinelearning
Zhipu AI выкатила в своем он-лайн сервисе chat.z.ai новую языковую модель GLM-5.
Официальных спецификаций на данный момент нету, но по слухам, масштаб и эффективность нового флагмана удвоены, а контекстное окно достигает 200 тыс. токенов.
Первые пользователи отмечают неплохие способности модели в написании кода и логическом выводе.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
🔥Курс по Deep Learning (Fall 2024) от MIT доступен онлайн!
Один из лекторов - Phillip Isola, чень крутой ресерчер в Computer Vision. Олды помнят его легендарный CycleGAN (2017).
Выложили и слайды, и доп материалы, и видео лекций, и домашки (можете по-честному их выполнить и отправить на проверку в Claude Code :))
Очень качественный базовый курс. Если хотите разобраться в Deep Learning немного глубже промптов, то очень рекомендую к просмотру!
Курс целиком можно скачать тут:
https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/video_galleries/lecture-videos/
P.S. Еще один хрестоматийный курс по DL - это Стенфордский CS231 от Карпатого.
#ликбез
@ai_newz
Один из лекторов - Phillip Isola, чень крутой ресерчер в Computer Vision. Олды помнят его легендарный CycleGAN (2017).
Выложили и слайды, и доп материалы, и видео лекций, и домашки (можете по-честному их выполнить и отправить на проверку в Claude Code :))
Очень качественный базовый курс. Если хотите разобраться в Deep Learning немного глубже промптов, то очень рекомендую к просмотру!
Курс целиком можно скачать тут:
https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/video_galleries/lecture-videos/
P.S. Еще один хрестоматийный курс по DL - это Стенфордский CS231 от Карпатого.
#ликбез
@ai_newz
Forwarded from Refat Talks: Tech & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Slidev - пожалуй лучший способ создавать презентации в эпоху AI. Markdown-first, с мощным тулингом и экспортом в PDF и PowerPoint. Делюсь своим опытом.
Инструментов для презентаций сейчас вагон - от классических PowerPoint и Google Slides до Figma Slides, Gamma, и в каждом втором туле от NodebookLM до Perplexity. Но для своих выступлений, перепробовав кучу вариантов, я как file-first адепт искал инструмент на базе markdown. Сначала это был Marp - хорош для минимальных слайдов, но ограничен. В Slidev я нашел все что не хватало.
Почему markdown для презентаций - это мощно
Все крутится вокруг идеи что слайды - это текстовый файл. Это значит:
- Хирургическая точность - find & replace, regex, массовые правки за секунды. В одной из моих през было около 50 логотипов технологий - конечно проще было это сделать кодом чем тягать в визуальном редакторе.
- Рефакторинг и рестайлинг - поменял тему в одной строчке frontmatter и все слайды перестроились. Поменял шрифт - тоже одна строчка.
- Git-friendly - нормальные диффы, версионирование, бранчи. Презентация лежит рядом с кодом проекта.
- Hackable - это веб-приложение под капотом (Vue 3 + Vite), если чего-то не хватает, можно встроить что угодно: npm-пакеты, API-запросы, интерактивные компоненты. Одна только возможность использовать какие-нибудь Lucide-icons чего стоит.
- Это просто быстрее - ты тратишь меньше времени на программы презентаций и больше на сам контент.
Что доступно из коробки
- Presenter View - заметки, таймер, preview следующего слайда, remote control с телефона (работает как веб-приложение)
- Экспорт в PDF, PPTX, PNG или деплой как статический сайт.
- Готовые layouts, темы через npm, UnoCSS для стилизации
- Mermaid-диаграммы, LaTeX-формулы
- Подсветка кода с пошаговым выделением строк (`{2|3-5|7}`)
- Magic Move - анимированная трансформация одного блока кода в другой
- Monaco Editor - live coding с автокомплитом прямо в слайде
- Рисование на слайдах во время презентации
- VS Code расширение - preview, навигация по слайдам, drag-and-drop
- И многое другое, но в минимальной комплектации это все может быть просто один файл
AI-ready
Есть Agent Skill который ставится одной командой
Slidev позиционируется как "presentation slides for developers". Но имхо с AI-агентами это доступно примерно всем - тем более с таким удобным тулингом. Будете делать презентации - попробуйте!
🔥➕🔁 @nobilix
Инструментов для презентаций сейчас вагон - от классических PowerPoint и Google Slides до Figma Slides, Gamma, и в каждом втором туле от NodebookLM до Perplexity. Но для своих выступлений, перепробовав кучу вариантов, я как file-first адепт искал инструмент на базе markdown. Сначала это был Marp - хорош для минимальных слайдов, но ограничен. В Slidev я нашел все что не хватало.
Почему markdown для презентаций - это мощно
Все крутится вокруг идеи что слайды - это текстовый файл. Это значит:
- Хирургическая точность - find & replace, regex, массовые правки за секунды. В одной из моих през было около 50 логотипов технологий - конечно проще было это сделать кодом чем тягать в визуальном редакторе.
- Рефакторинг и рестайлинг - поменял тему в одной строчке frontmatter и все слайды перестроились. Поменял шрифт - тоже одна строчка.
- Git-friendly - нормальные диффы, версионирование, бранчи. Презентация лежит рядом с кодом проекта.
- Hackable - это веб-приложение под капотом (Vue 3 + Vite), если чего-то не хватает, можно встроить что угодно: npm-пакеты, API-запросы, интерактивные компоненты. Одна только возможность использовать какие-нибудь Lucide-icons чего стоит.
- Это просто быстрее - ты тратишь меньше времени на программы презентаций и больше на сам контент.
Что доступно из коробки
- Presenter View - заметки, таймер, preview следующего слайда, remote control с телефона (работает как веб-приложение)
- Экспорт в PDF, PPTX, PNG или деплой как статический сайт.
- Готовые layouts, темы через npm, UnoCSS для стилизации
- Mermaid-диаграммы, LaTeX-формулы
- Подсветка кода с пошаговым выделением строк (`{2|3-5|7}`)
- Magic Move - анимированная трансформация одного блока кода в другой
- Monaco Editor - live coding с автокомплитом прямо в слайде
- Рисование на слайдах во время презентации
- VS Code расширение - preview, навигация по слайдам, drag-and-drop
- И многое другое, но в минимальной комплектации это все может быть просто один файл
slides.md и одна команда npx slidevAI-ready
Есть Agent Skill который ставится одной командой
npx skills add slidevjs/slidev (хех, сначала у меня был свой, но недавно выкатили официальный). Плюс презентацию можно разбить на отдельные .md файлы - супер-удобно с точки зрения контекст инжиниринга.Slidev позиционируется как "presentation slides for developers". Но имхо с AI-агентами это доступно примерно всем - тем более с таким удобным тулингом. Будете делать презентации - попробуйте!
🔥➕🔁 @nobilix
❤3
Forwarded from Machine learning Interview
⚡ Anthropic выложили 6 полноценных курсов по ИИ - бесплатно.
По уровню это легко заменяет обучение на десятки или даже сотни тысяч рублей.
Внутри:
- сотни уроков и практики
- интерактивные задания и квизы
- реальные кейсы работы с Claude
- сертификаты после прохождения
Если работаешь с AI, агентами или API - это база, которую сейчас проходят разработчики в топ-компаниях.
Что можно изучить:
• Работа с Claude API
https://anthropic.skilljar.com/claude-with-the-anthropic-api
• Введение в Model Context Protocol (MCP)
https://anthropic.skilljar.com/introduction-to-model-context-protocol
• Claude в Amazon Bedrock
https://anthropic.skilljar.com/claude-in-amazon-bedrock
• Claude в Google Cloud (Vertex AI)
https://anthropic.skilljar.com/claude-with-google-vertex
• Продвинутый MCP
https://anthropic.skilljar.com/model-context-protocol-advanced-topics
• Claude Code на практике
https://anthropic.skilljar.com/claude-code-in-action
Это не «обзорные лекции».
Это реальные навыки для тех, кто хочет строить AI-продукты, агентов и автоматизацию.
По уровню это легко заменяет обучение на десятки или даже сотни тысяч рублей.
Внутри:
- сотни уроков и практики
- интерактивные задания и квизы
- реальные кейсы работы с Claude
- сертификаты после прохождения
Если работаешь с AI, агентами или API - это база, которую сейчас проходят разработчики в топ-компаниях.
Что можно изучить:
• Работа с Claude API
https://anthropic.skilljar.com/claude-with-the-anthropic-api
• Введение в Model Context Protocol (MCP)
https://anthropic.skilljar.com/introduction-to-model-context-protocol
• Claude в Amazon Bedrock
https://anthropic.skilljar.com/claude-in-amazon-bedrock
• Claude в Google Cloud (Vertex AI)
https://anthropic.skilljar.com/claude-with-google-vertex
• Продвинутый MCP
https://anthropic.skilljar.com/model-context-protocol-advanced-topics
• Claude Code на практике
https://anthropic.skilljar.com/claude-code-in-action
Это не «обзорные лекции».
Это реальные навыки для тех, кто хочет строить AI-продукты, агентов и автоматизацию.
Forwarded from Machinelearning
Это первый open-weight релиз в серии Qwen3.5.
Лицензия Apache 2.0.
Что интересного:
• Мультимодальная модель
Понимает текст и изображения
• Создана для AI-агентов
Оптимизирована для реальных задач: планирование, работа с инструментами, многошаговые действия.
• Новая архитектура
Hybrid Linear Attention + Sparse MoE + масштабное обучение с reinforcement learning.
• Высокая скорость
Заявлено что моделька примерно в 6- 9 раз быстрее, чем у предыдущей Qwen3-Max.
• Глобальная модель
Поддержка 201 языков и диалектов.
Модели такого уровня в открытом доступе:
- можно запускать AI у себя, без зависимости от API
- полный контроль над данными
- возможность строить собственных агентов и продукты
- снижение стоимости на масштабах
Qwen3.5-397B - реально в топе
Модель либо:
• на 1 месте,
• либо рядом с GPT-5.2 / Claude Opus 4.5 / Gemini 3 Pro почти во всех бенчмарках.
@ai_machinelearning_big_data
#qwen #ai #llm #ml #opensource
Please open Telegram to view this post
VIEW IN TELEGRAM
Google тестирует WebMCP - это крутая штука. Если сейчас можно подключить нейронку к браузеру и она будет ходить по сайтам, делая скриншоты, или можно парсить сайты, скачивая html код, то после запуска МСР это все будет не нужно - данные сайта будут передаваться нейронке так, чтобы она могла получить все данные и заполнить все формы без скриншотов, через код, пользуясь этим МСР сервером.
Это сильно и быстро изменит то, как мы пользуемся интернетом.
Это сильно и быстро изменит то, как мы пользуемся интернетом.
❤1