Forwarded from Анализ данных (Data analysis)
🚀 Релиз GLM-4.6V!
• GLM-4.6V (106B) - старшая модель.
• GLM-4.6V-Flash (9B) — лёгкая, быстрая, отлично подходит для локального использования.
🔥 Что внутри:
✅ Нативный multimodal tool calling -заточена на работу с изображениями и документами.
✅ Контекст 128K - переваривает 150-страничные документы или часовые видео за один прогон
✅ Visual → Action pipeline - мультимодальные агенты: “найди эту одежду онлайн” → возвращает структурированный список покупок
✅ На 50% дешевле GLM-4.5V-— ~1$ за миллион входных токенов. (На ModelScope API можно использовать бесплатно.)
→ modelscope.cn/collections/GLM-46V-37fabc27818446
• GLM-4.6V (106B) - старшая модель.
• GLM-4.6V-Flash (9B) — лёгкая, быстрая, отлично подходит для локального использования.
🔥 Что внутри:
✅ Нативный multimodal tool calling -заточена на работу с изображениями и документами.
✅ Контекст 128K - переваривает 150-страничные документы или часовые видео за один прогон
✅ Visual → Action pipeline - мультимодальные агенты: “найди эту одежду онлайн” → возвращает структурированный список покупок
✅ На 50% дешевле GLM-4.5V-— ~1$ за миллион входных токенов. (На ModelScope API можно использовать бесплатно.)
→ modelscope.cn/collections/GLM-46V-37fabc27818446
Forwarded from Анализ данных (Data analysis)
🚀 Вышел Qwen-Image-i2L от DiffSynth-Studio - первый open-source инструмент, который умеет делать LoRA-модель из одной картинки. 🖼️➡️🧠
Что можно извлекать из изображения:
🎨 Style — только стиль и эстетика
🧩 Coarse — стиль + содержание сцены
✨ Fine — улучшение детализации 1024×1024 (используется вместе с Coarse)
⚖️ Bias — подстройка под фирменный визуальный почерк Qwen-Image
Модель построена на SigLIP2 + DINOv3 + Qwen-VL.
Итог — можно взять одну картинку и быстро натренировать под неё собственную LoRA, без больших датасетов.
🔗 ModelScope: modelscope.cn/models/DiffSynth-Studio/Qwen-Image-i2L/summary
💻 Код: github.com/modelscope/DiffSynth-Studio/blob/main/examples/qwen_image/model_inference_low_vram/Qwen-Image-i2L.py
Что можно извлекать из изображения:
🎨 Style — только стиль и эстетика
🧩 Coarse — стиль + содержание сцены
✨ Fine — улучшение детализации 1024×1024 (используется вместе с Coarse)
⚖️ Bias — подстройка под фирменный визуальный почерк Qwen-Image
Модель построена на SigLIP2 + DINOv3 + Qwen-VL.
Итог — можно взять одну картинку и быстро натренировать под неё собственную LoRA, без больших датасетов.
🔗 ModelScope: modelscope.cn/models/DiffSynth-Studio/Qwen-Image-i2L/summary
💻 Код: github.com/modelscope/DiffSynth-Studio/blob/main/examples/qwen_image/model_inference_low_vram/Qwen-Image-i2L.py
Оффтопик, но как человек, который был в Помпеях месяц назад, пропустить новость не могу
https://t.me/denissexy/11037
https://t.me/denissexy/11037
Telegram
Denis Sexy IT 🤖
Помните учительница истории любила говорить «рецепт потерян» когда говорила вам про цемент древнего Рима? И вы такой да как так то, мы же технологичнее! У каждого же такое было?
В общем, в Помпеях нашли “застывшую” стройплощадку - дом, ремонт которого прервал…
В общем, в Помпеях нашли “застывшую” стройплощадку - дом, ремонт которого прервал…
🔥2
Forwarded from Machinelearning
🚀 Вышло крупное обновление Qwen3-Omni-Flash (версия 2025-12-01)
Что изменилось:
🎙️ Модель намного лучше ведёт разговоры с голосом и видео - общение звучит естественно и непрерывно
✨ Теперь можно задавать характер ИИ через system prompts, например, стиль общения или роль
🗣️ Улучшена поддержка языков: 119 письменных и 19 голосовых
😊 Голоса звучат почти как настоящие люди
Где попробовать:
🎙️ В Qwen Chat - нажмите VoiceChat или VideoChat (правый нижний угол): http://chat.qwen.ai
📝 Подробности в блоге: https://qwen.ai/blog?id=qwen3-omni-20251201
🎧 Онлайн-демо: http://hf.co/spaces/Qwen/Qwen3-Omni-Demo
🎧 Второе демо: http://modelscope.cn/studios/Qwen/Qwen3-Omni-Demo
⚡ Realtime API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-realtime-2025-12-01
📥 Offline API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-2025-12-01
@ai_machinelearning_big_data
#Qwen #llm #ml
Что изменилось:
🎙️ Модель намного лучше ведёт разговоры с голосом и видео - общение звучит естественно и непрерывно
✨ Теперь можно задавать характер ИИ через system prompts, например, стиль общения или роль
🗣️ Улучшена поддержка языков: 119 письменных и 19 голосовых
😊 Голоса звучат почти как настоящие люди
Где попробовать:
🎙️ В Qwen Chat - нажмите VoiceChat или VideoChat (правый нижний угол): http://chat.qwen.ai
📝 Подробности в блоге: https://qwen.ai/blog?id=qwen3-omni-20251201
🎧 Онлайн-демо: http://hf.co/spaces/Qwen/Qwen3-Omni-Demo
🎧 Второе демо: http://modelscope.cn/studios/Qwen/Qwen3-Omni-Demo
⚡ Realtime API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-realtime-2025-12-01
📥 Offline API: https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash-2025-12-01
@ai_machinelearning_big_data
#Qwen #llm #ml
Сегодня с утра - пара новых моделей tts - text to speech. Если у VOX-cpm 1.5 только два языка - английский и китайский, то у Google все норм, русский есть. Но не опен сорс..
А вообще прикольно, когда с нейронкой можно говорить, обязательно что-то такое замучу
А вообще прикольно, когда с нейронкой можно говорить, обязательно что-то такое замучу
X (formerly Twitter)
Google AI Studio (@GoogleAIStudio) on X
Improving Gemini Text-to-Speech models for better control and capabilities
Для любителей экзотики - маленькая модель text-to-3D. Можно ставить на свой комп
huggingface.co
IvanTang/3DGen-R1 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Почему я возлагаю большие надежды на релиз ChatGPT 5.2:
во-первых, и 5.1 был прекрасен в написании кода, причем на недорогих подписках в Claude code модель Opus недоступна, только Sonnet, а chatGPT дает доступ к последним моделям (почти);
во-вторых, теперь она знает то, что происходило до августа 2025 - это удобно, модели, которые обучались давно, местами тупят;
Контекст вырос до 400К - тоже удобно, и этого, в общем, достаточно.
Рекомендую Codex как первую опцию для программирования. Будет меньше заморочек, чем с Claude и Gemini.
во-первых, и 5.1 был прекрасен в написании кода, причем на недорогих подписках в Claude code модель Opus недоступна, только Sonnet, а chatGPT дает доступ к последним моделям (почти);
во-вторых, теперь она знает то, что происходило до августа 2025 - это удобно, модели, которые обучались давно, местами тупят;
Контекст вырос до 400К - тоже удобно, и этого, в общем, достаточно.
Рекомендую Codex как первую опцию для программирования. Будет меньше заморочек, чем с Claude и Gemini.
Вот и я о том - все скоро станут вайб-кодерами в том или ином количестве. И чем дальше, тем больше
https://t.me/seeallochnaya/3194
https://t.me/seeallochnaya/3194
Telegram
Сиолошная
OpenAI недавно выпустили Android-приложение Sora; по классике, сначала вышла iOS-версия, и затем через какое-то время команда допилила для нас, работяг. Вот только OpenAI сделали приложение командой из 4 человек и всего за 4 недели благодаря Codex Max — и…
С учетом того, что теперь вайб-кодинг - наше все, надо озаботиться правильными промптами для агентов.
Прежде чем, собственно, программировать, попросите модель сначала сделать readme.md (для людей), а потом agents.md (для агентов), для Клода - Claude.md. Чтобы этот файл получился качественным, попросите модель посмотреть этот репозиторий:
https://github.com/agentsmd/agents.md
Ну или его аналог.
Положите эти файлы в директорию проекта и запускайте Codex (рекомендую) или другого вашего агента для программирования.
Так работает вайб-кодинг..
Прежде чем, собственно, программировать, попросите модель сначала сделать readme.md (для людей), а потом agents.md (для агентов), для Клода - Claude.md. Чтобы этот файл получился качественным, попросите модель посмотреть этот репозиторий:
https://github.com/agentsmd/agents.md
Ну или его аналог.
Положите эти файлы в директорию проекта и запускайте Codex (рекомендую) или другого вашего агента для программирования.
Так работает вайб-кодинг..
GitHub
GitHub - agentsmd/agents.md: AGENTS.md — a simple, open format for guiding coding agents
AGENTS.md — a simple, open format for guiding coding agents - agentsmd/agents.md
Интересная мини-моделька на 3В специально натренированная для распознавания pdf - в последнее время, интересная для меня тема
huggingface.co
ByteDance/Dolphin-v2 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Лайфхак. Если вы регулярно используете схемы в презентациях, то их гораздо проще и удобнее рисовать в draw.io
Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
GitHub
GitHub - DayuanJiang/next-ai-draw-io: A next.js web application that integrates AI capabilities with draw.io diagrams. This app…
A next.js web application that integrates AI capabilities with draw.io diagrams. This app allows you to create, modify, and enhance diagrams through natural language commands and AI-assisted visual...
Forwarded from дядя_д
Это спустя два месяца после запуска запуска этой фичи у Anthropic. Skills – это папки с markdown-файлами и скриптами, которые позволяют LLM получать специализированные знания для конкретных задач. ChatGPT теперь имеет встроенную директорию
/home/oai/skills с готовыми skills для работы с PDF, DOCX и spreadsheets. Когда внедряли MCP (тоже антропиковская разработка) воротили носом только так. А тут что-то быстро прошло. И в стелс-режиме
сурс – https://simonwillison.net/2025/Dec/12/openai-skills/
дядь_д
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
💡 Google Переводчик запускает перевод речи в реальном времени прямо в беспроводные наушники - и да, подходят любые модели.
Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.
Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.
Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.
По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.
Глобальный релиз и версия для iOS ожидаются в 2026 году.
Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.
Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.
Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.
По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.
Глобальный релиз и версия для iOS ожидаются в 2026 году.
Большая книжка из Стенфорда - такую я бы начал читать с NotebookLM..
https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf
https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf
Какая-то мощная надстройка Claude Flow - скиллы и оркестрация агентов. Надо погружаться
GitHub
GitHub - ruvnet/ruflo: 🌊 The original agent harness. Deploy intelligent multi-player swarms, coordinate autonomous workflows, and…
🌊 The original agent harness. Deploy intelligent multi-player swarms, coordinate autonomous workflows, and build conversational AI systems. Features adaptive memory, self-learning intelligence, fed...
Сегодня с утра имел первый удачный опыт изготовления презентации с использованию ИИ. Как обычно, мне было поручено помогать детям - рисовали презентацию о церкви Санта-Мария-ин-Космедин. Делал в Google Docs.
Очень впечатляющий опыт - получилось быстро, вполне симпатично, в общем реально можно пользоваться. Нано-банана постаралась.
Правда есть один нюанс - вместо использования фотографий она рисовала картинки "по мотивам". Не видел церкви - не подкопаешься, все очень реалистично, только вот те, кто в курсе увидят, что у колокольни 5 этажей вместо 7, мозаика не такая, план немного другой, ну и т.д. Впечатление такое, что это рисунок "по памяти" - как запомнила.
Так что пользуйтесь, но проверяйте. Галлюцинаций выше крыши. Но симпатично получилось, и, главное - очень быстро, чисто на основе текста
Очень впечатляющий опыт - получилось быстро, вполне симпатично, в общем реально можно пользоваться. Нано-банана постаралась.
Правда есть один нюанс - вместо использования фотографий она рисовала картинки "по мотивам". Не видел церкви - не подкопаешься, все очень реалистично, только вот те, кто в курсе увидят, что у колокольни 5 этажей вместо 7, мозаика не такая, план немного другой, ну и т.д. Впечатление такое, что это рисунок "по памяти" - как запомнила.
Так что пользуйтесь, но проверяйте. Галлюцинаций выше крыши. Но симпатично получилось, и, главное - очень быстро, чисто на основе текста