Лайфхак. Если вы регулярно используете схемы в презентациях, то их гораздо проще и удобнее рисовать в draw.io
Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
GitHub
GitHub - DayuanJiang/next-ai-draw-io: A next.js web application that integrates AI capabilities with draw.io diagrams. This app…
A next.js web application that integrates AI capabilities with draw.io diagrams. This app allows you to create, modify, and enhance diagrams through natural language commands and AI-assisted visual...
Forwarded from дядя_д
Это спустя два месяца после запуска запуска этой фичи у Anthropic. Skills – это папки с markdown-файлами и скриптами, которые позволяют LLM получать специализированные знания для конкретных задач. ChatGPT теперь имеет встроенную директорию
/home/oai/skills с готовыми skills для работы с PDF, DOCX и spreadsheets. Когда внедряли MCP (тоже антропиковская разработка) воротили носом только так. А тут что-то быстро прошло. И в стелс-режиме
сурс – https://simonwillison.net/2025/Dec/12/openai-skills/
дядь_д
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
💡 Google Переводчик запускает перевод речи в реальном времени прямо в беспроводные наушники - и да, подходят любые модели.
Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.
Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.
Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.
По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.
Глобальный релиз и версия для iOS ожидаются в 2026 году.
Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.
Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.
Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.
По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.
Глобальный релиз и версия для iOS ожидаются в 2026 году.
Большая книжка из Стенфорда - такую я бы начал читать с NotebookLM..
https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf
https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf
Какая-то мощная надстройка Claude Flow - скиллы и оркестрация агентов. Надо погружаться
GitHub
GitHub - ruvnet/ruflo: 🌊 The original agent harness. Deploy intelligent multi-player swarms, coordinate autonomous workflows, and…
🌊 The original agent harness. Deploy intelligent multi-player swarms, coordinate autonomous workflows, and build conversational AI systems. Features adaptive memory, self-learning intelligence, fed...
Сегодня с утра имел первый удачный опыт изготовления презентации с использованию ИИ. Как обычно, мне было поручено помогать детям - рисовали презентацию о церкви Санта-Мария-ин-Космедин. Делал в Google Docs.
Очень впечатляющий опыт - получилось быстро, вполне симпатично, в общем реально можно пользоваться. Нано-банана постаралась.
Правда есть один нюанс - вместо использования фотографий она рисовала картинки "по мотивам". Не видел церкви - не подкопаешься, все очень реалистично, только вот те, кто в курсе увидят, что у колокольни 5 этажей вместо 7, мозаика не такая, план немного другой, ну и т.д. Впечатление такое, что это рисунок "по памяти" - как запомнила.
Так что пользуйтесь, но проверяйте. Галлюцинаций выше крыши. Но симпатично получилось, и, главное - очень быстро, чисто на основе текста
Очень впечатляющий опыт - получилось быстро, вполне симпатично, в общем реально можно пользоваться. Нано-банана постаралась.
Правда есть один нюанс - вместо использования фотографий она рисовала картинки "по мотивам". Не видел церкви - не подкопаешься, все очень реалистично, только вот те, кто в курсе увидят, что у колокольни 5 этажей вместо 7, мозаика не такая, план немного другой, ну и т.д. Впечатление такое, что это рисунок "по памяти" - как запомнила.
Так что пользуйтесь, но проверяйте. Галлюцинаций выше крыши. Но симпатично получилось, и, главное - очень быстро, чисто на основе текста
Успехи вчерашнего дня - откопал на просторах гитхаба и установил программку chezmoi. Прозносится как шемуа - по-французки "у меня". Предназначена для того, чтобы настройки в скрытых директориях синхронизировать между разными компьюетрами. Поскольку их у меня много, удобно иметь одни и те же настройки Клода, промпты, МСР-сервера и пр. одинаковые везде.
Синхронизация происходит по принципу звезды - база в зашифрованном виде хранится в GitHub, обновления на компе пушим туда, и наоборот, при обновлении на компе подтягиваем последнюю версию из GitHub.
Бонус - настроена синхронизация с bitwarden, которым я активно пользуюсь. Благодаря этому я, можно сказать, финализировал свою организацию секретов. Теперь это работает так:
- в директории проекта лежит файл json вида
{
"GPT_PASS": { "id": "GPT", "field": "password" }
}
- для такого файла есть скрипт, который вытаскивает пароль из bitwarden - он в скрытой директории, синхронизирован через chezmoi;
- далее сделан скрипт-обертка, которой вместо запуска основного питоновского файла проекта
python main.py
сначала идет в bitwarden, получает пароли, а потом запускает питоновский файл. Выглядит это как команда
secure-run python main.py
- как итог, пароли появляются только для питона, "на лету", нейронка их не видит ни в один момент. И нигде эти пароли в явном виде не прописаны.
Ровно то, что хотел. Очень доволен и собой, и программой
Синхронизация происходит по принципу звезды - база в зашифрованном виде хранится в GitHub, обновления на компе пушим туда, и наоборот, при обновлении на компе подтягиваем последнюю версию из GitHub.
Бонус - настроена синхронизация с bitwarden, которым я активно пользуюсь. Благодаря этому я, можно сказать, финализировал свою организацию секретов. Теперь это работает так:
- в директории проекта лежит файл json вида
{
"GPT_PASS": { "id": "GPT", "field": "password" }
}
- для такого файла есть скрипт, который вытаскивает пароль из bitwarden - он в скрытой директории, синхронизирован через chezmoi;
- далее сделан скрипт-обертка, которой вместо запуска основного питоновского файла проекта
python main.py
сначала идет в bitwarden, получает пароли, а потом запускает питоновский файл. Выглядит это как команда
secure-run python main.py
- как итог, пароли появляются только для питона, "на лету", нейронка их не видит ни в один момент. И нигде эти пароли в явном виде не прописаны.
Ровно то, что хотел. Очень доволен и собой, и программой
www.chezmoi.io
chezmoi - chezmoi
Manage your dotfiles across multiple machines, securely.
🤯1
Forwarded from Анализ данных (Data analysis)
Microsoft запустила VibeVoice Realtime на Hugging Face - лёгкую стриминговую text-to-speech модель, которая начинает озвучивать текст примерно за 300 миллисекунд.
Идеально для живых данных и разговоров с LLM.
huggingface.co/microsoft/VibeVoice-Realtime-0.5B
Идеально для живых данных и разговоров с LLM.
huggingface.co/microsoft/VibeVoice-Realtime-0.5B
👍1
Forwarded from Machinelearning
XiYan-SQL - это open-source решение, позволяющее генерировать, анализировать и выполнять SQL-запросы с использованием больших языковых моделей. Инструмент ориентирован на ускорение исследования данных и автоматизацию рутинных операций, связанных с запросами к базе.
Ключевые возможности:
- Генерация SQL из естественного языка -пользователь формулирует задачу обычными словами, а система преобразует её в корректный SQL-запрос.
- Интерактивная работа с базой данных - запросы можно оперативно уточнять, редактировать и выполнять, получая быстрый цикл обратной связи.
- Поддержка нескольких СУБД - PostgreSQL, MySQL, SQLite и другие.
- 🛠️ Минимальная конфигурация - подходит для анализа данных, прототипирования и облегчения доступа к базе без сложной инфраструктуры.
🔗 Репозиторий: github.com/XGenerationLab/XiYan-SQL
@ai_machinelearning_big_data
#sql #llm #ai #opensource #database #datatools #postgresql
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Ключевые характеристики:
- MoE-архитектура: 30B параметров всего, ~3.5B активных
- Контекст до 1 миллиона токенов
- Гибридная архитектура:
- 23 слоя Mamba-2 + MoE
- 6 attention-слоёв
- Баланс между скоростью и качеством рассуждений
Требования:
- необходимо около 24 ГБ видеопамяти для локального запуска
Модель хорошо подходит для длинных диалогов, анализа документов и reasoning-задач
Интересный пример того, как MoE и Mamba начинают реально снижать требования к железу, сохраняя масштаб контекста и качество.
Для обучения Super и Ultra используется NVFP4 и новая архитектура Latent Mixture of Experts. Она позволяет задействовать в четыре раза больше экспертов при той же стоимости инференса. По сути, модель становится «умнее» за счёт более гибкого выбора экспертов, а не за счёт постоянной активации всех параметров.
Дополнительно применяется Multi-Token Prediction, что ускоряет обучение и улучшает качество рассуждений на длинных последовательностях. Это особенно важно для agentic и multi-agent сценариев, где модели работают с длинным контекстом и сложными цепочками решений.
NVIDIA публикует не только веса, но и данные для предобучения и постобучения, а также технические детали, которые объясняют, почему эти модели одновременно быстрые и сильные.
Такой уровень открытости - редкость для моделей этого масштаба и хороший сигнал для индустрии.@ai_machinelearning_big_data
#AI #LLM #NVIDIA #Nemotron3 #OpenSource #MachineLearning
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Сегодня, кстати, ждем новый опенсорсный релиз (привет, Gemma 4!) от Google
Должны завезти уже совсем скоро
Должны завезти уже совсем скоро
С этим постом для меня началась новая эпоха. Обратите внимание на второй пункт - стартап Миры Муратти (один из бывших боссов OpenAI) Thinking machines запустила полноценную эксплуатацию Tinker - продукта, который позволяет обучать нейронки ламерам.
Идея такая - есть классические способы обучения типа Lora. Классические опенсорс модели - Qwen, Llama, gpt-oss и пр. Рябята уже реализовали все нужные алгоритмы для обучения, от вас нужны просто данные и выбрать модель. Цены на обучение привлекательные.
Например, если я хочу научить небольшую модель оформлять протоколы в моем стиле, нужно несколько десятков протоколов, до сотни, это 1-2 миллиона токенов обучения - и у Тинкера это обойдется в 0,5-1 доллара для небольших моделей. Вообще халява.
Бонус еще с том, что обученный слой можно будет перенести и на квантованные модели.
Да, еще один бонус - обученные модели можно запускать не у себя, а у облачных провайдеров вычислений, например, Replicate. Это, кстати, позволяет погонять дообученную модель на разном квантовании и посмотреть, что лучше подходит.
В общем, не зря Мире отвалили несколько миллиардов на разработку, когда продукт был только на бумаге.
Идея такая - есть классические способы обучения типа Lora. Классические опенсорс модели - Qwen, Llama, gpt-oss и пр. Рябята уже реализовали все нужные алгоритмы для обучения, от вас нужны просто данные и выбрать модель. Цены на обучение привлекательные.
Например, если я хочу научить небольшую модель оформлять протоколы в моем стиле, нужно несколько десятков протоколов, до сотни, это 1-2 миллиона токенов обучения - и у Тинкера это обойдется в 0,5-1 доллара для небольших моделей. Вообще халява.
Бонус еще с том, что обученный слой можно будет перенести и на квантованные модели.
Да, еще один бонус - обученные модели можно запускать не у себя, а у облачных провайдеров вычислений, например, Replicate. Это, кстати, позволяет погонять дообученную модель на разном квантовании и посмотреть, что лучше подходит.
В общем, не зря Мире отвалили несколько миллиардов на разработку, когда продукт был только на бумаге.
Thinking Machines Lab
Tinker
Tinker is a training API for researchers and developers.
🔥2
Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
Большинство качественных - слишком медленные.
И почти ни одна не решает вопрос аутентичности аудио на уровне архитектуры.
Resemble AI закрыли все три проблемы сразу.
Chatterbox Turbo 0 это:
🟢 <150 мс до первого звука
🟢 Качество уровня SOTA - превосходит более крупные проприетарные модели
🟢 Естественные, программируемые эмоции и интонации
🟢 Zero-shot клонирование голоса всего по 5 секундам аудио
🟢 PerTh watermarking - проверяемое и аутентифицированное аудио
🟢 Полностью open source, никакой «чёрной магии»
Редкий пример, когда скорость, качество и безопасность не идут на компромисс, а работают вместе.
HuggingFace: https://huggingface.co/spaces/ResembleAI/chatterbox-turbo-demo
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
Моделька на 309B параметров, из которых одновременно активны лишь 15B - за счёт умной MoE-маршрутизации модель достигает высокой эффективности. Сравнима с DeepSeek-V3.2 на общих бенчмарках.
MiMo-V2-Flash заточена под агентов и работу с инструментами.
🔥 Ключевые особенности
🏗️ Hybrid Attention
5:1 чередование 128-window SWA и Global Attention
Контекст — 256K токенов
🏆 Код и разработка
• SWE-Bench Verified - 73.4%
• SWE-Bench Multilingual - 71.7%
Новый SOTA среди open-source моделей
🚀 Скорость
• До 150 output tokens/sec
• Day-0 поддержка от @lmsysorg
MiMo-V2-Flash - пример того, как MoE-архитектуры выходят на новый уровень: быстрее, дешевле и готовые к агентным сценариям.
🤗 Model: http://hf.co/XiaomiMiMo/MiMo-V2-Flash
📝 Blog: http://mimo.xiaomi.com/blog/mimo-v2-flash
📄 Technical Report: http://github.com/XiaomiMiMo/MiMo-V2-Flash/blob/main/paper.pdf
🎨 AI Studio: http://aistudio.xiaomimimo.com
#AI #LLM #MoE #OpenSource #AgenticAI #MachineLearning #DeepLearning #GenAI #SWEBench #Xiaomi #AIModels
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Новый день – новые модели: Nvidia выпустили прекрасную Nemotron 3 Nano
В ней 31.6B параметров, но активных всего 3.6B (это MoE). Запустить можно на 24ГБ RAM. Зафайнтюнить – на 60ГБ VRAM.
Контекст – 1 миллион токенов.
По метрикам, внимание, обходит Qwen3-30В-А3В-Thinking и GPT-oss-20B-А4В. Получается, модель не просто конкурентоспособная, но и лучшая в своем классе на многих основных бенчмарках: SWE-bench, GPQA и др.
И еще – моделька очень шустрая, выдает больше 350 токенов в секунду. Это в 2-3 раза быстрее того же Qwen.
Nvidia умеют удивлять.
Веса (+датасеты!) | Статья | Блогпост
P.S. Любителям опенсорса напоминаем, что сегодня также ждем новенькую Gemma-3
В ней 31.6B параметров, но активных всего 3.6B (это MoE). Запустить можно на 24ГБ RAM. Зафайнтюнить – на 60ГБ VRAM.
Контекст – 1 миллион токенов.
По метрикам, внимание, обходит Qwen3-30В-А3В-Thinking и GPT-oss-20B-А4В. Получается, модель не просто конкурентоспособная, но и лучшая в своем классе на многих основных бенчмарках: SWE-bench, GPQA и др.
И еще – моделька очень шустрая, выдает больше 350 токенов в секунду. Это в 2-3 раза быстрее того же Qwen.
Nvidia умеют удивлять.
Веса (+датасеты!) | Статья | Блогпост
P.S. Любителям опенсорса напоминаем, что сегодня также ждем новенькую Gemma-3