Сегодня с утра - пара новых моделей tts - text to speech. Если у VOX-cpm 1.5 только два языка - английский и китайский, то у Google все норм, русский есть. Но не опен сорс..
А вообще прикольно, когда с нейронкой можно говорить, обязательно что-то такое замучу
А вообще прикольно, когда с нейронкой можно говорить, обязательно что-то такое замучу
X (formerly Twitter)
Google AI Studio (@GoogleAIStudio) on X
Improving Gemini Text-to-Speech models for better control and capabilities
Для любителей экзотики - маленькая модель text-to-3D. Можно ставить на свой комп
huggingface.co
IvanTang/3DGen-R1 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Почему я возлагаю большие надежды на релиз ChatGPT 5.2:
во-первых, и 5.1 был прекрасен в написании кода, причем на недорогих подписках в Claude code модель Opus недоступна, только Sonnet, а chatGPT дает доступ к последним моделям (почти);
во-вторых, теперь она знает то, что происходило до августа 2025 - это удобно, модели, которые обучались давно, местами тупят;
Контекст вырос до 400К - тоже удобно, и этого, в общем, достаточно.
Рекомендую Codex как первую опцию для программирования. Будет меньше заморочек, чем с Claude и Gemini.
во-первых, и 5.1 был прекрасен в написании кода, причем на недорогих подписках в Claude code модель Opus недоступна, только Sonnet, а chatGPT дает доступ к последним моделям (почти);
во-вторых, теперь она знает то, что происходило до августа 2025 - это удобно, модели, которые обучались давно, местами тупят;
Контекст вырос до 400К - тоже удобно, и этого, в общем, достаточно.
Рекомендую Codex как первую опцию для программирования. Будет меньше заморочек, чем с Claude и Gemini.
Вот и я о том - все скоро станут вайб-кодерами в том или ином количестве. И чем дальше, тем больше
https://t.me/seeallochnaya/3194
https://t.me/seeallochnaya/3194
Telegram
Сиолошная
OpenAI недавно выпустили Android-приложение Sora; по классике, сначала вышла iOS-версия, и затем через какое-то время команда допилила для нас, работяг. Вот только OpenAI сделали приложение командой из 4 человек и всего за 4 недели благодаря Codex Max — и…
С учетом того, что теперь вайб-кодинг - наше все, надо озаботиться правильными промптами для агентов.
Прежде чем, собственно, программировать, попросите модель сначала сделать readme.md (для людей), а потом agents.md (для агентов), для Клода - Claude.md. Чтобы этот файл получился качественным, попросите модель посмотреть этот репозиторий:
https://github.com/agentsmd/agents.md
Ну или его аналог.
Положите эти файлы в директорию проекта и запускайте Codex (рекомендую) или другого вашего агента для программирования.
Так работает вайб-кодинг..
Прежде чем, собственно, программировать, попросите модель сначала сделать readme.md (для людей), а потом agents.md (для агентов), для Клода - Claude.md. Чтобы этот файл получился качественным, попросите модель посмотреть этот репозиторий:
https://github.com/agentsmd/agents.md
Ну или его аналог.
Положите эти файлы в директорию проекта и запускайте Codex (рекомендую) или другого вашего агента для программирования.
Так работает вайб-кодинг..
GitHub
GitHub - agentsmd/agents.md: AGENTS.md — a simple, open format for guiding coding agents
AGENTS.md — a simple, open format for guiding coding agents - agentsmd/agents.md
Интересная мини-моделька на 3В специально натренированная для распознавания pdf - в последнее время, интересная для меня тема
huggingface.co
ByteDance/Dolphin-v2 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Лайфхак. Если вы регулярно используете схемы в презентациях, то их гораздо проще и удобнее рисовать в draw.io
Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
GitHub
GitHub - DayuanJiang/next-ai-draw-io: A next.js web application that integrates AI capabilities with draw.io diagrams. This app…
A next.js web application that integrates AI capabilities with draw.io diagrams. This app allows you to create, modify, and enhance diagrams through natural language commands and AI-assisted visual...
Forwarded from дядя_д
Это спустя два месяца после запуска запуска этой фичи у Anthropic. Skills – это папки с markdown-файлами и скриптами, которые позволяют LLM получать специализированные знания для конкретных задач. ChatGPT теперь имеет встроенную директорию
/home/oai/skills с готовыми skills для работы с PDF, DOCX и spreadsheets. Когда внедряли MCP (тоже антропиковская разработка) воротили носом только так. А тут что-то быстро прошло. И в стелс-режиме
сурс – https://simonwillison.net/2025/Dec/12/openai-skills/
дядь_д
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
💡 Google Переводчик запускает перевод речи в реальном времени прямо в беспроводные наушники - и да, подходят любые модели.
Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.
Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.
Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.
По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.
Глобальный релиз и версия для iOS ожидаются в 2026 году.
Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.
Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.
Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.
По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.
Глобальный релиз и версия для iOS ожидаются в 2026 году.
Большая книжка из Стенфорда - такую я бы начал читать с NotebookLM..
https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf
https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf
Какая-то мощная надстройка Claude Flow - скиллы и оркестрация агентов. Надо погружаться
GitHub
GitHub - ruvnet/ruflo: 🌊 The original agent harness. Deploy intelligent multi-player swarms, coordinate autonomous workflows, and…
🌊 The original agent harness. Deploy intelligent multi-player swarms, coordinate autonomous workflows, and build conversational AI systems. Features adaptive memory, self-learning intelligence, fed...
Сегодня с утра имел первый удачный опыт изготовления презентации с использованию ИИ. Как обычно, мне было поручено помогать детям - рисовали презентацию о церкви Санта-Мария-ин-Космедин. Делал в Google Docs.
Очень впечатляющий опыт - получилось быстро, вполне симпатично, в общем реально можно пользоваться. Нано-банана постаралась.
Правда есть один нюанс - вместо использования фотографий она рисовала картинки "по мотивам". Не видел церкви - не подкопаешься, все очень реалистично, только вот те, кто в курсе увидят, что у колокольни 5 этажей вместо 7, мозаика не такая, план немного другой, ну и т.д. Впечатление такое, что это рисунок "по памяти" - как запомнила.
Так что пользуйтесь, но проверяйте. Галлюцинаций выше крыши. Но симпатично получилось, и, главное - очень быстро, чисто на основе текста
Очень впечатляющий опыт - получилось быстро, вполне симпатично, в общем реально можно пользоваться. Нано-банана постаралась.
Правда есть один нюанс - вместо использования фотографий она рисовала картинки "по мотивам". Не видел церкви - не подкопаешься, все очень реалистично, только вот те, кто в курсе увидят, что у колокольни 5 этажей вместо 7, мозаика не такая, план немного другой, ну и т.д. Впечатление такое, что это рисунок "по памяти" - как запомнила.
Так что пользуйтесь, но проверяйте. Галлюцинаций выше крыши. Но симпатично получилось, и, главное - очень быстро, чисто на основе текста
Успехи вчерашнего дня - откопал на просторах гитхаба и установил программку chezmoi. Прозносится как шемуа - по-французки "у меня". Предназначена для того, чтобы настройки в скрытых директориях синхронизировать между разными компьюетрами. Поскольку их у меня много, удобно иметь одни и те же настройки Клода, промпты, МСР-сервера и пр. одинаковые везде.
Синхронизация происходит по принципу звезды - база в зашифрованном виде хранится в GitHub, обновления на компе пушим туда, и наоборот, при обновлении на компе подтягиваем последнюю версию из GitHub.
Бонус - настроена синхронизация с bitwarden, которым я активно пользуюсь. Благодаря этому я, можно сказать, финализировал свою организацию секретов. Теперь это работает так:
- в директории проекта лежит файл json вида
{
"GPT_PASS": { "id": "GPT", "field": "password" }
}
- для такого файла есть скрипт, который вытаскивает пароль из bitwarden - он в скрытой директории, синхронизирован через chezmoi;
- далее сделан скрипт-обертка, которой вместо запуска основного питоновского файла проекта
python main.py
сначала идет в bitwarden, получает пароли, а потом запускает питоновский файл. Выглядит это как команда
secure-run python main.py
- как итог, пароли появляются только для питона, "на лету", нейронка их не видит ни в один момент. И нигде эти пароли в явном виде не прописаны.
Ровно то, что хотел. Очень доволен и собой, и программой
Синхронизация происходит по принципу звезды - база в зашифрованном виде хранится в GitHub, обновления на компе пушим туда, и наоборот, при обновлении на компе подтягиваем последнюю версию из GitHub.
Бонус - настроена синхронизация с bitwarden, которым я активно пользуюсь. Благодаря этому я, можно сказать, финализировал свою организацию секретов. Теперь это работает так:
- в директории проекта лежит файл json вида
{
"GPT_PASS": { "id": "GPT", "field": "password" }
}
- для такого файла есть скрипт, который вытаскивает пароль из bitwarden - он в скрытой директории, синхронизирован через chezmoi;
- далее сделан скрипт-обертка, которой вместо запуска основного питоновского файла проекта
python main.py
сначала идет в bitwarden, получает пароли, а потом запускает питоновский файл. Выглядит это как команда
secure-run python main.py
- как итог, пароли появляются только для питона, "на лету", нейронка их не видит ни в один момент. И нигде эти пароли в явном виде не прописаны.
Ровно то, что хотел. Очень доволен и собой, и программой
www.chezmoi.io
chezmoi - chezmoi
Manage your dotfiles across multiple machines, securely.
🤯1
Forwarded from Анализ данных (Data analysis)
Microsoft запустила VibeVoice Realtime на Hugging Face - лёгкую стриминговую text-to-speech модель, которая начинает озвучивать текст примерно за 300 миллисекунд.
Идеально для живых данных и разговоров с LLM.
huggingface.co/microsoft/VibeVoice-Realtime-0.5B
Идеально для живых данных и разговоров с LLM.
huggingface.co/microsoft/VibeVoice-Realtime-0.5B
👍1
Forwarded from Machinelearning
XiYan-SQL - это open-source решение, позволяющее генерировать, анализировать и выполнять SQL-запросы с использованием больших языковых моделей. Инструмент ориентирован на ускорение исследования данных и автоматизацию рутинных операций, связанных с запросами к базе.
Ключевые возможности:
- Генерация SQL из естественного языка -пользователь формулирует задачу обычными словами, а система преобразует её в корректный SQL-запрос.
- Интерактивная работа с базой данных - запросы можно оперативно уточнять, редактировать и выполнять, получая быстрый цикл обратной связи.
- Поддержка нескольких СУБД - PostgreSQL, MySQL, SQLite и другие.
- 🛠️ Минимальная конфигурация - подходит для анализа данных, прототипирования и облегчения доступа к базе без сложной инфраструктуры.
🔗 Репозиторий: github.com/XGenerationLab/XiYan-SQL
@ai_machinelearning_big_data
#sql #llm #ai #opensource #database #datatools #postgresql
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Ключевые характеристики:
- MoE-архитектура: 30B параметров всего, ~3.5B активных
- Контекст до 1 миллиона токенов
- Гибридная архитектура:
- 23 слоя Mamba-2 + MoE
- 6 attention-слоёв
- Баланс между скоростью и качеством рассуждений
Требования:
- необходимо около 24 ГБ видеопамяти для локального запуска
Модель хорошо подходит для длинных диалогов, анализа документов и reasoning-задач
Интересный пример того, как MoE и Mamba начинают реально снижать требования к железу, сохраняя масштаб контекста и качество.
Для обучения Super и Ultra используется NVFP4 и новая архитектура Latent Mixture of Experts. Она позволяет задействовать в четыре раза больше экспертов при той же стоимости инференса. По сути, модель становится «умнее» за счёт более гибкого выбора экспертов, а не за счёт постоянной активации всех параметров.
Дополнительно применяется Multi-Token Prediction, что ускоряет обучение и улучшает качество рассуждений на длинных последовательностях. Это особенно важно для agentic и multi-agent сценариев, где модели работают с длинным контекстом и сложными цепочками решений.
NVIDIA публикует не только веса, но и данные для предобучения и постобучения, а также технические детали, которые объясняют, почему эти модели одновременно быстрые и сильные.
Такой уровень открытости - редкость для моделей этого масштаба и хороший сигнал для индустрии.@ai_machinelearning_big_data
#AI #LLM #NVIDIA #Nemotron3 #OpenSource #MachineLearning
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM