Denoiselab
506 subscribers
1.6K photos
205 videos
4 files
1.86K links
Denoiselab

_Data Analysis
_Artificial Intelegence
_Cognitive tech

Информация в канале служит только для ознакомления и не является призывом к действию. Не нарушайте законы РФ и других стран. Мы не несем отвественность за ваши действия или бездействия.
Download Telegram
Пара Питерских зарисовок из ИТМО. Посмотрел я там несколько крутых практик для аппробации работы со студентами. Да и в целом вуз мне понравился.

Шагают они бодро, очень много лабораторий. Только вот архитектура немного витееватая, даже летом лабы активно работают. В одной студенты ваяли какую-то роборуку, в другой химики в халатах и перчатках че-то смешивали. Кодеров куча, всех фасонов и направлений.

Корпуса новые, поговорили с Альфа банком, тоже очень бодрые. Рассказал им про VibeAnalysing и VibeOps. Удивились про последнее, сказали первый раз такое видим, вдохновились.

Коворкинги и опенспейс модные. В общем отличная получилась поездка.

Курс хороший они сделали, притащили производственников и сразу все заиграло. Материалу куча, лекции до сих пор все смотрю, реально интересно. Пару вещей конечно уже не так делают в проде, но все равно норм.

С погодой, просто, нереально повезло. Лето в лучшей своей версии. Питер - респект !
3
https://balticrally.ru/ - ехал в поезде познакомился с человеком он был на Балтик Ралли 2026. Это ежегодный мотофестиваль. Длится 4 дня. Судя по сайту очень масштабный. Если вы фанат мототехники, вам стоит заглянуть.
Один из самых высоких православных памятников России появился в Екатеринбурге

Скульптурную композицию «Собор
Архистратига Михаила» открыли в день города, уникальный монумент стал подарком Русской медной компании и её основателя Игоря Алтушкина столице Урала. Высота памятника – около 16 метров, для его создания потребовалось несколько лет.

Открытие памятника стало частью двухдневного фестиваля «Энергия РМК» со спортивными соревнованиями, шоу, турнирами, дрифтом и выступлениями звезд российской и мировой эстрады.
В России нашли новый минерал, который дороже золота. Его обнаружили учёные в Кировском руднике Хибинского массива и назвали «кольским ашкрофтином».

По оценкам исследователей, даже тонкий налёт этого минерала на породе стоит около $145 за миллиметр. Его уникальность — в необычном составе и одной из самых сложных структур среди всех известных науке минералов.
🤯1
⚡️ Крутейший сервис, который поможет понять, как устроены нейросети —

Нашёл отличную вещь, которая поможет разобраться в устройстве нейросетей — Interactive Tools.

Это библиотека интерактивных визуализаций, демонстрирующих, как работают такие нейросети, как ChatGPT, Midjourney и другие.

Например, Transformer Explainer наглядно объясняет, как ChatGPT выбирает следующее слово в тексте (подсказка: это как T9, но на максималках) и почему иногда выдаётся не самое вероятное слово.

📌 Interactive Tools
👀  Audio Generation 2024-2026

Недавно собрался силами провести семинар в МИСиС от AIKC. Рассказал как сейчас делают генерацию музыки и речи. От подготовки данных из большых сырых корпусов, до применения RL. Поделился своими инсайдами и направлениями ресерча. Презу приложил к посту. Запись выложат на Stepic. Тут поделюсь сухой выжимкой без моих размышлений и комментариев)

Структура семинара поделилась на общие паттерны для речи и музыки, и специфичные для речи и музыки. Некоторые идеи отлично ложатся с одного домена на другой, но еще не были применены для речи/музыки.

1. Говоря о данных, а у нас корпуса могут доходить до 5М часов как в Qwen3-TTS, или 1М часов как в Inworld TTS-1, или 27М семпов музыки как в ACE-Step-1,5... Хочется уметь автоматически и качественно отбирать данные для претрейна/CPT/SFT. В речи есть объективные метрики типа WER/PER, SIM, всякие MOS'ы. Это более приятный сценарий, в отличие от музыки, где нет объективных метрик. Поэтому сейчас хороший сценарий для музыки - использовать frontier LLM модели типа Gemini 2.5 Pro. Авторы ACE-Step предложили занятный self-evolving pipeline.

2. Говоря о репрезентациях аудио, сейчас идет смещение к аудио кодекам. В речи главный приоритет - стриминг. Низкий битрейт 12-25Hz, casual-only decoder для реалтайма, а попытки сжать битрейт еще ниже до 5Hz обычно неудачны, НО недавно вышел SiTok. В музыке стриминг не нужен, нам скорее хочется сделать кодек работающий с 48kHz аудио и длинным контекстом. Длина последовательности при 25Hz ~= 7500*количество кодбуков, бюджет растет до десятков тысяч токенов. Плюс хочется учитывать когерентность между треками: вокал и разные инструменты аккомпанемента. Авторы LeVo придумали классный кодек для этого. А для работы с длинным контекстом хорошее решение предложили авторы Qwen3-TTS, сделали curriculum по контексту с 8 до 32к токенов. Конечно сейчас также мейнстрим разными способами добавлять семантику в кодеки, стандарт - стиль Mimi Codec.

3. Собрав данные и определив репрезентации, подумаем о архитектуре. Тут мне нравится схема от BLIP3o-Next, хоть тут и про картинки. Их AR+Diffusion пайплайн. Накидывают RL на AR для хорошего понимания сцены, позиционирования объектов, прочей семантики. Потом через кросс-атеншн в DiT блоки добавляют инфу из AR блока. Почитайте работу) В речи подобный паттерн нарастает.

Впрочем, говоря про pure AR: готовый стек LLM, in-context learning — voice cloning «из коробки», законы масштабирования, но бывает exposure bias, hallucinations, repetitions и качество ограничено codec bottleneck. Иначе гововря про Non-AR: параллельная генерация — нет последовательной задержки, continuous latents — нет codec bottleneck, нет exposure bias, но alignment text-audio — центральная сложность, long-form coherence хуже, чем у AR, тяжелее применять RL

4. Переходя к обучению, конечно увидим пайплайн PT->CPT->SFT->RL, а говоря про инференс и стримнг обратите внимание на техрепорт Iworld TTS-1. В музыке говоря про long-context снова обратите внимание на curriculum по длине от Qwen3-TTS, про структурное сегментирование у YuE/ACE-Step, dual-treck+mixed tokens generation от LeVo.

5. Для управляемости генерацией мейнстрим - LM как планировщик. Вместо промпт -> output делают промпт -> LM blueprint -> output. В речи это thinking pattern из Qwen3-TTS, активируется для сложных voice description промптов, как ризонинг в LLM. Плюс emotion/non-verbal tags ([whispering], [breathe]), которые в Inworld TTS-1 учат через LoRA на парных (neutral, stylized) данных - полный FT теряет базовую cloning capability. В музыке размах больше: ACE-Step делает Composer Agent, который раскладывает «sad jazz ballad» в YAML с BPM, key, structure, instruments, mood - DiT-рендерер занимается только акустикой. YuE добавляет structural progressive conditioning - генерация по сегментам [verse][chorus][bridge] с передачей контекста, авторы явно называют это CoT для музыки.

#audio #perfomances
Please open Telegram to view this post
VIEW IN TELEGRAM
1
США меняют модель финансирования науки. Теперь гранты получают не только ученые, но и AI-агенты.

В США стартовала одна из самых амбициозных научных программ последних лет — Genesis Mission. Ее цель — сделать искусственный интеллект не вспомогательным инструментом, а полноценным участником научных исследований. Первые результаты уже объявлены: Министерство энергетики США (DOE) профинансировало 278 проектов, а Белый дом одновременно заявил о намерении расширить программу более чем до $5 млрд с подключением NSF, NASA и NIH.

На первый взгляд это обычная грантовая программа. На самом деле — это эксперимент по перестройке всей научной системы.

Исследовательские группы получили лишь 6 недель, чтобы собрать консорциумы из университетов, национальных лабораторий и бизнеса. В результате поступило более 5000 заявок, из которых профинансировали всего 5,6%. Но главное — структура финансирования.

Каждая команда получает $500–750 тыс. только на 9 месяцев. Затем проходит жесткий отбор. Лишь немногие смогут претендовать на второй этап стоимостью $6–15 млн. Фактически государство перенимает подход венчурных фондов: быстро проверить гипотезы, а затем масштабировать только победителей.

Еще важнее сами проекты. Например, одна команда использует AI для моделирования подземных микробных экосистем, объединяя геномные модели с физическими симуляциями. Другая создает AI-агентов, которые самостоятельно читают научную литературу, формируют гипотезы, интерпретируют результаты экспериментов и предлагают следующие эксперименты для извлечения критически важных металлов из использованных литий-ионных аккумуляторов. Цель — заменить тысячи лабораторных попыток целенаправленным поиском решений.

Но наиболее показателен проект Prometheus. Консорциум из 32 организаций получил $60 млн государственного финансирования и более $200 млн от промышленности, чтобы создать первый ядерный реактор, который будет спроектирован, построен и введен в эксплуатацию с активным участием ИИ. Если сегодня разработка нового реактора занимает около 15 лет, авторы рассчитывают сократить этот срок примерно вдвое. Для этого потребуется обработка триллионов токенов научных и инженерных данных.

Дело не  в размерах грантов.

Genesis показывает смену государственной научной политики. США начинают финансировать не отдельные исследования, а AI-native научные конвейеры, где искусственный интеллект становится таким же элементом исследовательской инфраструктуры, как суперкомпьютеры, лаборатории или ускорители частиц.

Если эта модель окажется успешной, следующим объектом конкуренции между странами станет уже не количество публикаций или даже объем вычислительных ресурсов, а скорость производства научных открытий. Именно она может стать новой ключевой метрикой технологического лидерства.
Человечество может колонизировать Марс, создать сверхумный ИИ и портал времени, но воду в домах каждое лето отключать не перестанут.

Покупка токенов откладывается, нам нужен бойлер 🫠
Please open Telegram to view this post
VIEW IN TELEGRAM
😁5
В Тюмени у «Газпром нефти» естественным образом сформировался большой научно-исследовательский кластер. В городе расположено более десятка институтов и образовательных центров, филиалы РАН, а в 2024 году на полную мощность заработал исследовательский центр «Геосфера». Корреспондент Naked Science побывала в Тюмени по приглашению «Газпром нефти». Рассказываем об этом опыте в подробностях.

Репортаж: https://naked-science.ru/article/hi-tech/geospera-field-report
https://naked-science.ru/article/psy/pamyat-sdvinula-nachalo-i - вот такое интересное наблюдение. В целом очень алгоритмично. Вот сейчас я читаю про нейроморфное программирование и тут тоже подобные вещи описываются. То есть не важно чтобы было между началом и концом события, главное начало и конец.
Google Research попыталась объяснить, откуда у diffusion-моделей берётся «креативность».

Почему генератор изображений не просто копирует обучающие примеры, а создаёт новые сцены, которых не было в датасете?

Ответ оказался математическим.

Во время обучения нейросеть не запоминает идеальную функцию удаления шума. Из-за регуляризации и особенностей градиентного обучения она усваивает её более сглаженную версию. Google называет этот эффект score smoothing.

Если бы функция была идеальной, каждый случайный шум в конце превращался бы в точную копию одного из обучающих примеров.

Но сглаживание создаёт между примерами «зоны интерполяции». Модель может остановиться не на известной точке, а между несколькими знакомыми образами и получить новый, но правдоподобный результат.

В многомерном пространстве это помогает модели восстановить скрытый data manifold - область, где находятся осмысленные изображения. Движение к этой области сохраняется быстрым, а схлопывание к конкретным обучающим картинкам ослабевает. Так появляется баланс между качеством и новизной.

То есть «творчество» diffusion-модели может быть не загадочным свойством и не случайностью.

Это побочный эффект того, что нейросеть учится не идеально и строит мосты между известными примерами.

Работа представлена на ICLR 2026, код экспериментов опубликован открыто.

https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/
👏3👍1
Большая грудь помогает девушкам побеждать на велогонках. На «Тур де Франс» разгорелся скандал из-за девушек, которые используют подкладки для увеличения груди. Прокладки меняют воздушный поток и выигрывают спортсменкам до 0,78 секунды на километр. Теперь на «Тур де Франс» грудь девушек будут тщательно осматривать.
😁3
🔳🔳🔳: Claude взломал BIOS ноутбука.

Реддитор купил ноут HP с заблокированным BIOS и попросил Claude Code разобраться с дампом прошивки. Нейросеть нашла способ обойти проверку цифровой подписи RSA-2048, сняла ограничения и открыла 5️⃣5️⃣ скрытых настроек BIOS.

В итоге энтузиаст получил полностью разблокированный BIOS, а весь процесс автоматизировал в Python-скрипт.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3
❗️Ректор МГИМО Анатолий Торкунов предложил ввести квоты на поступление олимпиадников в вузы, пишет Российская газета.

Он считает, что долю победителей и призеров олимпиад стоит квотировать на уровне 10–15% бюджетных мест. Сейчас, по его словам, в ряде вузов значительная часть набора проходит на приоритетном этапе, из-за чего общий конкурс сокращается.

Инициатива направлена на баланс между поступающими по олимпиадам и по результатам ЕГЭ.
👍1
10 GitHub-репозиториев, которые слишком хороши для бесплатных
1. OmniRoute


Единый OpenAI-совместимый эндпоинт для сотен моделей и провайдеров. Поддерживает Claude Code, Codex, Cursor и Cline, автоматическое переключение между бэкендами и сжатие контекста.

https://github.com/diegosouzapw/OmniRoute

2. OfficeCLI

CLI для создания и редактирования файлов Word, Excel и PowerPoint с помощью ИИ-агентов. Microsoft Office устанавливать не нужно.

https://github.com/iOfficeAI/OfficeCLI

3. System Prompts Leaks

Коллекция системных промптов Claude, ChatGPT, Gemini, Grok, Cursor, Copilot и других продуктов.

https://github.com/asgeirtj/system_prompts_leaks

4. OpenCut

Open-source видеоредактор в браузере, который развивается как альтернатива CapCut.

https://github.com/OpenCut-app/OpenCut

5. AI Job Search

Агент на базе Claude Code, который анализирует вакансии, адаптирует резюме, пишет сопроводительные письма и готовит вопросы для интервью.

https://github.com/MadsLorentzen/ai-job-search

6. Meetily

Локальная расшифровка и суммаризация встреч с Whisper, Parakeet и Ollama. Бэкенд написан на Rust.

https://github.com/Zackriya-Solutions/meetily

7. Vibe-Trading

Платформа для исследования рынков и создания торговых стратегий с помощью естественного языка и ИИ-агентов.

https://github.com/HKUDS/Vibe-Trading

8. Strix

Open-source сканер безопасности, который использует ИИ-агентов для поиска и проверки уязвимостей.

https://github.com/usestrix/strix

9. Superpowers

Набор навыков и рабочих процессов для ИИ-кодеров: планирование, TDD, выполнение задач и проверка результата.

https://github.com/obra/superpowers

10. Firecrawl

Превращает сайты в чистые данные для LLM, RAG и агентных пайплайнов.

https://github.com/firecrawl/firecrawl

Все проекты имеют открытый исходный код и точно заслуживают места в закладках.
Плотненько работаем...