very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Data Secrets
⚡️ Вышел DeepSeek-Math-V2

С релиза первой версии прошло почти два года. Новую уже никто и не ждал, но релиз, как это часто бывает в случае с DeepSeek, наступил внезапно.

Сразу кратко о результатах:

– Уровень золотой медали на IMO 2025 и CMO 2024 (Chinese Mathematical Olympiad).

– Почти идеальный результат 118/120 на Putnam 2024. Это сверхсложная математическая олимпиада для студентов университетов США и Канады.

– Бенчмарков мало, нет ни MATH, ни GSM8K, ни AIME, вообще почти ничего. Это странновато, но можно пока посмотреть на сравнения с другими моделями на IMO-ProofBench. Видно, что модель довольно уверенно бьет GPT-5 и на сложных задачах выходит на уровень с Gemini 2.5 Pro. Опять же, интересно, что там с Gemini 3, Grok 4 и GPT-5.1.

Теперь заглянем под капот.

Система основана на DeepSeek-V3.2-Exp-Base. Пайплайн состоит из генератора и верификатора.

Доказательство или решение формируется не за раз, а в результате нескольких проходов и улучшений: большая модель генерирует решение -> оно отправляется в модель-верификатор, где тщательно проверяется каждый шаг и ищутся ошибки -> обратная связь от верификатора возвращается генератору -> так доказательство переписывается и улучшается до 16 раз.

При этом в каждой итерации используются и проверяются сразу несколько (до 64) гипотез и вариантов решения. Получается сотни прогонов для одной задачи. Такое вот умное структурированное масштабирование test-time компьюта.

Сколько стоило решение олимпиады – не раскрывают, но видимо немало. Судя по всему, поэтому результатов по бенчмаркам и нет: денег не хватило 😭

Веса | Статья | Репозиторий
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1🔥1
И новоая моделька на 106B параметров - Intellect 3. Честно говоря, пока мало что о ней можно сказать..
❤3👍1
Forwarded from Machinelearning
🌟 ToolOrchestra: буст ИИ-потенциала за счет координации моделей и инструментов.

NVIDIA совместно с Университетом Гонконга разработала ToolOrchestra - методику обучения дирижеров для ИИ-агентов, и выпустила на ее основе модель Orchestrator-8B.

Это модель, базирующаяся на архитектуре Qwen3 предназначена для оркестрации других моделей и инструментов. Вместо того чтобы решать задачу в одиночку, модель чередует этапы рассуждения с вызовом внешних инструментов.

В ее арсенале поисковые движки, интерпретаторы кода и другие LLM, от узкоспециализированных математических до универсальных гигантов Claude и Llama-Nemotron.

Обучение проводилось с помощью GRPO, который поощрял модель не только за точность, но и за экономическую эффективность.

В результате решение получилось в 2,5 раза быстрее и на 70% дешевле в эксплуатации, чем использование одной лишь флагманской модели для всех этапов задачи, а сама Orchestrator-8B набрала 37,1% в сложнейшем бенчмарке Humanity's Last Exam , обойдя GPT-5 (35,1%).


📌Лицензирование кода : Apache 2.0 License.

📌Лицензирование модели: NVIDIA License.


🟡Страница проекта
🟡Модель
🟡Arxiv
🟡Датасет
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Orchestrator #NVIDIA
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ Подробный туториал, который показывает, как с нуля собрать собственную систему распознавания аудио прямо на устройстве.

Используется модель LFM2-Audio-1.5B от LiquidAI, а все данные остаются приватными.

Полностью локальный пайплайн, который можно адаптировать под свои задачи и интегрировать где угодно.

Готовый разбор и код - по ссылке:

https://github.com/Liquid4All/cookbook/tree/main/examples/audio-transcription-cli
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍1🔥1
Hugging face тут интересное выкладывает. Кстати, народ говорит, что по подписке за 9 баксов в месяц у них можно получить много инференса на открытых моделях. Тем, кому нужна моделька по апи может быть интересно
❤1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Unitree R1 и G1 демонстрируют свои навыки на одной сцене

Выбери своего БОЙЦА:

❤️ Новый, более доступный и компактный R1
или
🔥 Мощный и уже зарекомендовавший себя на рынке G1, который остаётся флагманом линейки.

@ai_machinelearning_big_data

#ai #robots
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5
CLAUDE.md
3.1 KB
Кстати, сделали тут с Claude Opus 4.5 файл с основыми инструкциями для Claude Code - попытался прописать туда все основные вопросы, с которыми сталкиваюсь. Как и положено для таких промптов, очень кратко - уложились в 100 строк.

Смотрите, может кому пригодится. Положить этот файл надо в директорию .claude в корень (это для маков) - чтобы открыть доступ к этой скрытой директории в корне директории юзера нажмите Cmnd+Shift+.
❤4👍2🔥1
Ну и кстати, вчера сделал свой первый публичный репозиторий в GitHub с небольшой программкой, на которую ссылаюсь в правилах - это передача паролей в программы с использованием Bitwarden (я раньше писал важный пост, о том, как выстроить систему работы с паролями, доступ к которым есть только у вас).

Теперь никакие пароли и API нигде не видны в виде теста. Программы все-равно получают к ним доступ, и модели в рамках запущенных процессов тоже, но извлечь их из них будет сложнее. Порадовало, что я не один такой, есть и аналоги.

Если делать совсем ультимативное решение, то надо делать МСР сервер, который передает ключи по требованию - может и займусь этим, но история более геморная, мне пока это не нужно. Вот когда продукты будут как-то активно использоваться, нужно будет озаботиться.
❤4👍1🔥1
Anthropic выпустил инструменты для экономии контекста: Skills и Commands

Написали тут с Клодом пост про новые инструменты, если вы вдруг еще про них не знаете.

Контекстное окно — главный ресурс при работе с LLM. Чем больше инструкций загружаешь в каждый запрос, тем меньше места для задачи. Anthropic решает это двумя инструментами.

Skills — инструкции "КАК делать"

Папка с файлом SKILL.md, где описаны правила и процессы. Claude сам решает, когда подключить нужный skill — смотрит на описание и контекст разговора.

Работают везде: Claude.ai (веб и десктоп), Claude Code, API.

Экономия контекста: при сканировании ~100 токенов, полная загрузка только когда skill реально нужен (<5000 токенов).

Commands — шаблоны "ЧТО делать"

Markdown-файл с готовым промптом. Вызываешь явно в терминале Claude Code, набирая /command-name.

Работают только в Claude Code.

Пример: создание README

Skill описывает стандарты — какая структура, какие секции, как оформлять. Когда говоришь "напиши readme", Claude автоматически применяет эти правила.

Файл .claude/skills/readme-style/SKILL.md:


---
name: readme-style
description: Стандарты оформления README для проектов
---

# Как писать README

## Структура
1. Название и краткое описание
2. Установка
3. Использование
4. Конфигурация
5. Лицензия

## Правила
- Примеры кода в code blocks
- Бейджи в начале (CI, coverage, version)
- Не больше 3 уровней заголовков


Command — конкретный сценарий: прочитай конфиги, изучи структуру, сгенерируй файл. Набираешь /readme в терминале — Claude выполняет последовательность.

Файл .claude/commands/readme.md:


Проанализируй текущий проект и создай README.md:

1. Прочитай package.json / pyproject.toml
2. Изучи структуру директорий
3. Найди примеры использования в тестах
4. Сгенерируй README по нашему стандарту

Сохрани результат в README.md


Когда что использовать

Единый стиль во всех проектах → Skill
Быстро выполнить задачу в терминале → Command
Работа в веб-интерфейсе → только Skills
Повторяющиеся dev-задачи → Commands

Итог

Skills = "всегда делай так" (автоматически)
Commands = "сделай это сейчас" (вручную)

Skills доступны для Pro, Max, Team и Enterprise. Commands требуют Claude Code.
👍3❤2🔥1
Лучшие практики и подходы для RAG
(буду наполнять)


Очередной раз спросили в чате канала что почитать про RAG (https://t.me/neuraldeepchat)

Соберем тут все лучшее присылайте и ваши статьи и разборы

Тут материалы предыдущих ответов

1) https://t.me/neuraldeepchat/3176
2) https://t.me/neuraldeepchat/2953


1) Чанкование (sliding window) можно подглядеть концепты от langchain
https://github.com/langchain-ai/langchain/tree/master/libs/text-splitters

Tired of making your gazillionth chunker? Sick of the overhead of large libraries? Want to chunk your texts quickly and efficiently? Chonkie the mighty hippo is here to help!
https://github.com/chonkie-inc/chonkie



2) Векторные бд от pgvector до qdrant можно начать с chroma (IVF_Flat или HNSW)

3) Векторные модели для ру
ai-forever/FRIDA
BAAI/bge-m3
intfloat/multilingual-e5-large
Qwen3-Embedding-8B

4) Реранкер после KNN сделать доп ранжирование
BAAI/bge-reranker-v2-m3
Qwen3-Reranker-8B


5) LLM + vLMM (база qwen-2.5-7b-instruct)
RefalMachine/RuadaptQwen2.5-14B-Instruct
t-tech/T-lite-it-1.0
t-tech/T-pro-it-2.0

Agentic RAG(Qwen3-30B-A3B-Instruct-2507)
РЕПО(https://github.com/vamplabAI/sgr-agent-core/tree/tool-confluence)

Презентация от Дяди
Построение RAG систем от исследований до индустрии


Хорошо описанные подходы от Богдана
https://t.me/bogdanisssimo/2047

Лучшее решение РАГ по документации от Ильи(@IlyaRice) которое выиграло первое место на ERC2
https://github.com/IlyaRice/RAG-Challenge-2/tree/main


Готовые фреймворки одобренные нашим сообществом
https://github.com/langgenius/dify/
https://github.com/Marker-Inc-Korea/AutoRAG
https://github.com/run-llama/llama_index
https://github.com/mastra-ai/mastra

Кейс red_mad_robot по RAG (DCD) для строительной компании (t-lite)
https://habr.com/ru/companies/redmadrobot/articles/892882/

Серия про file first от Рефата
https://t.me/nobilix/182

Классика (Запись эфира по RAGу без эмбеддингов)
https://t.me/oestick/397

#RAG
#best_rag_practice

Сохраняй в избранное чтобы не потерять
🔥3❤2👍1
Набор курсов от Hugging Face лежит на huggingface.co/learn
🔥4👍3
Ждем сегодня завтра выхода маленьких моделей от Mistral
🔥6❤1
Кстати, вы заметили, что из chatGPT как-то незаметно ушел deep research. И в Gemini его не запустишь. Можно просить думать модели дольше, но это не то же самое. У Grok тоже размышления не самые долгие.

Пока что держится Anthropic - у него эту функцию можно запустить в явном виде.

Видно, вычисления в дефиците, и стоят дорого, но я расстроен. Впрочем, для таких запросов пользуюсь Клодом.

Небольшой лайфхак: если вам надо изучить какой-то вопрос, не делайте research по одной фразе. Сначала попросите Клода сделать подробный промпт для исследования, а потом, в новом диалоге, запустите исследование по этому подробному промпту. Получится гораздо лучше.

И учитывайте, что Opus - дорогая модель, поиск с ней в интернете выбирает все токены, на размышления, видимо, остается мало. С Sonnet, по ощущениям, он думает дольше
🔥5❤3👍1
Кстати, вчера неожиданно для себя и, честно говоря, совсем не заметив, обучил свою первую нейронку. Решал с дочкой задачку по созданию движка по игре в шахматы.

Движок без нейронки (тоже сделан своими руками) правда, делает ее на раз, и играет при этом на уровне нормального любителя, но все же.. она просто маленькая, на 200K, и простая, обучена на оценке Stockfish 50 тыс. шахматных позиций.

Это Claude предложила, а Codex запрограммировал. Прикольно
👍7🔥3❤2
Forwarded from Data Secrets
⚡️ Вышли свеженькие модели от DeepSeek!

Китайский стартап выпустил DeepSeek-V3.2 и DeepSeek-V3.2-Speciale.

Позиционируются обе как модели для агентов. DeepSeek-V3.2-Speciale – с акцентом на сложный долгий ризонинг и планирование.

Первая уже доступна в чате. Вторая пока только в API. По метрикам – уровень GPT-5 и Gemini 3.0 соответственно.

Ну и, естественно, все в опенсорсе! Hugging Face

Бегом пробовать!
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6❤2🔥2