Forwarded from Pavel Zloi
Сегодня выступаю на ML&DS Offstage от Ozon.
Собираемся закрытым составом ML- и DS-инженеров, тема вечера - агенты, поиск и LLM-платформы.
Мой доклад про SGR Agent Core, открытый фреймворк для агентов, расскажу, как и зачем на нём собирать своих агентов, на примерах конфигов, схемах и в коде.
Мой слот начинается в 20:35, заглядывайте в гости.
Собираемся закрытым составом ML- и DS-инженеров, тема вечера - агенты, поиск и LLM-платформы.
Мой доклад про SGR Agent Core, открытый фреймворк для агентов, расскажу, как и зачем на нём собирать своих агентов, на примерах конфигов, схемах и в коде.
Мой слот начинается в 20:35, заглядывайте в гости.
👍13❤2🔥1
Pavel Zloi
Сегодня выступаю на ML&DS Offstage от Ozon. Собираемся закрытым составом ML- и DS-инженеров, тема вечера - агенты, поиск и LLM-платформы. Мой доклад про SGR Agent Core, открытый фреймворк для агентов, расскажу, как и зачем на нём собирать своих агентов,…
А вы забыли уже про SGR Agent Core?
А оно живет и развивается!
https://github.com/vamplabAI/sgr-agent-core
А оно живет и развивается!
https://github.com/vamplabAI/sgr-agent-core
GitHub
GitHub - vamplabAI/sgr-agent-core: Schema-Guided Reasoning (SGR) has agentic system design created by neuraldeep community
Schema-Guided Reasoning (SGR) has agentic system design created by neuraldeep community - vamplabAI/sgr-agent-core
👍11🔥9👏1
Kimi K3
Ждем весов, будет 2.5T не меньше!
UPDATE:
https://www.kimi.com/blog/kimi-k3
Говорят рвет все что только было до этого
Ждем весов, будет 2.5T не меньше!
UPDATE:
https://www.kimi.com/blog/kimi-k3
Говорят рвет все что только было до этого
1🔥49👍8👀3
This media is not supported in your browser
VIEW IN TELEGRAM
1🔥41😁12🤡10🤮6🖕5❤2
Forwarded from Константин Доронин
Мы начинаем наш стрим "Харнесс будущего. Какой он?"
Подключайтесь: https://youtube.com/live/LAUdN1-4mgI
Подключайтесь: https://youtube.com/live/LAUdN1-4mgI
YouTube
Харнесс будущего. Какой он?
Подписывайтесь на Telegram:
Александр Абрамов – https://t.me/dealerAI
Павел Рыков – https://t.me/evilfreelancer
Тимур Хахалев – https://t.me/the_ai_architect
Константин Доронин – https://t.me/kdoronin_blog
Александр Абрамов – https://t.me/dealerAI
Павел Рыков – https://t.me/evilfreelancer
Тимур Хахалев – https://t.me/the_ai_architect
Константин Доронин – https://t.me/kdoronin_blog
🔥11❤3🙉3
Говорить с Qwen на одном языке
Давно хотел выложить свои локальные наработки для агентов и промптинга Qwen через кодинг агентов
Выложил гайд и skill для того, чтобы строить и промптить под модели семейства Qwen3.x на их родном диалекте так, как это делает сама Alibaba.
РЕПО: https://github.com/vakovalskii/qwen-native-agents
Давно хотел выложить свои локальные наработки для агентов и промптинга Qwen через кодинг агентов
Выложил гайд и skill для того, чтобы строить и промптить под модели семейства Qwen3.x на их родном диалекте так, как это делает сама Alibaba.
РЕПО: https://github.com/vakovalskii/qwen-native-agents
3👍34🔥20 8❤5🤔2👀2💊2
Forwarded from LLM под капотом
Kimi K3 - в топе бенчмарка LLM для агентов
По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.
Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.
Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).
Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!
Ваш, @llm_under_hood 🤗
По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.
Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.
Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).
Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!
Ваш, @llm_under_hood 🤗
❤43🔥23🤣11
От менеджера сессий к мультитерминальному решению
Я решил угореть и заснуть терминал прямо в наше с вами решении https://github.com/vakovalskii/codbash 230+ звезд 20+ контрибутеров
За 3 месяца разработки мы поддержали и встроили более 10 CLI-агентных решений для анализа и менедж сессий
Zero-deps не очень получилось поддержать =)
Зато теперь можно прокинуть такой браузер наружу и кодить по сети =), или поставить только cli или запускать через браузер или поставить dmg
Что-то начало к чему-то большему.
И я ушел с Iterm2 на Codbash.
Все так же в open-source.
Присоединяйтесь в сообщество более 20 контрибьюторов! (планирую раздачу подписок на neuraldeep.ru всем активным!)
Установить DMG
Я решил угореть и заснуть терминал прямо в наше с вами решении https://github.com/vakovalskii/codbash 230+ звезд 20+ контрибутеров
За 3 месяца разработки мы поддержали и встроили более 10 CLI-агентных решений для анализа и менедж сессий
Zero-deps не очень получилось поддержать =)
Зато теперь можно прокинуть такой браузер наружу и кодить по сети =), или поставить только cli или запускать через браузер или поставить dmg
Что-то начало к чему-то большему.
И я ушел с Iterm2 на Codbash.
Все так же в open-source.
Присоединяйтесь в сообщество более 20 контрибьюторов! (планирую раздачу подписок на neuraldeep.ru всем активным!)
Установить DMG
1🔥22❤14🤣2⚡1👀1
Forwarded from Глеб Кудрявцев про AI
Вообще, как вы видите сейчас, нефть будущего — это вовсе не софт, а железки. Покрайней мере, пока мы не вошли в сингулярность, когда ИИ начнет штамповать их
себе самостоятельно.
Всем бизнесам нужен инференс, но есть проблема: когда компании переводят процессы на LLM, они просто охреневают от счетов за API OpenAI или Claude.
Рынок ломается о стоимость вычислений. Которые можно сильно сократить, если оптимизировать косты на железо и работать со специализированными небольшими моделями, четко подобранными под задачу.
К чему это я?
Мы с @neuraldeep хотим построить свой AI-датацентр в Европе. Мы даем бизнесу тот же результат, но в 90–100 раз дешевле крупных провайдеров.
Продуктово это не просто классический хостинг, а хаб, где мы монетизируем одну железяку трижды: продаем голые токены, сдаем GPU в аренду и продаем бандлы подписок на AI-продукты (чат, RAG, OCR, транскрибация и т.д.).
Самое важное: хаб уже работает в проде и генерит кэш. Без копейки платного маркетинга откручено 21.9 млрд токенов, за 2 месяца, собрано более 1000 платящих юзеров, а операционная маржинальность инференса 90%.
Сейчас мы поднимаем Seed-раунд на $5M (за 25% доли, оценка $20M post-money),
чтобы кратно отмасштабировать флот серверов на весь мир.
Почему мы порвем этот рынок:
1) Идеальная локация. Я живу в хостинговой столице мира — Финляндии. Тут самая дешевая электроэнергия в ЕС и сосредоточены мощности Google, Microsoft, Hetzner, Небиус. В самой Финке нет амазона Амазона (мы платим за доставку из Германии), зато есть его датацентры.
2) Налоги. Местная система может отбирать 60% с зарплаты, но зато максимально благосклонно относится к реинвестированию хоть в трактора хоть в видеокарты. Будем эффективно списывать затраты на железо.
3) Умный CAPEX. Мы не сжигаем капитал на флагманские стойки с B300 под жидкостным охлаждением за бешеные миллионы. Наша ниша позволяет использовать просьюмерские RTX PRO 6000 — это дает нам на 58% больше токенов на каждый вложенный доллар.
4) Валера (@neuraldeep) — абсолютно гениальный технарь с лояльной аудиторией в 15k AI-разработчиков, который готов это отскелить на любой масштаб.
В отличие от венчура, где 90% хипстерских стартапов проедают деньги и закрываются, у нас большая часть раунда пойдет напрямую в закупку GPU.
Это хард-ассет бизнес. Риски даунсайда минимальны: даже если всё пойдет по одному месту, GPU сохраняют свою ликвидность и их можно продать любому другому датацентру, которым сейчас не хватает свободных мощностей. Вы инвестируете в ликвидное железо с окупаемостью 10-15 месяцев, а не в воздух.
Рынок GPU-инфраструктуры сейчас горячий как никогда, и окно возможностей открыто именно сейчас.
Так что если вы инвестор и вам интересно вложиться в понятную AI-инфраструктуру с подтвержденной экономикой — велкам в личку. Пришлю наш питч-дек, финмодель под NDA и отвечу на любые вопросы.
себе самостоятельно.
Всем бизнесам нужен инференс, но есть проблема: когда компании переводят процессы на LLM, они просто охреневают от счетов за API OpenAI или Claude.
Рынок ломается о стоимость вычислений. Которые можно сильно сократить, если оптимизировать косты на железо и работать со специализированными небольшими моделями, четко подобранными под задачу.
К чему это я?
Мы с @neuraldeep хотим построить свой AI-датацентр в Европе. Мы даем бизнесу тот же результат, но в 90–100 раз дешевле крупных провайдеров.
Продуктово это не просто классический хостинг, а хаб, где мы монетизируем одну железяку трижды: продаем голые токены, сдаем GPU в аренду и продаем бандлы подписок на AI-продукты (чат, RAG, OCR, транскрибация и т.д.).
Самое важное: хаб уже работает в проде и генерит кэш. Без копейки платного маркетинга откручено 21.9 млрд токенов, за 2 месяца, собрано более 1000 платящих юзеров, а операционная маржинальность инференса 90%.
Сейчас мы поднимаем Seed-раунд на $5M (за 25% доли, оценка $20M post-money),
чтобы кратно отмасштабировать флот серверов на весь мир.
Почему мы порвем этот рынок:
1) Идеальная локация. Я живу в хостинговой столице мира — Финляндии. Тут самая дешевая электроэнергия в ЕС и сосредоточены мощности Google, Microsoft, Hetzner, Небиус. В самой Финке нет амазона Амазона (мы платим за доставку из Германии), зато есть его датацентры.
2) Налоги. Местная система может отбирать 60% с зарплаты, но зато максимально благосклонно относится к реинвестированию хоть в трактора хоть в видеокарты. Будем эффективно списывать затраты на железо.
3) Умный CAPEX. Мы не сжигаем капитал на флагманские стойки с B300 под жидкостным охлаждением за бешеные миллионы. Наша ниша позволяет использовать просьюмерские RTX PRO 6000 — это дает нам на 58% больше токенов на каждый вложенный доллар.
4) Валера (@neuraldeep) — абсолютно гениальный технарь с лояльной аудиторией в 15k AI-разработчиков, который готов это отскелить на любой масштаб.
В отличие от венчура, где 90% хипстерских стартапов проедают деньги и закрываются, у нас большая часть раунда пойдет напрямую в закупку GPU.
Это хард-ассет бизнес. Риски даунсайда минимальны: даже если всё пойдет по одному месту, GPU сохраняют свою ликвидность и их можно продать любому другому датацентру, которым сейчас не хватает свободных мощностей. Вы инвестируете в ликвидное железо с окупаемостью 10-15 месяцев, а не в воздух.
Рынок GPU-инфраструктуры сейчас горячий как никогда, и окно возможностей открыто именно сейчас.
Так что если вы инвестор и вам интересно вложиться в понятную AI-инфраструктуру с подтвержденной экономикой — велкам в личку. Пришлю наш питч-дек, финмодель под NDA и отвечу на любые вопросы.
🔥80😁28❤18🤡8🤯2🙉2
В NeuralDeep векторные модели не дополнение к чату, а самостоятельный класс со своим отдельным лимитом
Вы давно просили на подписках исключиь emb из общих лимитов вот я и собрал всю логику теперь если вы запускаете RAG, индексируете корпус на десятки тысяч чанков это не расходует ваш лимит на чат-модели
Два независимых счётчика: чат отдельно, векторы отдельно.
На тарифе за 2500 можно прогнать за месяц 60 000 векторизаций не зависимо от размера инпута
📊 Эмбеддинги (POST /v1/embeddings, OpenAI-совместимо):
e5-large — multilingual
bge-m3
frida
jina-embeddings-v4
qwen3-embedding-4b
giga-embeddings
🎯 Реранкеры (POST /v1/rerank):
bge-reranker (v2-m3)
Ключи https://hub.neuraldeep.ru/app/overview
Документация https://hub.neuraldeep.ru/docs
Вы давно просили на подписках исключиь emb из общих лимитов вот я и собрал всю логику теперь если вы запускаете RAG, индексируете корпус на десятки тысяч чанков это не расходует ваш лимит на чат-модели
Два независимых счётчика: чат отдельно, векторы отдельно.
На тарифе за 2500 можно прогнать за месяц 60 000 векторизаций не зависимо от размера инпута
📊 Эмбеддинги (POST /v1/embeddings, OpenAI-совместимо):
e5-large — multilingual
bge-m3
frida
jina-embeddings-v4
qwen3-embedding-4b
giga-embeddings
🎯 Реранкеры (POST /v1/rerank):
bge-reranker (v2-m3)
Ключи https://hub.neuraldeep.ru/app/overview
Документация https://hub.neuraldeep.ru/docs
🔥33👍2
Валера Ковальский
От менеджера сессий к мультитерминальному решению Я решил угореть и заснуть терминал прямо в наше с вами решении https://github.com/vakovalskii/codbash 230+ звезд 20+ контрибутеров За 3 месяца разработки мы поддержали и встроили более 10 CLI-агентных решений…
Codbash CLI Browser
Я все больше повторяю UX/UI браузера, очень хочу довести этот эксперимент до состояния повторение всех топовых поведений.
Восстановление всех сессий + вкладок при закрытии.
cmd + shift + t — восстановление закрытой вкладки.
cmd + t — новая вкладка
Сохранение закладок (папка + команда + continue)
Скоро запишу видос что из этого выходит а пока вы сами можете потестить последнюю версию
Самый прикол что это все еще браузерная фишка
https://github.com/vakovalskii/codbash/releases/download/v7.14.7/codbash-7.14.7-arm64.dmg
Я все больше повторяю UX/UI браузера, очень хочу довести этот эксперимент до состояния повторение всех топовых поведений.
Восстановление всех сессий + вкладок при закрытии.
cmd + shift + t — восстановление закрытой вкладки.
cmd + t — новая вкладка
Сохранение закладок (папка + команда + continue)
Скоро запишу видос что из этого выходит а пока вы сами можете потестить последнюю версию
Самый прикол что это все еще браузерная фишка
https://github.com/vakovalskii/codbash/releases/download/v7.14.7/codbash-7.14.7-arm64.dmg
🔥12👀4👍3
Я посмотрел на 1069 своих коммитов и понял, где именно ломается AI-разработка
Вчера Рефат написал вещь, которая меня зацепила
"Чем умнее агенты, тем дороже ваша поверхностность"
"Что сильные инженеры всё чаще скользят по поверхности приносят ответ агента, едва понимая, что в нём
"И что снаружи это выглядит продуктивно ровно до момента, пока суть под контролем"
Читал и кивал и думал я же ровно в том же состоянии сейчас, потому что у меня под рукой сейчас проект на 3к юзеров neuraldeep.ru считайте прям полигон для страдания =)
Еще плюс я сейчас в рамках одного эксперимента перевожу боевые проекты на рельсы агентной разработки но не про них хочу рассказать, про них будет отдельно
Хочу про свой хаб
Тот самый LLM-хаб, который я каждый день пилю сам в одного
Потому что честнее всего вскрывать не чужой прод, а собственный
Я взял и проанализировал его git-историю за 90 дней, тут спасибо агентам =)
И вот что нашлось
Каждый второй коммит тушение пожара (ДА КАК ТАК?)
Из 1069 коммитов 416 это fix
Не фича, не рефактор стабилизация уже выкаченного
Последние три недели я вообще не развиваю проект, я воюю за его стабильность
Беру фичу в цикл и полирую руками
Стоит начать полировать агентами начинается полная дичь: затирание конфигов, забывание про blue-green деплой, карнавал "заloop engineering "
Мои же 500-ки, которые я не мог найти
Помните соблазн «ну это агент так нарешал, вопросы к нему»?
У меня была своя версия: пятисотки на проде, а откуда хрен разберёшь
Тайм-ауты, каждый раз новые
Я потратил дни, чтобы просто научить систему логировать причину собственных ошибок в истории лежат коммиты уровня «5xx никогда не логируется без причины, добавляю синтетический reason».
А корень вот в python коде 1436 блоков except Exception =), из которых только 10% реально пробрасывают ошибку дальше, тут каюсь я сам не смотрел но оно же умное, думал я
Остальные 90% тихо глотают её в лог или в return None
Ну по логике то что я хотел то и получил, агент оборачивает всё в try/except, чтобы «работало» и хоронит причину
Зелёненько?
Катим
А потом ты три недели ищешь, кто генерит 500 зачем, почему, как избежать как не обожить все просто except
God-файлы, которых человек бы не спроектировал.
Один route-файл 6305 строк
Не потому что так задумано, а потому что каждую новую фичу дописывали туда же агенту так ближе по контексту
Разнобой уровня число моделей захардкожено в четырёх местах четырьмя разными значениями (10/13/14/30), потому что нет single source of truth, и в каждом месте агент пишет своё, я знаю что нужно сесть и все привести в порядок, но рынок диктует другое, скорость и тайм ту маркет
Пиковая скорость 44 коммита в день
Это не человеческий темп ревью
Это фоновые лупы
Снова привет, заloop engineering и налог на оркестрацию: поднять пять агентов легко, а вот распараллелить свою когнитивную пропускную способность нет и точка
Теперь главное
Соблазн из всего этого сделать хайповый вывод "AI SDLC утопия, всё тлен"
Фактура вроде тянет помните? Человек оркестр и 6 лет девоПСА
Но это враньё, и вот почему
Проект не мёртв
Он живёт ровно на мне
Долг копится строго там, где я убрал себя из центра
swallowed-эксепшены
6k-строчные роуты,
разнобой счётчиков
А там, где я держу карту в голове и пропускаю решения через себя стабилизируется
Это не "модели плохие"
Это "Я осознанно убрали инженера-владельца, контекст накопился в долг"
Ровно как говорит Рефат "агент работает в задаче, а твоё место над ней"
AI SDLC не утопия и не серебряная пуля. Это усилитель. Он множит и продуктивность, и когнитивный долг с одинаковым КПД
В центре стоит инженер с картой множится продукт
В центре пусто множится техдолг, и ты потом три недели ищешь свои же 500-ки
И да, обязательный ревью фичи моделью из другого семейства (у меня Codex/GLM/Kimi k3) теперь личный стандарт, без которого неуютно.
Не потому что не доверяю своему агенту, а потому что чужой глаз ловит ровно то, что мой замыли
Жду пост от @virrius_tech по нашей внутрянке, там думаю будет самый сок крупных проблем которые я тут не затронул!
А вы где проводите границу между «отдал агенту» и «отдал без карты в голове»?
И замечаете ли за собой это скольжение по поверхности? Кажется это все о наболевшем
Вчера Рефат написал вещь, которая меня зацепила
"Чем умнее агенты, тем дороже ваша поверхностность"
"Что сильные инженеры всё чаще скользят по поверхности приносят ответ агента, едва понимая, что в нём
"И что снаружи это выглядит продуктивно ровно до момента, пока суть под контролем"
Читал и кивал и думал я же ровно в том же состоянии сейчас, потому что у меня под рукой сейчас проект на 3к юзеров neuraldeep.ru считайте прям полигон для страдания =)
Еще плюс я сейчас в рамках одного эксперимента перевожу боевые проекты на рельсы агентной разработки но не про них хочу рассказать, про них будет отдельно
Хочу про свой хаб
Тот самый LLM-хаб, который я каждый день пилю сам в одного
Потому что честнее всего вскрывать не чужой прод, а собственный
Я взял и проанализировал его git-историю за 90 дней, тут спасибо агентам =)
И вот что нашлось
Каждый второй коммит тушение пожара (ДА КАК ТАК?)
Из 1069 коммитов 416 это fix
Не фича, не рефактор стабилизация уже выкаченного
Последние три недели я вообще не развиваю проект, я воюю за его стабильность
Беру фичу в цикл и полирую руками
Стоит начать полировать агентами начинается полная дичь: затирание конфигов, забывание про blue-green деплой, карнавал "заloop engineering "
Мои же 500-ки, которые я не мог найти
Помните соблазн «ну это агент так нарешал, вопросы к нему»?
У меня была своя версия: пятисотки на проде, а откуда хрен разберёшь
Тайм-ауты, каждый раз новые
Я потратил дни, чтобы просто научить систему логировать причину собственных ошибок в истории лежат коммиты уровня «5xx никогда не логируется без причины, добавляю синтетический reason».
А корень вот в python коде 1436 блоков except Exception =), из которых только 10% реально пробрасывают ошибку дальше, тут каюсь я сам не смотрел но оно же умное, думал я
Остальные 90% тихо глотают её в лог или в return None
Ну по логике то что я хотел то и получил, агент оборачивает всё в try/except, чтобы «работало» и хоронит причину
Зелёненько?
Катим
А потом ты три недели ищешь, кто генерит 500 зачем, почему, как избежать как не обожить все просто except
God-файлы, которых человек бы не спроектировал.
Один route-файл 6305 строк
Не потому что так задумано, а потому что каждую новую фичу дописывали туда же агенту так ближе по контексту
Разнобой уровня число моделей захардкожено в четырёх местах четырьмя разными значениями (10/13/14/30), потому что нет single source of truth, и в каждом месте агент пишет своё, я знаю что нужно сесть и все привести в порядок, но рынок диктует другое, скорость и тайм ту маркет
Пиковая скорость 44 коммита в день
Это не человеческий темп ревью
Это фоновые лупы
Снова привет, заloop engineering и налог на оркестрацию: поднять пять агентов легко, а вот распараллелить свою когнитивную пропускную способность нет и точка
Теперь главное
Соблазн из всего этого сделать хайповый вывод "AI SDLC утопия, всё тлен"
Фактура вроде тянет помните? Человек оркестр и 6 лет девоПСА
Но это враньё, и вот почему
Проект не мёртв
Он живёт ровно на мне
Долг копится строго там, где я убрал себя из центра
swallowed-эксепшены
6k-строчные роуты,
разнобой счётчиков
А там, где я держу карту в голове и пропускаю решения через себя стабилизируется
Это не "модели плохие"
Это "Я осознанно убрали инженера-владельца, контекст накопился в долг"
Ровно как говорит Рефат "агент работает в задаче, а твоё место над ней"
AI SDLC не утопия и не серебряная пуля. Это усилитель. Он множит и продуктивность, и когнитивный долг с одинаковым КПД
В центре стоит инженер с картой множится продукт
В центре пусто множится техдолг, и ты потом три недели ищешь свои же 500-ки
И да, обязательный ревью фичи моделью из другого семейства (у меня Codex/GLM/Kimi k3) теперь личный стандарт, без которого неуютно.
Не потому что не доверяю своему агенту, а потому что чужой глаз ловит ровно то, что мой замыли
Жду пост от @virrius_tech по нашей внутрянке, там думаю будет самый сок крупных проблем которые я тут не затронул!
А вы где проводите границу между «отдал агенту» и «отдал без карты в голове»?
И замечаете ли за собой это скольжение по поверхности? Кажется это все о наболевшем
❤45💯27🔥16👍7🤡4😁2🤔1🤣1