Валера Ковальский
15.9K subscribers
608 photos
91 videos
6 files
525 links
Head of AI red_mad_robot
AI-advisor Bitrix24

From IT Admin to Head of AI in 6 years
Автор https://neuraldeep.ru/
Raised $2M+ for human-centric AI startups
github.com/vakovalskii | chat @neuraldeepchat
Download Telegram
Please open Telegram to view this post
VIEW IN TELEGRAM
11🔥69👍2212
Forwarded from Pavel Zloi
Сегодня выступаю на ML&DS Offstage от Ozon.

Собираемся закрытым составом ML- и DS-инженеров, тема вечера - агенты, поиск и LLM-платформы.

Мой доклад про SGR Agent Core, открытый фреймворк для агентов, расскажу, как и зачем на нём собирать своих агентов, на примерах конфигов, схемах и в коде.

Мой слот начинается в 20:35, заглядывайте в гости.
👍132🔥1
Kimi K3

Ждем весов, будет 2.5T не меньше!

UPDATE:

https://www.kimi.com/blog/kimi-k3

Говорят рвет все что только было до этого
1🔥49👍8👀3
This media is not supported in your browser
VIEW IN TELEGRAM
1🔥41😁12🤡10🤮6🖕52
Говорить с Qwen на одном языке

Давно хотел выложить свои локальные наработки для агентов и промптинга Qwen через кодинг агентов

Выложил гайд и skill для того, чтобы строить и промптить под модели семейства Qwen3.x на их родном диалекте так, как это делает сама Alibaba.

РЕПО: https://github.com/vakovalskii/qwen-native-agents
3👍34🔥2085🤔2👀2💊2
Forwarded from Neural Shit
Да((
4😁101💯135🔥4🤣3
Kimi K3 - в топе бенчмарка LLM для агентов

По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.

Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.

Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).

Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!

Ваш, @llm_under_hood 🤗
43🔥23🤣11
От менеджера сессий к мультитерминальному решению

Я решил угореть и заснуть терминал прямо в наше с вами решении https://github.com/vakovalskii/codbash 230+ звезд 20+ контрибутеров

За 3 месяца разработки мы поддержали и встроили более 10 CLI-агентных решений для анализа и менедж сессий

Zero-deps не очень получилось поддержать =)

Зато теперь можно прокинуть такой браузер наружу и кодить по сети =), или поставить только cli или запускать через браузер или поставить dmg

Что-то начало к чему-то большему.

И я ушел с Iterm2 на Codbash.

Все так же в open-source.

Присоединяйтесь в сообщество более 20 контрибьюторов! (планирую раздачу подписок на neuraldeep.ru всем активным!)

Установить DMG
1🔥2214🤣21👀1
Вообще, как вы видите сейчас, нефть будущего — это вовсе не софт, а железки. Покрайней мере, пока мы не вошли в сингулярность, когда ИИ начнет штамповать их
себе самостоятельно.

Всем бизнесам нужен инференс, но есть проблема: когда компании переводят процессы на LLM, они просто охреневают от счетов за API OpenAI или Claude.

Рынок ломается о стоимость вычислений. Которые можно сильно сократить, если оптимизировать косты на железо и работать со специализированными небольшими моделями, четко подобранными под задачу.

К чему это я?

Мы с @neuraldeep хотим построить свой AI-датацентр в Европе. Мы даем бизнесу тот же результат, но в 90–100 раз дешевле крупных провайдеров.

Продуктово это не просто классический хостинг, а хаб, где мы монетизируем одну железяку трижды: продаем голые токены, сдаем GPU в аренду и продаем бандлы подписок на AI-продукты (чат, RAG, OCR, транскрибация и т.д.).

Самое важное: хаб уже работает в проде и генерит кэш. Без копейки платного маркетинга откручено 21.9 млрд токенов, за 2 месяца, собрано более 1000 платящих юзеров, а операционная маржинальность инференса 90%.

Сейчас мы поднимаем Seed-раунд на $5M (за 25% доли, оценка $20M post-money),
чтобы кратно отмасштабировать флот серверов на весь мир.

Почему мы порвем этот рынок:

1) Идеальная локация. Я живу в хостинговой столице мира — Финляндии. Тут самая дешевая электроэнергия в ЕС и сосредоточены мощности Google, Microsoft, Hetzner, Небиус. В самой Финке нет амазона Амазона (мы платим за доставку из Германии), зато есть его датацентры.
2) Налоги. Местная система может отбирать 60% с зарплаты, но зато максимально благосклонно относится к реинвестированию хоть в трактора хоть в видеокарты. Будем эффективно списывать затраты на железо.
3) Умный CAPEX. Мы не сжигаем капитал на флагманские стойки с B300 под жидкостным охлаждением за бешеные миллионы. Наша ниша позволяет использовать просьюмерские RTX PRO 6000 — это дает нам на 58% больше токенов на каждый вложенный доллар.
4) Валера (@neuraldeep) — абсолютно гениальный технарь с лояльной аудиторией в 15k AI-разработчиков, который готов это отскелить на любой масштаб.

В отличие от венчура, где 90% хипстерских стартапов проедают деньги и закрываются, у нас большая часть раунда пойдет напрямую в закупку GPU.

Это хард-ассет бизнес. Риски даунсайда минимальны: даже если всё пойдет по одному месту, GPU сохраняют свою ликвидность и их можно продать любому другому датацентру, которым сейчас не хватает свободных мощностей. Вы инвестируете в ликвидное железо с окупаемостью 10-15 месяцев, а не в воздух.

Рынок GPU-инфраструктуры сейчас горячий как никогда, и окно возможностей открыто именно сейчас.

Так что если вы инвестор и вам интересно вложиться в понятную AI-инфраструктуру с подтвержденной экономикой — велкам в личку. Пришлю наш питч-дек, финмодель под NDA и отвечу на любые вопросы.
🔥80😁2818🤡8🤯2🙉2
В NeuralDeep векторные модели не дополнение к чату, а самостоятельный класс со своим отдельным лимитом

Вы давно просили на подписках исключиь emb из общих лимитов вот я и собрал всю логику теперь если вы запускаете RAG, индексируете корпус на десятки тысяч чанков это не расходует ваш лимит на чат-модели

Два независимых счётчика: чат отдельно, векторы отдельно.

На тарифе за 2500 можно прогнать за месяц 60 000 векторизаций не зависимо от размера инпута

📊 Эмбеддинги (POST /v1/embeddings, OpenAI-совместимо):
e5-large — multilingual
bge-m3
frida
jina-embeddings-v4
qwen3-embedding-4b
giga-embeddings

🎯 Реранкеры (POST /v1/rerank):
bge-reranker (v2-m3)

Ключи https://hub.neuraldeep.ru/app/overview
Документация https://hub.neuraldeep.ru/docs
🔥33👍2
Валера Ковальский
От менеджера сессий к мультитерминальному решению Я решил угореть и заснуть терминал прямо в наше с вами решении https://github.com/vakovalskii/codbash 230+ звезд 20+ контрибутеров За 3 месяца разработки мы поддержали и встроили более 10 CLI-агентных решений…
Codbash CLI Browser

Я все больше повторяю UX/UI браузера, очень хочу довести этот эксперимент до состояния повторение всех топовых поведений.

Восстановление всех сессий + вкладок при закрытии.
cmd + shift + t — восстановление закрытой вкладки.
cmd + t — новая вкладка

Сохранение закладок (папка + команда + continue)

Скоро запишу видос что из этого выходит а пока вы сами можете потестить последнюю версию

Самый прикол что это все еще браузерная фишка

https://github.com/vakovalskii/codbash/releases/download/v7.14.7/codbash-7.14.7-arm64.dmg
🔥12👀4👍3
Я посмотрел на 1069 своих коммитов и понял, где именно ломается AI-разработка

Вчера Рефат написал вещь, которая меня зацепила
"Чем умнее агенты, тем дороже ваша поверхностность"
"Что сильные инженеры всё чаще скользят по поверхности приносят ответ агента, едва понимая, что в нём
"И что снаружи это выглядит продуктивно ровно до момента, пока суть под контролем"

Читал и кивал и думал я же ровно в том же состоянии сейчас, потому что у меня под рукой сейчас проект на 3к юзеров neuraldeep.ru считайте прям полигон для страдания =)

Еще плюс я сейчас в рамках одного эксперимента перевожу боевые проекты на рельсы агентной разработки но не про них хочу рассказать, про них будет отдельно

Хочу про свой хаб
Тот самый LLM-хаб, который я каждый день пилю сам в одного
Потому что честнее всего вскрывать не чужой прод, а собственный

Я взял и проанализировал его git-историю за 90 дней, тут спасибо агентам =)
И вот что нашлось

Каждый второй коммит тушение пожара (ДА КАК ТАК?)

Из 1069 коммитов 416 это fix
Не фича, не рефактор стабилизация уже выкаченного
Последние три недели я вообще не развиваю проект, я воюю за его стабильность
Беру фичу в цикл и полирую руками
Стоит начать полировать агентами начинается полная дичь: затирание конфигов, забывание про blue-green деплой, карнавал "заloop engineering "

Мои же 500-ки, которые я не мог найти
Помните соблазн «ну это агент так нарешал, вопросы к нему»?
У меня была своя версия: пятисотки на проде, а откуда хрен разберёшь

Тайм-ауты, каждый раз новые
Я потратил дни, чтобы просто научить систему логировать причину собственных ошибок в истории лежат коммиты уровня «5xx никогда не логируется без причины, добавляю синтетический reason».

А корень вот в python коде 1436 блоков except Exception =), из которых только 10% реально пробрасывают ошибку дальше, тут каюсь я сам не смотрел но оно же умное, думал я
Остальные 90% тихо глотают её в лог или в return None
Ну по логике то что я хотел то и получил, агент оборачивает всё в try/except, чтобы «работало» и хоронит причину
Зелёненько?
Катим
А потом ты три недели ищешь, кто генерит 500 зачем, почему, как избежать как не обожить все просто except

God-файлы, которых человек бы не спроектировал.
Один route-файл 6305 строк
Не потому что так задумано, а потому что каждую новую фичу дописывали туда же агенту так ближе по контексту
Разнобой уровня число моделей захардкожено в четырёх местах четырьмя разными значениями (10/13/14/30), потому что нет single source of truth, и в каждом месте агент пишет своё, я знаю что нужно сесть и все привести в порядок, но рынок диктует другое, скорость и тайм ту маркет

Пиковая скорость 44 коммита в день
Это не человеческий темп ревью
Это фоновые лупы
Снова привет, заloop engineering и налог на оркестрацию: поднять пять агентов легко, а вот распараллелить свою когнитивную пропускную способность нет и точка

Теперь главное
Соблазн из всего этого сделать хайповый вывод "AI SDLC утопия, всё тлен"
Фактура вроде тянет помните? Человек оркестр и 6 лет девоПСА
Но это враньё, и вот почему

Проект не мёртв
Он живёт ровно на мне
Долг копится строго там, где я убрал себя из центра
swallowed-эксепшены
6k-строчные роуты,
разнобой счётчиков

А там, где я держу карту в голове и пропускаю решения через себя стабилизируется
Это не "модели плохие"
Это "Я осознанно убрали инженера-владельца, контекст накопился в долг"

Ровно как говорит Рефат "агент работает в задаче, а твоё место над ней"

AI SDLC не утопия и не серебряная пуля. Это усилитель. Он множит и продуктивность, и когнитивный долг с одинаковым КПД
В центре стоит инженер с картой множится продукт
В центре пусто множится техдолг, и ты потом три недели ищешь свои же 500-ки

И да, обязательный ревью фичи моделью из другого семейства (у меня Codex/GLM/Kimi k3) теперь личный стандарт, без которого неуютно.
Не потому что не доверяю своему агенту, а потому что чужой глаз ловит ровно то, что мой замыли

Жду пост от @virrius_tech по нашей внутрянке, там думаю будет самый сок крупных проблем которые я тут не затронул!

А вы где проводите границу между «отдал агенту» и «отдал без карты в голове»?
И замечаете ли за собой это скольжение по поверхности? Кажется это все о наболевшем
45💯27🔥16👍7🤡4😁2🤔1🤣1