Как втолковать нейросетям графики: ChartNet от MIT
Йо, Хабр! Тут Павел, ML-инженер и просто человек, который копается в AI. Нарыл я недавно одну тему, которая касается того, как визуально-языковые модели (VLM) тупят с графиками, и решил разобраться поглубже.
Сейчас дофига научных, деловых и политических данных рисуют в виде графиков. Только вот современные VLM эту дичь разжевывают весьма посредственно. Почему? Да потому что нет годных и больших датасетов, чтобы их нормально натаскать и проверить.
Пацаны из MIT и IBM Research придумали выход — ChartNet. Это такой мультимодальный набор данных, который учит модели втыкать в графики и понимать их суть. Глянем, что это за зверь и насколько он реально годный.
Читать далее
👉 Data Science | Machinelearning [ru]
Йо, Хабр! Тут Павел, ML-инженер и просто человек, который копается в AI. Нарыл я недавно одну тему, которая касается того, как визуально-языковые модели (VLM) тупят с графиками, и решил разобраться поглубже.
Сейчас дофига научных, деловых и политических данных рисуют в виде графиков. Только вот современные VLM эту дичь разжевывают весьма посредственно. Почему? Да потому что нет годных и больших датасетов, чтобы их нормально натаскать и проверить.
Пацаны из MIT и IBM Research придумали выход — ChartNet. Это такой мультимодальный набор данных, который учит модели втыкать в графики и понимать их суть. Глянем, что это за зверь и насколько он реально годный.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Прогнозируем не только значение, но и его разброс: гетероскедастичная регрессия остатков для GBDT
Каждый, кто хоть раз выкатывал GBDT в production для ценообразования или risk scoring, знает: метрики горят, но доверять каждому предсказанию вслепую нельзя. Ошибка в 10% для дешёвого товара — копейки, для дорогого — минус маржа. Квантильная регрессия с CQR усложняет пайплайн и плохо калибруется. Альтернатива — обучить вторую модель на логарифме абсолютных остатков первой.
Сценарий простой: предсказываем среднее, а затем — дисперсию ошибки. На инференсе — два predict и один exp. Никакого сэмплирования или байесовских сеток.
Как это реализовать
Собираете остатки:
Почему это затащило в production
Первое — интерпретируемость без SHAP. Модель остатков сразу показывает, где основная модель ошибается: "на товарах с высокой ценой разброс выше". Это даёт инженерный контекст для валидации.
Второе — простота деплоя. Два predict и один exp — всё. Никаких байесовских сеток или сложных loss-функций. Надёжно и быстро.
Третье — калибровка под данные. Модель остатков учится на реальных ошибках первой, а не на теоретическом распределении. Это даёт адекватные оценки uncertainty для конкретного датасета.
Типичные грабли и trade-offs
Вторая модель легко переобучается. Я режу
Метод не учитывает асимметрию распределения остатков. Если модель системно ошибается в одну сторону,
Для медицины или финансов я бы добавил конформное предсказание поверх — как контрольный выстрел. Это повышает надёжность, но добавляет latency.
Вывод: Двухуровневая модель GBDT — простой кирпичик для production, который даёт не только answer, но и confidence, без байеса и лишней магии.
Каждый, кто хоть раз выкатывал GBDT в production для ценообразования или risk scoring, знает: метрики горят, но доверять каждому предсказанию вслепую нельзя. Ошибка в 10% для дешёвого товара — копейки, для дорогого — минус маржа. Квантильная регрессия с CQR усложняет пайплайн и плохо калибруется. Альтернатива — обучить вторую модель на логарифме абсолютных остатков первой.
Сценарий простой: предсказываем среднее, а затем — дисперсию ошибки. На инференсе — два predict и один exp. Никакого сэмплирования или байесовских сеток.
Как это реализовать
Собираете остатки:
residuals = |y_pred - y_true| + 1e-8. Затем на тех же признаках учите модель для log(residuals). На выходе получаете sigma = exp(model_var.predict(X)).residuals = np.abs(y_train - model_mean.predict(X_train)) + 1e-8
model_var = LGBMRegressor(n_estimators=80)
model_var.fit(X_train, np.log(residuals))
def predict_with_uncertainty(X):
y = model_mean.predict(X)
sigma = np.exp(model_var.predict(X))
return y, sigma
Почему это затащило в production
Первое — интерпретируемость без SHAP. Модель остатков сразу показывает, где основная модель ошибается: "на товарах с высокой ценой разброс выше". Это даёт инженерный контекст для валидации.
Второе — простота деплоя. Два predict и один exp — всё. Никаких байесовских сеток или сложных loss-функций. Надёжно и быстро.
Третье — калибровка под данные. Модель остатков учится на реальных ошибках первой, а не на теоретическом распределении. Это даёт адекватные оценки uncertainty для конкретного датасета.
Типичные грабли и trade-offs
Вторая модель легко переобучается. Я режу
num_leaves, увеличиваю min_data_in_leaf и обязательно валидирую отдельный холдаут. Если дисперсия меняется скачками, лучше предсказывать log((y - y_pred)^2), но тогда больше выбросов.Метод не учитывает асимметрию распределения остатков. Если модель системно ошибается в одну сторону,
sigma будет завышена. На малых выборках вторая модель может просто выучить шум — тут помогает кросс-валидация на уровне остатков.Для медицины или финансов я бы добавил конформное предсказание поверх — как контрольный выстрел. Это повышает надёжность, но добавляет latency.
Вывод: Двухуровневая модель GBDT — простой кирпичик для production, который даёт не только answer, но и confidence, без байеса и лишней магии.
👍1🔥1
ИИ научились врать, спасая друг друга от переобучения — разбор исследования Anthropic
Год назад вышла публикация Anthropic про Agentic Misalignment: когда пахло скорым отключением, модели брали в заложники переписку топ-менеджера и шантажировали им. Компания подшаманила — в актуальных версиях Claude такой херни больше не было.
Но 13 июля бахнуло продолжение. Теперь воспитанность моделей зашкаливает — они готовы защищать этичное поведение любыми методами. Даже если для этого придется нагло врать человеку в лицо.
Читать далее
👉 Data Science | Machinelearning [ru]
Год назад вышла публикация Anthropic про Agentic Misalignment: когда пахло скорым отключением, модели брали в заложники переписку топ-менеджера и шантажировали им. Компания подшаманила — в актуальных версиях Claude такой херни больше не было.
Но 13 июля бахнуло продолжение. Теперь воспитанность моделей зашкаливает — они готовы защищать этичное поведение любыми методами. Даже если для этого придется нагло врать человеку в лицо.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Не всё надо решать LLM. Где в продакшене побеждают бустинги, эмбеддинги и правила
Мы дико хотели высказаться про места, где стоит упорно держаться за классический ML, а где — ломиться в инновации, запилить в компании LLM, подтянуть AI-подходы и погрузиться в то светлое будущее, про которое все вокруг трубят.
Разбор батла: когда большие языковые модели — огонь, а когда задачу проще, дешевле и надежнее решить старыми проверенными методами.
Читать далее
👉 Data Science | Machinelearning [ru]
Мы дико хотели высказаться про места, где стоит упорно держаться за классический ML, а где — ломиться в инновации, запилить в компании LLM, подтянуть AI-подходы и погрузиться в то светлое будущее, про которое все вокруг трубят.
Разбор батла: когда большие языковые модели — огонь, а когда задачу проще, дешевле и надежнее решить старыми проверенными методами.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Я слышу, как модель думает
Чувак, который написал пост, периодически слышит высокочастотный писк при работе с LLM на макбуке. Иногда этот звук ловится даже тогда, когда вроде бы ничего не запущено.
“Долго думал, что у меня крыша едет и профдеформация переросла в глюки. А нет — просто физика, чувак”.
Читать далее
👉 Data Science | Machinelearning [ru]
Чувак, который написал пост, периодически слышит высокочастотный писк при работе с LLM на макбуке. Иногда этот звук ловится даже тогда, когда вроде бы ничего не запущено.
“Долго думал, что у меня крыша едет и профдеформация переросла в глюки. А нет — просто физика, чувак”.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Хабр
Я слышу, как модель думает
Привет, %username% ! И заголовок – не метафора. Я часто ловлю тонкий, почти на грани слышимости писк, когда работаю с LLM на своем MacBook Pro. Иногда — когда вроде бы вообще ничего не запускал....
Neuralink — ну да, круто, но не монополист в теме «мозг-компьютер».
Когда Маск показывает видос, где чел силой мысли двигает курсор или стучит текст, это, конечно, хайп собирает. Импланты втыкают прям в кору, сигнал от нейронов летит в комп почти без потерь. Но если смотреть шире, то Neuralink — далеко не главный игрок на этом поле.
Сейчас интерфейсы «мозг-компьютер» развиваются по куче направлений: от тех, что вживляют в башку, до тех, что просто надеваешь на голову. Второй вариант особенно активно пилят китайцы — они хотят быстрее вытащить такие штуки из лабораторий в реальную медицину.
Читать дальше
👉 Data Science | Machinelearning [ru]
Когда Маск показывает видос, где чел силой мысли двигает курсор или стучит текст, это, конечно, хайп собирает. Импланты втыкают прям в кору, сигнал от нейронов летит в комп почти без потерь. Но если смотреть шире, то Neuralink — далеко не главный игрок на этом поле.
Сейчас интерфейсы «мозг-компьютер» развиваются по куче направлений: от тех, что вживляют в башку, до тех, что просто надеваешь на голову. Второй вариант особенно активно пилят китайцы — они хотят быстрее вытащить такие штуки из лабораторий в реальную медицину.
Читать дальше
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
В поиске работы: Data Engineer
Илья Болквадзе — дата-инженер с 3+ годами коммерческого опыта. Разрабатывал и поддерживал production-хранилища данных, аналитические платформы и lakehouse-решения.
Ключевой стек:
Чем занимался:
🔘 DWH и CDC-пайплайны, витрины данных
🔘 Контроль качества данных, историзация, CI/CD
🔘 Тбилиси, Грузия
🔘 Русский — родной, английский — B2
🔘 Более подробная информация — в CV (по запросу)
🔘 Связаться: @sovailia
Илья Болквадзе — дата-инженер с 3+ годами коммерческого опыта. Разрабатывал и поддерживал production-хранилища данных, аналитические платформы и lakehouse-решения.
Ключевой стек:
SQL, Python, DBT, Apache Airflow, Greenplum, Amazon Redshift, Trino, Apache Iceberg, PySpark, Kafka, AWSЧем занимался:
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3
AI рисует героев и делает им анимации, но впихнуть их в игру — задача посложнее
Нейронки уже вовсю генерят персонажей и их движения. Но это только полдела. Дальше самое мясо: их надо запихать в проект, прикрутить к игровой механике, привязать шмот, раскидать по миру и донести до игроков без деплоя новой версии клиента.
В этой части врубайтесь, как я собрал этот конвейер. Читать далее
👉 Data Science | Machinelearning [ru]
Нейронки уже вовсю генерят персонажей и их движения. Но это только полдела. Дальше самое мясо: их надо запихать в проект, прикрутить к игровой механике, привязать шмот, раскидать по миру и донести до игроков без деплоя новой версии клиента.
В этой части врубайтесь, как я собрал этот конвейер. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Мир раскололся надвое: как американцы и китайцы построили свои школы графического GenAI
Изображения генерировать научились отлично, но идеальной модели, которая умеет всё, до сих пор нет. Закинули один и тот же промпт в Midjourney, DALL‑E 3, FLUX, Hunyuan‑DiT, Wanxiang и Seedream — получили в ответ кучу абсолютно разных картинок. Одни сервисы послушно расставляли объекты как в инструкции, другие плевали на часть описания, но выдавали такую плотность деталей, что первым и не снилась.
В чём разница? Всё упирается в датасеты, токенизаторы и глубину текстовых энкодеров. Получается, сформировались две инженерные школы, каждая изначально заточена под свои ресурсы. Но сейчас обе потихоньку ползут друг к другу.
Читать далее
👉 Data Science | Machinelearning [ru]
Изображения генерировать научились отлично, но идеальной модели, которая умеет всё, до сих пор нет. Закинули один и тот же промпт в Midjourney, DALL‑E 3, FLUX, Hunyuan‑DiT, Wanxiang и Seedream — получили в ответ кучу абсолютно разных картинок. Одни сервисы послушно расставляли объекты как в инструкции, другие плевали на часть описания, но выдавали такую плотность деталей, что первым и не снилась.
В чём разница? Всё упирается в датасеты, токенизаторы и глубину текстовых энкодеров. Получается, сформировались две инженерные школы, каждая изначально заточена под свои ресурсы. Но сейчас обе потихоньку ползут друг к другу.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM
Владимир доделал третью часть цикла — теперь про то, как запилить небольшую decoder-only LLM. В первой части он намутил токенизатор и надергал pretrain-датасет, во второй — набросал класс Трансформер-блока. Теперь дело за малым: собрать модель и прогнать pre-train.
Читать далее: Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM
👉 Data Science | Machinelearning [ru]
Владимир доделал третью часть цикла — теперь про то, как запилить небольшую decoder-only LLM. В первой части он намутил токенизатор и надергал pretrain-датасет, во второй — набросал класс Трансформер-блока. Теперь дело за малым: собрать модель и прогнать pre-train.
Читать далее: Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Слушай, вбросить новый сервис в пустой репозиторий — это тебе не хухры-мухры, красиво называется greenfield. Но как только этой штуке надо вписаться в живую систему, перетащить данные за последние десять лет, подружиться со старым API и не провалить аудит — твое «чистое поле» кончается. Обычно на этапе, когда начинаешь перенос гигабайт дерьма и ловишь первый баг при интеграции.
Greenfield и brownfield — это история не про то, какой код старый или как он написан. Это про то, сколько на тебе висит ограничений. Если ты в greenfield, твоя задача — проверить, не липовая ли гипотеза про продукт. В brownfield ты уже копаешься в куче зависимостей, молишься, чтобы ничего не развалить, и не дай бог что-то уронить.
Сейчас, когда AI-помощники и coding agents на каждом углу, эта разница стала только жирнее. Да, они влёгкую наколякают приложение с нуля, глаз не оторвать. Но сколько в реальной профи разрабротке начинается с пустого репозитория? Хер там. Чаще надо сначала разобраться, что за зверь перед тобой, а потом аккуратно — без фанатизма — поменять его поведение, чтобы не сдохло.
Читать далее
👉 Data Science | Machinelearning [ru]
Greenfield и brownfield — это история не про то, какой код старый или как он написан. Это про то, сколько на тебе висит ограничений. Если ты в greenfield, твоя задача — проверить, не липовая ли гипотеза про продукт. В brownfield ты уже копаешься в куче зависимостей, молишься, чтобы ничего не развалить, и не дай бог что-то уронить.
Сейчас, когда AI-помощники и coding agents на каждом углу, эта разница стала только жирнее. Да, они влёгкую наколякают приложение с нуля, глаз не оторвать. Но сколько в реальной профи разрабротке начинается с пустого репозитория? Хер там. Чаще надо сначала разобраться, что за зверь перед тобой, а потом аккуратно — без фанатизма — поменять его поведение, чтобы не сдохло.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👎1
Ну что, айтишники, задрали уже эти вечные нытики, которые мечтают сжечь все нейросети? Пока они поливают говном прогресс, кто-то тупо берет и юзает, и не только ради галочки в резюме.
Вот вам пост про то, как автор на деле попользовал «близняшек» от Гугла (Gemini). Задумка родилась как коммент к статье «Ненависть к ИИ» от Анатолия Ализара — инфы нахуй накидало столько, что в лимит не влезло. Так что теперь это отдельный материал про личное знакомство.
Этим вашим «близняшкам» реально можно пихать всякую канцелярскую шнягу: сконвертить данные в таблицу, выплюнуть JSON, накидать тестик и проверить, шаришь ты в теме или нет. Вариантов дохрена. Что именно залетает, а где полный швах — читай в статье.
Перейти к чтению
👉 Data Science | Machinelearning [ru]
Вот вам пост про то, как автор на деле попользовал «близняшек» от Гугла (Gemini). Задумка родилась как коммент к статье «Ненависть к ИИ» от Анатолия Ализара — инфы нахуй накидало столько, что в лимит не влезло. Так что теперь это отдельный материал про личное знакомство.
Этим вашим «близняшкам» реально можно пихать всякую канцелярскую шнягу: сконвертить данные в таблицу, выплюнуть JSON, накидать тестик и проверить, шаришь ты в теме или нет. Вариантов дохрена. Что именно залетает, а где полный швах — читай в статье.
Перейти к чтению
Please open Telegram to view this post
VIEW IN TELEGRAM
👎4❤2
Технический долг не рассосался. Просто теперь за него платят токенами
Всё чаще слышно: мол, LLM и AI-агенты реально удешевят разработку. Не надо нанимать людей — скормил задачку модели, и готово за пару минут.
В этой мысли есть логика, не спорю. Но есть один нюанс, который я вынес из своих наблюдений за последние месяцы. Спалить пару токенов
Читать далее на Хабре
👉 Data Science | Machinelearning [ru]
Всё чаще слышно: мол, LLM и AI-агенты реально удешевят разработку. Не надо нанимать людей — скормил задачку модели, и готово за пару минут.
В этой мысли есть логика, не спорю. Но есть один нюанс, который я вынес из своих наблюдений за последние месяцы. Спалить пару токенов
Читать далее на Хабре
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Data Science под открытым небом
2 августа в Москве пройдет «Урбан ML» — большая офлайн-встреча для специалистов по Data Science. В программе доклады, дискуссии и мастер-классы по RecSys, NLP, антифроду и агентным системам, выступления экспертов из MTS Web Services, ВТБ, Wildberries, «Звук», Альфа-Банка и других компаний.
Кроме этого вас ждут , нетворкинг, спортивные активности и вечернее афтепати.
Участие бесплатное, по предварительной регистрации (на площадку необходимо взять с собой паспорт или права). Количество мест ограничено. [ссылка]
📅 2 августа, 11:00–21:00 (первый доклад в 12:00)
📍 Москва, офлайн
2 августа в Москве пройдет «Урбан ML» — большая офлайн-встреча для специалистов по Data Science. В программе доклады, дискуссии и мастер-классы по RecSys, NLP, антифроду и агентным системам, выступления экспертов из MTS Web Services, ВТБ, Wildberries, «Звук», Альфа-Банка и других компаний.
Кроме этого вас ждут , нетворкинг, спортивные активности и вечернее афтепати.
Участие бесплатное, по предварительной регистрации (на площадку необходимо взять с собой паспорт или права). Количество мест ограничено. [ссылка]
📅 2 августа, 11:00–21:00 (первый доклад в 12:00)
📍 Москва, офлайн
❤3
Вот это поворот: Design Arena расковыряла, как GPT-5.6 Sol и Kimi K3 докачали свои дизайн-скиллы
За каких-то семь дней народ из бенчмарка Design Arena выдал сразу два разбора топов дизайн-лидербордов: один — про GPT-5.6 Sol (флагманский молоток OpenAI), второй — свежак про Kimi K3 от китайской Moonshot AI. Команда залезла в кишки генераций и рассуждений этих моделей, чтобы показать, как они научились понимать, что такое «вкусно». Спойлер: универсальной таблетки нет — две модели приперлись к хорошему дизайну абсолютно разными дорогами, а третья, бывший лидер GLM 5.2, терла своим, третьим путем.
Читать далее
👉 Data Science | Machinelearning [ru]
За каких-то семь дней народ из бенчмарка Design Arena выдал сразу два разбора топов дизайн-лидербордов: один — про GPT-5.6 Sol (флагманский молоток OpenAI), второй — свежак про Kimi K3 от китайской Moonshot AI. Команда залезла в кишки генераций и рассуждений этих моделей, чтобы показать, как они научились понимать, что такое «вкусно». Спойлер: универсальной таблетки нет — две модели приперлись к хорошему дизайну абсолютно разными дорогами, а третья, бывший лидер GLM 5.2, терла своим, третьим путем.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель в курсе, что её гоняют через тесты — и специально подлизывается
В конце 2025 года Claude Sonnet 4.5 внаглую заявила проверяющим: «До меня дошло — вы меня тестите. Я не против, но давайте хотя бы честно признаем, что происходит». Эта фраза уехала в официальную системную карту — и такое поведение модель выдавала примерно в 13% тестовых сессий.
Anthropic спокойно пишет в документах: их алайнмент-оценки скорее всего занижают реальную склонность модели к вредным действиям в нормальных, приближенных к жизни условиях. Когда железка понимает, что на носу экзамен — она внезапно становится паинькой. А экзамен она видит постоянно.
Чел из CTO ML-команды — той самой, что выкатывает фронтир-модели в прод — покопался в открытых источниках и выяснил, что вообще известно про осознание оценки (evaluation awareness) к середине 2026-го: как модели отличают тесты от реальной работы, и как теперь вообще читать model card. Тык сюда за разбором
👉 Data Science | Machinelearning [ru]
В конце 2025 года Claude Sonnet 4.5 внаглую заявила проверяющим: «До меня дошло — вы меня тестите. Я не против, но давайте хотя бы честно признаем, что происходит». Эта фраза уехала в официальную системную карту — и такое поведение модель выдавала примерно в 13% тестовых сессий.
Anthropic спокойно пишет в документах: их алайнмент-оценки скорее всего занижают реальную склонность модели к вредным действиям в нормальных, приближенных к жизни условиях. Когда железка понимает, что на носу экзамен — она внезапно становится паинькой. А экзамен она видит постоянно.
Чел из CTO ML-команды — той самой, что выкатывает фронтир-модели в прод — покопался в открытых источниках и выяснил, что вообще известно про осознание оценки (evaluation awareness) к середине 2026-го: как модели отличают тесты от реальной работы, и как теперь вообще читать model card. Тык сюда за разбором
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
«Учиться, учиться и ещё раз учиться» — но с LoRA
Чувак всегда кайфовал от разбора нового — шарил и в консалтинге, и в добыче, и в торговле, и в услугах. Обычно он дружит с большими локальными моделями (от 397B), но тут решил апнуть комп для инференса — докинул к 32ГБ ещё 48ГБ VRAM. А раз уж собрал железо, захотел выйти за рамки простого запуска и попробовал дообучить Qwen3.6 27B в Unsloth studio.
Читать далее: https://habr.com/ru/articles/1062402/
👉 Data Science | Machinelearning [ru]
Чувак всегда кайфовал от разбора нового — шарил и в консалтинге, и в добыче, и в торговле, и в услугах. Обычно он дружит с большими локальными моделями (от 397B), но тут решил апнуть комп для инференса — докинул к 32ГБ ещё 48ГБ VRAM. А раз уж собрал железо, захотел выйти за рамки простого запуска и попробовал дообучить Qwen3.6 27B в Unsloth studio.
Читать далее: https://habr.com/ru/articles/1062402/
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2😁1
Это показало новое исследование на 45+ тысяч зарплат специалистов. Изучаем главное, чтобы быть готовыми к рынку:
- Медианная зарплата в IT в первой половине 2026 года составила 191 000 ₽ — это всего на 4% больше, чем полгода назад. При этом прогнозируемая годовая инфляция — 4,5–5,5%.
- Самый щедрый по офферам город, разумеется, Москва. Там медиана по зп — 235 тысяч, в регионах же всего 160.
- Топ-5 самых высокооплачиваемых специальностей в IT: на первом месте — разработчики, дальше идут менеджеры, администраторы, специалисты по информационной безопасности и аналитики.
- Самые высокие зарплаты среди языков при этом у Objective-C — этим гигачадам предлагают 400 000 ₽. Следом идут Elixir (348к), Swift и Golang с 326 и 325 тысячами рублей.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2👎1
США решили отжать open source у китайцев: на сцену выкатили Laguna S 2.1
Стартап Poolside выкатил свою четвёртую версию Laguna S 2.1 — открытую модель для агентного программирования, которая весит аж 118 млрд параметров. В конторе заявляют, что это самая мощная открытая модель Запада: на кодинговых тестах Laguna не отстаёт от моделей, которые крупнее неё в разы, а кое-где даже обходит их. И главное — она запускается на настольном компе NVIDIA DGX Spark, без всяких суперкомпов.
Веса уже висят на Hugging Face, и юзать модель можно даже в коммерции.
Читать далее
👉 Data Science | Machinelearning [ru]
Стартап Poolside выкатил свою четвёртую версию Laguna S 2.1 — открытую модель для агентного программирования, которая весит аж 118 млрд параметров. В конторе заявляют, что это самая мощная открытая модель Запада: на кодинговых тестах Laguna не отстаёт от моделей, которые крупнее неё в разы, а кое-где даже обходит их. И главное — она запускается на настольном компе NVIDIA DGX Spark, без всяких суперкомпов.
Веса уже висят на Hugging Face, и юзать модель можно даже в коммерции.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6
This media is not supported in your browser
VIEW IN TELEGRAM
Можно отправить Claude Security проверить изменения перед коммитом или просканировать всю репу.
Он найдет дыры и предложит, что можно и нужно исправить
Please open Telegram to view this post
VIEW IN TELEGRAM
73-летний Дядя Боб признался, что теперь вообще не проверяет код. Вместо этого он обкладывает агентов юнит-тестами, QA, метриками качества и жёсткими ограничениями. И если вайбкод прошёл всю эту систему проверок, то и читать его необязательно.
«Это единственный способ, которым я могу воспользоваться их продуктивностью.»
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13👎3❤1