Вайб-кодинг
51.3K subscribers
1.99K photos
822 videos
30 files
1.3K links
Авторский канал по ВАЙБ КОДИНГУ

Ссылка для друзей: https://t.me/+ll3pbl442dNkZmYy

Cотрудничество: @devmangx

РКН: https://clck.ru/3RRVfk
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Qwen 3.8 Max действительно впечатляет.

Модели Qwen 3.8 Max, Claude Opus 5, Kimi K3 и GPT-5.6 Sol получили одну и ту же фотографию неба с просьбой нарисовать силуэт животного по форме облаков.

По этому тесту Qwen 3.8 Max выглядел ничуть не хуже остальных моделей.

А вот GPT, похоже, разглядел в облаках что-то своё. 😄
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Forwarded from Айти мемы
This media is not supported in your browser
VIEW IN TELEGRAM
Ежедневная рутина с Claude
Модель или обвязка?

Если вы разрабатываете ИИ-агентов для продакшена, эту статью стоит сохранить.

Авторы собрали 41 типичный сценарий отказа и классифицировали их по тому, на стыке каких компонентов возникает проблема. Каждая ошибка привязывается к взаимодействию между моделью, обвязкой, пользователем, инструментами, памятью или окружением, а также указывает, на какой стороне находится причина и где её нужно исправлять.

Это хорошо отражает реальную картину: большинство проблем ИИ-агентов возникает не в самой модели, а на стыке модели и окружающей её инфраструктуры.

Подход также подходит для автоматического анализа. В тестах на четырёх передовых моделях лучший ИИ-судья достиг коэффициента согласия Коэна 0,76 по сравнению с ручной разметкой. Это позволяет автоматически классифицировать ошибки прямо в продакшене, а не разбирать их вручную после каждого инцидента.

В этом году инженерия обвязки стала одним из главных факторов качества ИИ-агентов, но общего языка для разделения ошибок модели и ошибок обвязки до сих пор не было. Эта работа как раз предлагает такую систему.

Статья: https://arxiv.org/abs/2607.28802
5
Совет по вайбкодингу: попросите Codex создать интерактивную карту вашего репозитория, а затем отмечать, какие модули изменились с момента её генерации.

Нажав на любой модуль, можно увидеть его вызывающие компоненты, зависимости, основные потоки выполнения, связанные тесты и подтверждающие данные из исходного кода.

Он создаёт:
docs/codemap/codemap.html
docs/codemap/codemap.json
docs/codemap/codemap.lock

Полный промпт ↓

Analyze the current codebase. Do not modify product code. Only create or update files under docs/codemap/.

Ignore vendor, build, dist, cache, and other generated directories.

If docs/codemap/ already exists, first compare the existing codemap.lock with the current repo and list the modules that changed. Then regenerate these three files together:

1. docs/codemap/codemap.html

Build a fully self-contained interactive code map that opens directly in a browser. Include:

- major modules, services, databases, queues, and external dependencies
- no more than 20 primary nodes; group low-level files under their parent module
- calls and data flows between modules
- the 3-5 most important end-to-end flows
- a clear dark theme by default
- system boundaries and the most important data flows visible on the first screen
- color-coded module types with a simple legend
- automatic layout that minimizes crossing edges
- clicking any module highlights its upstream callers, downstream dependencies, related tests, and the flows it belongs to
- selecting a flow highlights its complete path
- search, filtering, zoom, and drag controls

At the top, show the repo name, generation time, and the commit it was generated from.

2. docs/codemap/codemap.json

Use this structure:

{
"generated_at": "",
"generated_from_commit": "",
"scope": [],
"nodes": [],
"edges": [],
"flows": []
}

Each node must include:

- id
- path
- role
- entrypoints
- tests
- constraints
- evidence

Each edge must include:

- from
- to
- type
- evidence

type may only be:

- imports
- calls
- reads
- writes
- publishes
- subscribes

Each flow must include:

- trigger
- steps
- outcome

Every step must reference an existing node id.

Attach the matching source path and symbol to every node and edge. Mark any relationship without source evidence as unknown. Do not guess.

3. docs/codemap/codemap.lock

Use parseable JSON to record:

- the current commit
- whether the working tree has uncommitted changes
- generation time
- scanned scope
- excluded directories
- the fingerprint algorithm
- a deterministic fingerprint for each top-level module, calculated from its tracked file paths and current file contents

If no existing codemap.lock is found, treat every module as new and generate the full map.

When finished, verify that:

- codemap.json parses successfully
- every node path exists and every evidence symbol can be found in the source
- every edge and flow step references an existing node
- codemap.html and codemap.json use the same nodes, edges, and flows
- codemap.lock matches the current commit, working tree state, and module fingerprints
- every relationship without source evidence is marked unknown

These three files must always be generated together from the current repo. Never edit only one of them manually.

Finally, show:

- files created or modified
- stale modules
- remaining unknowns
- validation results
- the complete diff


Ещё один момент. Добавьте правило в AGENTS.md, чтобы карта кода всегда оставалась синхронизированной с репозиторием:

At the start of every code-changing task, compare the current repo with docs/codemap/codemap.lock.

Before modifying a module, use docs/codemap/codemap.json to answer three questions:

1. What calls it?
2. What does it affect?
3. Which tests cover it?

If the map is stale or cannot answer those questions, regenerate codemap.html, codemap.json, and codemap.lock before changing the code.

Whenever module boundaries, dependencies, routes, databases, queues, or major data flows change, update the code map in the same commit as the code.
3
Вычисления для ИИ скоро отправятся на орбиту.

NVIDIA и SpaceX официально объединяются для создания космического дата-центра.

В рамках проекта спутник Starmind AI1 получит вычислительный модуль на базе NVIDIA Vera Rubin NVL72.

Он будет использовать солнечную энергию для работы ИИ-инфраструктуры на орбите, обеспечивая высокопроизводительные вычисления с передачей результатов на Землю. 🚀
Please open Telegram to view this post
VIEW IN TELEGRAM
3
This media is not supported in your browser
VIEW IN TELEGRAM
Firecrawl запустил anydoc — их новый движок для парсинга документов на Rust

Он конвертирует PDF, Word-документы, презентации и ещё 10 форматов в Markdown менее чем за 5 мс, сохраняя одно из лучших качеств обработки в индустрии.

100% опенсорс
7
Anthropic vs OpenAI 😂😂😂
Please open Telegram to view this post
VIEW IN TELEGRAM
COMEBACK: Meta выпустили Muse Spark 1.2 и собственную IDE Muse Code в бета-версии. 🍗

Это быстрое обновление после Muse Spark 1.1, вышедшей всего несколько недель назад. Новая версия получила больше фокуса на задачах программирования и новый harness.

В тестах модель показала заметный рост в Terminal Bench, DeepSWE и внутренних бенчмарках. В агентных сценариях улучшились результаты в GDPVal и MCP Atlas.

В DeepSWE 1.1 Muse Spark 1.2 набрала 59%, обойдя Grok Build 4.5 и Gemini 3.6 Flash.

При этом цена остаётся крайне низкой. Если готовы немного поделиться данными с Цукербергом ради «улучшения продуктов Meta» — Spark 1.2 можно получить почти даром: $0,10 за 1 млн входных токенов и $0,20 за 1 млн выходных.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Очень интересный релиз: Prime Intellect запустили Prime Agent — обвязку, которая превращает долгие автономные сессии ИИ в отдельную задачу программирования.

Его единственный инструмент — постоянное IPython-ядро. Модель может программно искать по своей истории, вызывать инструменты, запускать постоянных субагентов и хранить полезное состояние вне активного контекста.

Prime Intellect описывают это так:
«RLM рассматривает контекст как переменную, а делегирование субагентам — как вызовы функций внутри REPL».


В основе лежат три идеи:

— программный вызов инструментов через RLM;
— постоянная работа нескольких субагентов;
— самоизменяемый harness, который позволяет агенту обновлять собственную память, навыки и настройки.

Они сообщают о заметном приросте результатов на задачах с длинным контекстом и долгим горизонтом. На ARC-AGI-3 Opus 5 в стандартной конфигурации набрал 30,2%, а с Prime Agent результат вырос до 95,5%, превысив заявленный хуман эксперт базлайн — 95,4%.

Также на предварительном бенчмарке он с нуля создал рабочие эмуляторы SEGA Genesis и Game Boy Color на Rust :D

опенсорс 🥰
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Совет: используйте Codex, Claude Code или другого ИИ-агента, чтобы быстро найти, что занимает место на диске.

Если хранилище переполнено и непонятно, куда исчезло свободное место, просто попросите Codex просканировать систему.

Промпт:
«Просканируй систему и найди, что занимает место на диске. Найди крупные файлы, старые установщики, неиспользуемые приложения, папки с кэшем, заброшенные проекты и всё, что можно безопасно очистить. Сгруппируй результаты по категориям с указанием размера и отметь, что можно удалить автоматически, а что требует моей проверки. Пока ничего не удаляй — только покажи список».


Codex найдёт самые объёмные файлы, объяснит, что это такое, и покажет, что можно удалить без риска, а что лучше сначала проверить. Это гораздо быстрее, чем вручную искать всё по папкам и переживать, что случайно удалишь что-то важное. 😓
Please open Telegram to view this post
VIEW IN TELEGRAM
Плохие новости: на странице API DeepSeek написано, что в ближайшее время стоимость использования API DeepSeek значительно вырастет.

Самое время выжать максимум из Flash, пока он не подорожал. 👀
Please open Telegram to view this post
VIEW IN TELEGRAM
Похоже, OpenAI работают над функцией, которая позволит покупать сброс лимитов запросов для Codex.

На это указывают находки в публичной конфигурации страницы оплаты и ресурсах веб-приложения ChatGPT.

Теперь ясно, почему Tibo не сбрасывает нам лимиты. 🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
OpenAI существенно обновила ChatGPT:

Теперь пользователи Free и Go могут без ограничений пользоваться GPT-5.6 Luna в текстовых чатах — моделью, возможностей которой уже более чем достаточно для большинства повседневных задач. Кроме того, на бесплатном тарифе появляется кнопка Think, которая позволяет модели уделять больше времени рассуждению при ответе на сложные вопросы.

Не остались без обновлений и пользователи Plus и Pro. Все новые чаты теперь по умолчанию работают на GPT-5.6 Sol, а также появился ползунок, с помощью которого можно регулировать объём рассуждений перед ответом. По данным OpenAI, новая версия модели допускает на 68% меньше фактических ошибок по сравнению с GPT-5.5 Instant. 💃

При этом обновление касается только обычных чатов ChatGPT. Версии GPT-5.6 Sol для Codex и Work остаются без изменений.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Теперь Codex Security Review можно запускать прямо из GitHub.

Codex теперь может автоматически выполнять проверку безопасности каждого GitHub PR с учётом контекста всего репозитория, оставляя найденные проблемы и рекомендации прямо в комментариях к изменённому коду.

Узнать, как включить автоматическую проверку 🔈
Please open Telegram to view this post
VIEW IN TELEGRAM
Anthropic обновила защитные механизмы Claude Fable 5, связанные с биологией, чтобы сократить количество ложных срабатываний. После обновления число отказов по запросам, связанным с биологией, уменьшилось примерно на 85% во всех продуктах компании.

При этом запросы, которые Anthropic считает задачами двойного назначения, включая вирусологию, токсикологию и молекулярный дизайн, по-прежнему будут автоматически передаваться в Opus 5. Из-за этого Fable 5 всё ещё не подходит для профессиональных биологических исследований и разработки лекарств.

Впрочем, на вопрос, откуда берутся дети, Claude Fable 5 по-прежнему отвечать отказывается. 🥲
Please open Telegram to view this post
VIEW IN TELEGRAM