Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
LiteParse — парсер документов, чтобы агенты точнее читали текст с PDF, Word, Excel, PowerPoint и картинок.
Обычно Claude Code читает PDF через pypdf или pdfplumber и каждый раз пишет для этого новый Python скрипт.
Тут LiteParse делает это одной командой. Парсит локально, быстро и без GPU.
Подойдет, если хотите, чтобы агент мог быстро прочитать PDF и работать дальше, а если нужно разобрать что-то визуально, то сделает скриншоты.
Для простых доков хватит, для сложных таблиц, нужно решение поточнее, например их облачный LlamaParse или olmOCR 2 на своем GPU.
Установка:
Использовать командами:
• lit parse document.pdf
• lit screenshot document.pdf
Есть еще skill для Claude Code и GitHub
@tips_ai #tools
Обычно Claude Code читает PDF через pypdf или pdfplumber и каждый раз пишет для этого новый Python скрипт.
Тут LiteParse делает это одной командой. Парсит локально, быстро и без GPU.
Подойдет, если хотите, чтобы агент мог быстро прочитать PDF и работать дальше, а если нужно разобрать что-то визуально, то сделает скриншоты.
Для простых доков хватит, для сложных таблиц, нужно решение поточнее, например их облачный LlamaParse или olmOCR 2 на своем GPU.
Установка:
npm i -g @llamaindex/liteparseИспользовать командами:
• lit parse document.pdf
• lit screenshot document.pdf
Есть еще skill для Claude Code и GitHub
@tips_ai #tools
❤1
Вчера в первый раз столкнулся с тем, что Claude code из терминала сам запустил Хром, полез с интернет и начал парсить базу данных..
Скоро так любую программу сможет запускать, не только браузер..
https://t.me/denissexy/11312
Скоро так любую программу сможет запускать, не только браузер..
https://t.me/denissexy/11312
Telegram
Denis Sexy IT 🤖
Антропик правда OpenClaw строит – теперь можно управлять компьютером через Claude:
https://claude.com/product/cowork#dispatch-and-computer-use
Говорите с телефона – мол, иди сделай задачу X, он сам экран смотрит и делает работу ☕️
https://claude.com/product/cowork#dispatch-and-computer-use
Говорите с телефона – мол, иди сделай задачу X, он сам экран смотрит и делает работу ☕️
У Claude code, кстати, появилась команда /schedule , которая позволяет запускать работу по расписанию. Хорошая тема
Блин, я это пишу своими руками… (на как своими, Клод пишет, а я команды даю)
теперь всегда так - только появляется возможность что-то сделать, это делают за тебя..
https://t.me/data_analysis_ml/4866
теперь всегда так - только появляется возможность что-то сделать, это делают за тебя..
https://t.me/data_analysis_ml/4866
Telegram
Анализ данных (Data analysis)
🚀 Похоже, в Claude Code появилась новая фича - Auto-dream
Пока официально не анонсирована, но её уже заметили в /memory
• Что это такое
Auto-dream - это фоновый подагент Claude, который:
- анализирует последние сессии
- извлекает ключевые знания
-…
Пока официально не анонсирована, но её уже заметили в /memory
• Что это такое
Auto-dream - это фоновый подагент Claude, который:
- анализирует последние сессии
- извлекает ключевые знания
-…
Вообще это классно, когда свои модели появляются, но бенчмарки несколько расстраивают.. Впрочем, лиха беда начало.
Есть и еще одна ложка дегтя - неделю назад пробовал подписаться на Сбер, но есть оплата только за апи, и цены выше чем на Соннет. Ну вот к этому я точно не готов. Дайте нормальную подписку - я возьму
https://t.me/ai_machinelearning_big_data/9732
Есть и еще одна ложка дегтя - неделю назад пробовал подписаться на Сбер, но есть оплата только за апи, и цены выше чем на Соннет. Ну вот к этому я точно не готов. Дайте нормальную подписку - я возьму
https://t.me/ai_machinelearning_big_data/9732
Telegram
Machinelearning
⚡️ Сбер выпустил крупнейшее обновление ГигаЧат — и выложил в open source.
GigaChat Ultra и GigaChat-3.1-Lightning уже под MIT-лицензией. Текущее обновление дало заметный прирост по качеству ответов, устойчивости генерации и прикладным сценариям использования.…
GigaChat Ultra и GigaChat-3.1-Lightning уже под MIT-лицензией. Текущее обновление дало заметный прирост по качеству ответов, устойчивости генерации и прикладным сценариям использования.…
GigaChat в долларах
GigaChat 2 Lite
• 20 млн токенов = 1 300 ₽ ≈ $14.4
• 100 млн токенов = 6 500 ₽ ≈ $72.2
• Цена за 1 млн токенов ≈ $0.72
GigaChat 2 Pro
• 3 млн токенов = 1 500 ₽ ≈ $16.7
• 15 млн токенов = 7 500 ₽ ≈ $83.3
• Цена за 1 млн токенов ≈ $5.56
GigaChat 2 Max
• 3 млн токенов = 1 950 ₽ ≈ $21.7
• 15 млн токенов = 9 750 ₽ ≈ $108.3
• Цена за 1 млн токенов ≈ $7.22
За 20 баксов 3 млн токенов гигачата или подписка на Claude, GPT или Gemini - печаль..
Ну нет в стране инференса
GigaChat 2 Lite
• 20 млн токенов = 1 300 ₽ ≈ $14.4
• 100 млн токенов = 6 500 ₽ ≈ $72.2
• Цена за 1 млн токенов ≈ $0.72
GigaChat 2 Pro
• 3 млн токенов = 1 500 ₽ ≈ $16.7
• 15 млн токенов = 7 500 ₽ ≈ $83.3
• Цена за 1 млн токенов ≈ $5.56
GigaChat 2 Max
• 3 млн токенов = 1 950 ₽ ≈ $21.7
• 15 млн токенов = 9 750 ₽ ≈ $108.3
• Цена за 1 млн токенов ≈ $7.22
За 20 баксов 3 млн токенов гигачата или подписка на Claude, GPT или Gemini - печаль..
Ну нет в стране инференса
Наконец, лучшую модель по генерации видео выпустили в публику - компания почти месяц решала проблемы с Голивудом, так как слишком хорошо делала видео с реальными актерами
https://t.me/ai_newz/4493
https://t.me/ai_newz/4493
Telegram
эйай ньюз
🔥🔥🔥 Seedance 2.0 в глобальном доступе
После затяжного переноса ByteDance наконец выкатили SOTA видео-модельку за пределами Китая. Пощупать генерацию можно в CapCut, на Dreamina, а также в агрегаторах. Официально пока раскатили по ограниченному списку стран…
После затяжного переноса ByteDance наконец выкатили SOTA видео-модельку за пределами Китая. Пощупать генерацию можно в CapCut, на Dreamina, а также в агрегаторах. Официально пока раскатили по ограниченному списку стран…
Forwarded from Denis Sexy IT 🤖
https://github.com/DenisSergeevitch/repo-task-proof-loop
(Спека - инструкции как кодинг агенту лучше работать с задачей)
В issue можно отправить агента описать если что-то не работает
***
– Собирал я ее на основе пейпера не про кодинг агента, а про то как агент становится «персональным» – в пейпере как раз про то, как убедится что агент правда делает то, что обещал, мне показалось это интересным подходом чтобы обернуть в кодинг агента
– Работает примерно так: само генерирует критерии приемки исходя из задачи, заставляет кодить саб-агента, проверяет работу, сбрасывает контекстное окно где надо (а где нет - не сбрасывает), фиксит баги, и так по кругу, подробнее в репе
– Устанавливать ее нужно как Skill, и я бы советовал Codex, так как у него саб-агенты лучше сделаны чем у Claude Code
– Использовать так: вы ей даете какую-то гигантскую задачу в стиле: «
Spawn subagents. Use $repo-task-proof-loop to continue the task described below in this repository. Reuse the matching repo-local task if it already exists; if not, stop after explaining that init should be run first....» <- вот тут вы упоминаете задачу или просто вставляете свои А4 текста
– Тестить ее лучше на новых проектах, ну или в проектах где уже есть git, так как она создаст много промежуточных файлов в папке .agents
– план мод можно с ней не использовать
В моих тестах, если агент не забывает вызывать этот скилл, у меня получается делать очень сложные проекты, но тратя больше квоты; ночью Codex работал над задачей почти 5 часов (рекорд у меня пока 12 часов)
Короче, я пока доволен – буду развивать если окажется полезной
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - DenisSergeevitch/repo-task-proof-loop: Spec driven skill with subagents spawning
Spec driven skill with subagents spawning. Contribute to DenisSergeevitch/repo-task-proof-loop development by creating an account on GitHub.
Судя по всему, умные модельки станут заметно менее требовательными к ресурсам. Помечтаем
https://t.me/ai_machinelearning_big_data/9736
https://t.me/ai_machinelearning_big_data/9736
Telegram
Machinelearning
📌 Google разработала алгоритм квантования KV-кэша без потери точности.
Подразделение Research анонсировало TurboQuant, алгоритм векторного квантования, объединяющий 2 других метода - QJL и PolarQuant, который решает проблему увеличения KV-кэша при работе…
Подразделение Research анонсировало TurboQuant, алгоритм векторного квантования, объединяющий 2 других метода - QJL и PolarQuant, который решает проблему увеличения KV-кэша при работе…
Anthropic написал статью, как они строили harness для долгих автономных задач, прежде всего для:
• генерации качественных интерфейсов,
• многочасовой разработки полноценных приложений без постоянного участия человека.
Главная идея: проблема не только в модели, а в архитектуре процесса вокруг модели.
───
Ключевые выводы статьи
1) Для длинных задач одного агента мало
На длинных прогонах агент:
• теряет нить,
• начинает “закругляться” раньше времени,
• переоценивает качество собственной работы.
Поэтому они ушли от наивного solo-agent режима к многоагентной схеме.
───
2) Они используют роли: planner / generator / evaluator
Planner
• берет короткий пользовательский запрос,
• разворачивает его в полноценный product spec.
Generator
• делает работу по спринтам/частям,
• реализует фичи одну за другой.
Evaluator
• независимо проверяет результат,
• ищет баги и оценивает качество,
• дает обратную связь генератору.
Это важно: агент не должен сам себя честно оценивать — он слишком снисходителен к собственной работе.
───
3) Для долгих задач важна работа с контекстом
Они отдельно подчеркивают проблему context anxiety:
• модель, чувствуя длинный контекст, начинает prematurely wrap up,
• или просто деградирует по качеству.
Раньше они боролись с этим через context resets:
• новый агент,
• чистый контекст,
• структурированный handoff-файл между сессиями.
Позже с Opus 4.5 смогли больше полагаться на compaction, но сама идея осталась:
нельзя просто бесконечно тянуть один и тот же контекст.
───
4) Коммуникация между агентами — через файлы/артефакты
Вместо хаотичного общего чата они передают состояние через структурированные файлы:
• контракт спринта,
• замечания,
• QA-отчеты,
• handoff-артефакты.
Это делает систему устойчивее и понятнее.
───
5) Для субъективных задач они формализуют критерии
На примере frontend-дизайна они показывают, что даже субъективные вещи можно оценивать по критериям:
• design quality
• originality
• craft
• functionality
После этого evaluator может не просто говорить “нравится / не нравится”, а давать направленную обратную связь.
───
6) Для full-stack разработки они используют “спринт-контракты”
Перед началом спринта generator и evaluator договариваются, что именно считается done.
Это очень сильная идея:
• спецификация сверху остается high-level,
• но на каждый спринт есть конкретный контракт,
• evaluator потом проверяет именно его.
───
Что у них получилось
По их словам:
• solo-agent сделал заметно хуже,
• полный harness работал намного дольше и дороже,
• но качество итогового продукта было существенно выше.
Пример из статьи:
• solo run: ~20 минут, ~$9
• full harness: ~6 часов, ~$200
То есть главный trade-off:
качество и автономность растут, но резко растут цена, время и сложность orchestration.
───
Статья не про “волшебную модель”, а про инженерную правду:
1. долгие задачи = это проблема процесса, а не только LLM
2. независимая оценка критична
3. артефакты и контракты важнее длинного чата
4. контекст надо управлять, а не просто копить
• генерации качественных интерфейсов,
• многочасовой разработки полноценных приложений без постоянного участия человека.
Главная идея: проблема не только в модели, а в архитектуре процесса вокруг модели.
───
Ключевые выводы статьи
1) Для длинных задач одного агента мало
На длинных прогонах агент:
• теряет нить,
• начинает “закругляться” раньше времени,
• переоценивает качество собственной работы.
Поэтому они ушли от наивного solo-agent режима к многоагентной схеме.
───
2) Они используют роли: planner / generator / evaluator
Planner
• берет короткий пользовательский запрос,
• разворачивает его в полноценный product spec.
Generator
• делает работу по спринтам/частям,
• реализует фичи одну за другой.
Evaluator
• независимо проверяет результат,
• ищет баги и оценивает качество,
• дает обратную связь генератору.
Это важно: агент не должен сам себя честно оценивать — он слишком снисходителен к собственной работе.
───
3) Для долгих задач важна работа с контекстом
Они отдельно подчеркивают проблему context anxiety:
• модель, чувствуя длинный контекст, начинает prematurely wrap up,
• или просто деградирует по качеству.
Раньше они боролись с этим через context resets:
• новый агент,
• чистый контекст,
• структурированный handoff-файл между сессиями.
Позже с Opus 4.5 смогли больше полагаться на compaction, но сама идея осталась:
нельзя просто бесконечно тянуть один и тот же контекст.
───
4) Коммуникация между агентами — через файлы/артефакты
Вместо хаотичного общего чата они передают состояние через структурированные файлы:
• контракт спринта,
• замечания,
• QA-отчеты,
• handoff-артефакты.
Это делает систему устойчивее и понятнее.
───
5) Для субъективных задач они формализуют критерии
На примере frontend-дизайна они показывают, что даже субъективные вещи можно оценивать по критериям:
• design quality
• originality
• craft
• functionality
После этого evaluator может не просто говорить “нравится / не нравится”, а давать направленную обратную связь.
───
6) Для full-stack разработки они используют “спринт-контракты”
Перед началом спринта generator и evaluator договариваются, что именно считается done.
Это очень сильная идея:
• спецификация сверху остается high-level,
• но на каждый спринт есть конкретный контракт,
• evaluator потом проверяет именно его.
───
Что у них получилось
По их словам:
• solo-agent сделал заметно хуже,
• полный harness работал намного дольше и дороже,
• но качество итогового продукта было существенно выше.
Пример из статьи:
• solo run: ~20 минут, ~$9
• full harness: ~6 часов, ~$200
То есть главный trade-off:
качество и автономность растут, но резко растут цена, время и сложность orchestration.
───
Статья не про “волшебную модель”, а про инженерную правду:
1. долгие задачи = это проблема процесса, а не только LLM
2. независимая оценка критична
3. артефакты и контракты важнее длинного чата
4. контекст надо управлять, а не просто копить
Anthropic
Harness design for long-running application development
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
Кстати, к вопросу. Такие обзоры как тот, что выше, пишет мне мой OpenClaw, когда я ему закидываю статью с командой «прочитать, пересказать». Удобно
👍1
Антропик начинает потихоньку разворачивать auto mode в Claude code
X (formerly Twitter)
Claude (@claudeai) on X
New in Claude Code: auto mode.
Instead of approving every file write and bash command, or skipping permissions entirely, auto mode lets Claude make permission decisions on your behalf.
Safeguard…
Instead of approving every file write and bash command, or skipping permissions entirely, auto mode lets Claude make permission decisions on your behalf.
Safeguard…
В продолжение прошлого поста - сейчас есть команда -dangerously skip permissions, которая всегда будет говорить «да» на вопросы пользователя, а теперь будет авто мод, который смотрит, где опасно, где нет, и будет человека дергать, но только по опасным случаям.
Сейчас по отдельным командам можно в настройках разрешения устанавливать, и это работает, но тут все будет работать автоматически, и в разных ситуациях по одной и той же команде Клод будет сам выполнять команду или спрашивать в зависимости от обстоятельств
Сейчас по отдельным командам можно в настройках разрешения устанавливать, и это работает, но тут все будет работать автоматически, и в разных ситуациях по одной и той же команде Клод будет сам выполнять команду или спрашивать в зависимости от обстоятельств
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Figma похоже начали догадываться что людям нужно больше.
Они открыли свой канвас для AI агентов.
Новый use_figma — агент создаёт и редактирует компоненты прямо на канвасе через вашу дизайн-систему. Переменные, компоненты, auto layout.
Claude Code, Codex, Cursor и другие MCP-клиенты теперь могут работать с Figma напрямую.
Появились skills которые объясняют агенту как работать в Figma.
Из основных:
Для команд где дизайнеры живут в Figma, то что нужно.
Сейчас бесплатно (бета), потом будет платным.
Гайд | Skills| GitHub
@tips_ai #news
Они открыли свой канвас для AI агентов.
Новый use_figma — агент создаёт и редактирует компоненты прямо на канвасе через вашу дизайн-систему. Переменные, компоненты, auto layout.
Claude Code, Codex, Cursor и другие MCP-клиенты теперь могут работать с Figma напрямую.
Появились skills которые объясняют агенту как работать в Figma.
Из основных:
• figma-implement-design: читает дизайн из Figma и генерирует рабочий код
• figma-generate-library: строит дизайн-систему в Figma из вашей кодовой базы
• figma-generate-design: собирает экраны из реальных компонентов и переменных
• figma-create-design-system-rules: сохраняет стандарты команды, агент их запоминает и применяет
Для команд где дизайнеры живут в Figma, то что нужно.
Сейчас бесплатно (бета), потом будет платным.
Гайд | Skills| GitHub
@tips_ai #news
Forwarded from Machinelearning
Система оптимизации производительности для AI-агентов. От победителя хакатона Anthropic.
Готовые к продакшену агенты, хуки, скилы, правила и MCP-конфигурации, которые эволюционировали за 10 месяцев ежедневной интенсивной работы над реальными продуктами.
Работает с Claude Code, Codex, Cowork и другими системами для AI-агентов.
@ai_machinelearning_big_data
🎯Полезные Мл-ресурсы
#AI #ML #aiagents #Claude
Please open Telegram to view this post
VIEW IN TELEGRAM
Очень хвалят в Х дистилированный на Qwen 3.5 27B Opus - но чтобы использовать локально надо 32гб или хотя бы 24...
huggingface.co
Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Про ускоренный переход на постквантовую криптографию зацепило (это шифры, которые не ломаются известными квантовыми алгоритмами, в отличие от большинства, используемых сейчас). Вчера еще читал новость, о том, как квантовый компьютер приделали к роботу, и он стал в 30 раз быстрее обрабатывать всю информацию о движениях (наши люди, кстати, делали)...
https://t.me/ai_machinelearning_big_data/9749
https://t.me/ai_machinelearning_big_data/9749
Telegram
Machinelearning
✔️ Apple дистиллирует Google Gemini.
В рамках партнерства с Google, Apple получила глубокий доступ к архитектуре Gemini. Инженеры используют дистилляцию знаний, чтобы перенести логику в легковесные решения для Apple Intelligence.
Модель Apple анализирует…
В рамках партнерства с Google, Apple получила глубокий доступ к архитектуре Gemini. Инженеры используют дистилляцию знаний, чтобы перенести логику в легковесные решения для Apple Intelligence.
Модель Apple анализирует…
Вожусь с графами, чтобы модель лучше ПОНИМАЛА смысл текста. И, судя по всему, проблема (помимо методических) в том, что для создания по тексту графа нельзя использовать дешевые модели, как в RAG. Надо - дорогую, и, возможно, САМУЮ дорогую. Впрочем, стоит ли удивляться - ведь задача-то сложная..
Хотите запустить Qwen 35B на мак мини? С 16гб? Тогда вам сюда. Обещают 30 токенов в секунду. Правда, на контекст мало памяти останется
GitHub
GitHub - walter-grace/mac-code: mac code — Claude Code, but it runs on your Mac for free. 35B AI agent at 30 tok/s via Apple…
mac code — Claude Code, but it runs on your Mac for free. 35B AI agent at 30 tok/s via Apple Silicon flash-paging. $0/month. - walter-grace/mac-code
Maestro
Undenis
Вышла новая Suno 5.5, посвящаю этот трек Маэстро 🐱 🐱
Please open Telegram to view this post
VIEW IN TELEGRAM