Пожалуй, такой лайфхак попробую у себя в проекте.
https://t.me/tips_ai/4799
Одна из проблем, от которой сильно страдаю - это то, что нейронки пишут очень много всего лишнего. В своем харнесе сделал специальную директорию, чтобы они могли писать туда все, что угодно. Остальные пути жестко контролирую.
https://t.me/tips_ai/4799
Одна из проблем, от которой сильно страдаю - это то, что нейронки пишут очень много всего лишнего. В своем харнесе сделал специальную директорию, чтобы они могли писать туда все, что угодно. Остальные пути жестко контролирую.
Telegram
Tips AI | IT & AI
Я конечно видел много способов harness для агентов, но это пожалуй самый прикольный:
Парень придумал для агентов papercuts, чтобы они могли жаловаться на любую ерунду которую нашли во время выполнения задачи
Потом по этим записям можно понять какие узкие…
Парень придумал для агентов papercuts, чтобы они могли жаловаться на любую ерунду которую нашли во время выполнения задачи
Потом по этим записям можно понять какие узкие…
Тестирую GPT Sol - первое впечатление: токены жрет не хуже Fable. Раньше мне никогда не удавалось так быстро высаживать лимиты у GPT.
Кстати - по выбору модели. Судя по бенчмаркам и тому, что пишут в интернетах, уровень услилий у GPT-5.6 надо выбирать
Sol - Max, Terra- Ultra, Luna - Max. И дальше уже делать выбор между моделями, которые больше подходят. Основное - пищем на Терре.
В любом случае, даже у Sol, когда показываешь результаты Claude, GLM-5.2 и DeepSeek V4, ошибки находятся. И китайские модели в их поиске выглядят совсем неплохо - не сильно хуже гпт и клода.
Кстати - по выбору модели. Судя по бенчмаркам и тому, что пишут в интернетах, уровень услилий у GPT-5.6 надо выбирать
Sol - Max, Terra- Ultra, Luna - Max. И дальше уже делать выбор между моделями, которые больше подходят. Основное - пищем на Терре.
В любом случае, даже у Sol, когда показываешь результаты Claude, GLM-5.2 и DeepSeek V4, ошибки находятся. И китайские модели в их поиске выглядят совсем неплохо - не сильно хуже гпт и клода.
Fable сегодня уберут из стандартных планов, оставят только по апи, но ходят слухи, что уже на следующей неделе нас ждет Opus 5 - ответ Антропика на GPT-5.6
Какое-то время назад полностью пересел с десктопного приложения Claude на терминал и его производные - Ghostty, cmux, Orca.
Теперь иду обратно - пробую ChatGPT Work. В приложении подключил booking.com и выбрал себе гостиницу - в принципе, все это можно сделать и на самом сайте, но здесь прикручен Codex и ты можешь ему ставить задачки как нейронке - ну, например, найти гостиницу рядом с водопадом или с видом на горы.
Вот и Claude Desktop также встроил в приложение браузер.
Есть ощущение, что Cloude Desktop (после того, как включат в него Design - создание презентаций) и ChatGPT Work терминал все-таки победят. Я бы на это поставил
Теперь иду обратно - пробую ChatGPT Work. В приложении подключил booking.com и выбрал себе гостиницу - в принципе, все это можно сделать и на самом сайте, но здесь прикручен Codex и ты можешь ему ставить задачки как нейронке - ну, например, найти гостиницу рядом с водопадом или с видом на горы.
Вот и Claude Desktop также встроил в приложение браузер.
Есть ощущение, что Cloude Desktop (после того, как включат в него Design - создание презентаций) и ChatGPT Work терминал все-таки победят. Я бы на это поставил
Unsloth выпустила новые динамические квантизации для Qwen-3.6, которые работают в 2 раза быстрее обычных. Запускаются на 32 гигабайтах памяти - видимо, это лучшие локальные модели на текущий момент
https://huggingface.co/collections/unsloth/nvfp4
https://huggingface.co/collections/unsloth/nvfp4
huggingface.co
NVFP4 - a unsloth Collection
Dynamic Unsloth NVFP4 Quants. Faster and more accurate.
very vibe coding
Тестирую GPT Sol - первое впечатление: токены жрет не хуже Fable. Раньше мне никогда не удавалось так быстро высаживать лимиты у GPT. Кстати - по выбору модели. Судя по бенчмаркам и тому, что пишут в интернетах, уровень услилий у GPT-5.6 надо выбирать Sol…
Нет, я ошибался. GPT Sol жрет токены гораздо лучше Fable. За час легко высаживает пятичасовой лимит и треть недельного лимита. Видимо, впервые придется воспользоваться обновлением лимита - если не знаете, OpenAI сделала такую опцию и вас тоже наверняка перезагрузки в запасе есть. И полностью переходить на Terra.
Продлили Fable. Я напоследок заказывал ему deep research, и с третьего пинка он, наконец, его сделал. Честно говоря, я впечатлен, многое для меня стало новым, хотя не первый день занимаюсь темой. Так что новости отличные
Еще из новостей - обновил Claude Desktop - и вижу, что Claude Design туда тоже перетащили. Ну все, можно возвращаться из терминала к приложению...
https://t.me/ai_newz/4648
Еще из новостей - обновил Claude Desktop - и вижу, что Claude Design туда тоже перетащили. Ну все, можно возвращаться из терминала к приложению...
https://t.me/ai_newz/4648
Telegram
эйай ньюз
Anthropic продлили доступ к Fable 5 ещё на неделю
Кроме этого продлили увеличение лимитов на 50% на ту же неделю. Вот что конкуренция животворящая делает. Интересно, сколько ещё раз они будут проворачивать этот трюк.
@ai_newz
Кроме этого продлили увеличение лимитов на 50% на ту же неделю. Вот что конкуренция животворящая делает. Интересно, сколько ещё раз они будут проворачивать этот трюк.
@ai_newz
🔥1
Посмотрел тут на результаты работы Sol - и что-то совсем разочарован. Токены уничтожены, все откатываю обратно. Видно, придется учиться более тщательно подбирать модель и усилия, чтобы держаться в лимитах, но ведь и результат пока не особо радует.. в отличие от Fable. Придется больше времени потратить на донастройку
Не только я заметил растрату токенов. OpenAI отменяет 5-часовые лимиты и перенастраивает Sol. Будем надеяться, станет работать лучше. А пока идет настройка, стоит следить за размером контекста и все-таки не злоупотреблять с max, ultra - как минимум, на Sol
https://t.me/vibecoding_tg/3470
https://t.me/vibecoding_tg/3470
Telegram
Вайб-кодинг
Хорошие новости от OpenAI: подвезли обновления для Codex и ChatGPT Work.
> внедрили оптимизации инференса и передали полученную экономию всем подписчикам GPT-5.6 Sol. В результате доступный объем использования должен увеличиться примерно на 10%.
> обнаружили…
> внедрили оптимизации инференса и передали полученную экономию всем подписчикам GPT-5.6 Sol. В результате доступный объем использования должен увеличиться примерно на 10%.
> обнаружили…
Я подобные модели использую активно - у меня стоит программка Handy, в которой живет Sber Salut - это для русского лучше чем Whisper. Но модель уже не менял давно. Видимо, пришло время
https://t.me/lovedeathtransformers/10857
https://t.me/lovedeathtransformers/10857
Telegram
Love. Death. Transformers.
GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥
Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество…
Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество…
И моделька, которая метит в лидеры по распознаванию текстов. Компактная, на 1В параметров
https://huggingface.co/ATH-MaaS/OvisOCR2
https://huggingface.co/ATH-MaaS/OvisOCR2
huggingface.co
ATH-MaaS/OvisOCR2 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Если вам нужна мощная бесплатная модель - это Hy3. На OpenRouter сейчас это самая популярная модель. Правда, все бесплатное там когда-то заканчивается. Модель весит всего 295В, так что это в теории можно будет запускать и локально на мощных Mac Studio.
https://openrouter.ai/tencent/hy3:free
https://openrouter.ai/tencent/hy3:free
openrouter.ai
Hy3 - API Pricing & Benchmarks
Hy3 is a 295B-parameter Mixture-of-Experts model from Tencent (21B active, 192 experts with top-8 routing) built for reasoning, agentic workflows, and real-world production use. $0.07 per million input tokens, $0.29 per million output tokens. 262,144 token…
Клод отлично ищет уязвимости. Остается только один вопрос - обо всех ли уязвимостях рассказывает Claude, и не остается ли какая-то часть за кадром, в рамках программы взаимодействия с правительством США?
Уязвимости поискать хочется, только как доверять эту работу проприетарным моделям?
https://t.me/machinelearning_interview/2873
Уязвимости поискать хочется, только как доверять эту работу проприетарным моделям?
https://t.me/machinelearning_interview/2873
Telegram
Machine learning Interview
🚀 Anthropic выложили reference harness для поиска и исправления уязвимостей с Claude
Очень недооценённый репозиторий для defensive security.
Идея простая: Claude проходит полный цикл работы с уязвимостью:
* threat model
* поиск подозрительных мест
* проверка…
Очень недооценённый репозиторий для defensive security.
Идея простая: Claude проходит полный цикл работы с уязвимостью:
* threat model
* поиск подозрительных мест
* проверка…
Иметь большую модель, обученную под себя? Это интересно. Проблема в том, что цена обучения с ростом модели растет. нелинейно, и обучать большие модели дорого. Но может это уже как-то порешали?
Команда этим занимается серьезная - бывшие боссы OpenAI
https://t.me/ai_machinelearning_big_data/10528
Команда этим занимается серьезная - бывшие боссы OpenAI
https://t.me/ai_machinelearning_big_data/10528
Telegram
Machinelearning
Thinking Machines Lab выкатила Inkling - свою первую open-weights модель.
И это сразу тяжёлый релиз:
* 975B total params
* 41B active
* 1M context
* обучение на 45T токенов
* текст, изображения, аудио и видео
* рядом идёт preview Inkling-Small с 12B active…
И это сразу тяжёлый релиз:
* 975B total params
* 41B active
* 1M context
* обучение на 45T токенов
* текст, изображения, аудио и видео
* рядом идёт preview Inkling-Small с 12B active…
За последнюю неделю у меня человек пять спросило, в чем я делаю презентации. В Claude Design.
Уже писал, что эта программа пару месяцев назад сделала большой скачок вперед. Для успешной работы надо потратить пару часов для подготовки типового макета. На тарифе в 20 долларов рисовать можно, но токены тратятся быстро, может не хватать 5-часового лимита. В Sonnet я не очень верю, сам использую для рисования Opus, и вам того же советую.
Сама программа тоже меняется, я бы сказал, немного упрощается. Процесс подготовки презентации выглядит, конечно иначе - вместо рисования, постоянно словами говоришь, что править. Но к этому привыкаешь, рисовать больше не хочется.
Можно, кстати, писать презентации и прямо в Claude Code. Я загрузил туда шаблон, и презентация программируется Клодом на питоне. Это тоже работает, и неплохо. По ощущениям, даже как-то более экономно по токенам. Советую попробовать.
Похожие функции есть и в последнем ChatGPT Work, но честно скажу, не пробовал. Исправлюсь, как будет больше времени.
Уже писал, что эта программа пару месяцев назад сделала большой скачок вперед. Для успешной работы надо потратить пару часов для подготовки типового макета. На тарифе в 20 долларов рисовать можно, но токены тратятся быстро, может не хватать 5-часового лимита. В Sonnet я не очень верю, сам использую для рисования Opus, и вам того же советую.
Сама программа тоже меняется, я бы сказал, немного упрощается. Процесс подготовки презентации выглядит, конечно иначе - вместо рисования, постоянно словами говоришь, что править. Но к этому привыкаешь, рисовать больше не хочется.
Можно, кстати, писать презентации и прямо в Claude Code. Я загрузил туда шаблон, и презентация программируется Клодом на питоне. Это тоже работает, и неплохо. По ощущениям, даже как-то более экономно по токенам. Советую попробовать.
Похожие функции есть и в последнем ChatGPT Work, но честно скажу, не пробовал. Исправлюсь, как будет больше времени.
О, у Apple, судя по всему, через неделю будет событие, посвященное AI. Учитывая, что с продажи на официальном сайте сняли последние Mac Studio, надеюсь, это будет запуск новой линейки Mac mini и Mac Studio с М5. Сейчас это лучшее железо для локального ИИ.
Кстати, планируется, что максимальный студио будет с 770 Гб памяти - это позволит раскатывать на одной машине реально большие модели типа квантованной GLM-5.2.
Кстати, планируется, что максимальный студио будет с 770 Гб памяти - это позволит раскатывать на одной машине реально большие модели типа квантованной GLM-5.2.
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
Эта бесплатная тулза позволяет Claude автоматически собирать данные из Google Maps.
Укажите Claude город и тип бизнеса — он запустит локальный скрапер и вернёт чистый список компаний с названиями, телефонами, email-адресами, сайтами, рейтингами и отзывами.
Есть встроенная защита от превышения лимитов запросов и поддержка прокси для более крупных задач
Открытый исходный код.👀
Укажите Claude город и тип бизнеса — он запустит локальный скрапер и вернёт чистый список компаний с названиями, телефонами, email-адресами, сайтами, рейтингами и отзывами.
Есть встроенная защита от превышения лимитов запросов и поддержка прокси для более крупных задач
Открытый исходный код.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Kimi K3 здесь
2.8T параметров, 1М контекста. Официальных бенчмарков пока нет, но вроде как модель бьет Fable и Sol на BrowseCamp и выходит на 3 место на GDPval.
https://www.kimi.com/
2.8T параметров, 1М контекста. Официальных бенчмарков пока нет, но вроде как модель бьет Fable и Sol на BrowseCamp и выходит на 3 место на GDPval.
https://www.kimi.com/