very vibe coding
120 subscribers
460 photos
126 videos
13 files
980 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Вайб-кодинг
Один полезный приём перед написанием кода.

Не просите агента сразу что-то реализовывать. Сначала проверьте, как он понял задачу.

Вставьте промпт:

Пока не изменяй код. Проверь, насколько полно ты понимаешь задачу:
Какую реальную проблему я пытаюсь решить?
Какие требования уже понятны?
Где могут быть неоднозначности?
Что ты, скорее всего, можешь неправильно понять, если сразу начнёшь писать код?
После этого предложи план выполнения.


Этот подход особенно полезен, когда требования сформулированы не до конца, контекста много или вы сами ещё не до конца продумали решение.

Сначала пусть модель перескажет задачу своими словами, покажет спорные места и разложит работу по шагам. И только потом приступает к реализации. Обычно это даёт гораздо более предсказуемый результат.

По сути, вы просто переносите ревью на более ранний этап 😶
Please open Telegram to view this post
VIEW IN TELEGRAM
Купил себе для экспериментов подписку на зайку - z.ai с их новенькой моделькой GLM-5.2. По бенчам она почти как опус - вот и попробуем, можно ли жить на опенсорсе?

Из необычного - своего харнесса у модели нет, поэтому предлагается пользоваться чужим, на выбор из 8 основных - Claude code, OpenCode и так далее. Начала работать через клода, по первому впечатлению выглядит норм. Если не знать, что за модель под капотом, можно ничего и не заметить, но это только первое впечатление
🔥1
Подключил z.ai к Claude code, говорю - давай проверим, кто ты? Отвечает - Gemini. Клод сказал, что это норм - все дистиллируют 😂🤔
Весь твиттер забит обсуждением GLM-5.2. Модель хороша. На уровне опуса и gpt 5.5.

Мои первые ощущения скорее это подтверждают, чем опровергают. Советую попробовать, подписка на 40% дешевле.

Из недостатков - плоховато держит длинный контекст и небыстрая.

Поспрашивал кло про локальный запуск - надо иметь мак студио ультра с 512, это будет квант на 4 - 4.5, и его качество норм, а дальше качество проседает уже сильно.
На неделе может появиться Sonnet 5. Давненько модель не обновляли, про Haiku и не говорю
Forwarded from Сиолошная
bidi-enablerr.zip
1.4 KB
Но возможно какие-то релизы на неделе всё равно будут — помните я давно писал про то, что OpenAI работает над новой голосовой моделью, которая может вас перебивать? (то есть одновременно слушать что вы говорите и генерировать свой аудио-ряд)

Она уже появилась в ChatGPT — чтобы её включить вам потребуется установить плагин из архива. Работает для Chrome и Chromium, то есть разные Arc Browser тоже работают.

1) заходите сюда chrome://extensions/
2) справа сверху включите режим разработчика (Developer mode)
3) слева сверху кнопка "загрузить распакованное" (load unpacked) и выбирайте папку из архива

Всё, теперь идём на chatgpt.com и жмём кнопку use voice в новом чате (самая правая, если текстовое поле пустое). Можете проверить так: попросите вас перебить, когда вы будете говорить.

Или в настройках Voice -> model, там должно быть Bidi 1 (там же можно выбрать «интеллект», но пока не понял, влияет ли это на что-то или просто заглушка).

Спасибо подписчику, который обнаружил это и завайбкодил плагин!
Forwarded from Machinelearning
🔍 Baidu выпустила Unlimited OCR - модель для распознавания длинных документов за один проход.

У модели 3B параметров, но активируются только 500M. При этом она показывает новые SOTA-результаты на OmniDocBench v1.5 и v1.6.

Главная фишка - Reference Sliding Window Attention.

Модель держит в фокусе:

• исходный документ

• недавний контекст

• следующие слова

А всё лишнее постепенно «забывает», чтобы не раздувать вычисления.

За счёт постоянного размера KV Cache и более дешёвого attention Unlimited OCR может распознавать 40+ страниц за один forward pass, не теряя контекст и не замедляясь.

GitHub: https://github.com/baidu/Unlimited-OCR

Hugging Face: https://huggingface.co/baidu/Unlimited-OCR

#ocr #baidu
Please open Telegram to view this post
VIEW IN TELEGRAM
Ну и, кстати, Мистраль выпустил OCR4 и божится, что это SOTA
Занимаюсь харнессом своими руками…

В работе с агентами мало того, чтобы они хорошо программировали. Основное время уходит на то, чтобы в проекте не появилось слишком много параллельного кода и документов.

Эта борьба мучительна, но без этого такие вещи как /goal с автоматической разработкой не сделаешь. Подробнее о том, что получается напишу позже, а сейчас ссылочка на готовый скилл - не один я этим занимаюсь

https://t.me/vibecoding_tg/3364
Ну и кстати - спасибо вам дорогие подписчики, что читаете. Вас теперь у меня 100 )) всех очень ценю, буду стараться изо все сил )
🔥1
Apple так не выпустила новых Mac Mini и Mac Studio, но подняла цены процентов на 20%, прежде всего, из-за роста цен на память..

Все плохо. Говорят, что у нового студио будет до 768гб оперативки, но мне страшно представить, сколько это будет стоить - 20К баксов? Зато можно будет иметь приватный домашний GLM-5.2 с минимальной потерей качества..
Forwarded from How2AI (дядя_д)
GPT-5.6 вышла - и сразу три модели

☀️ Sol - флагман, следующий frontier-модель. Самая мощная, самый глубокий reasoning
🤣 Terra - сбалансированная для повседневной работы. Конкурент GPT-5.5 по качеству, но в 2 раза дешевле
🌚 Luna - быстрая и дешёвая для высоконагруженных задач. Самый низкий ценник у OpenAI

Новая логика нейминга: цифра = поколение, имя = уровень способностей. Каждая линейка развивается самостоятельно.

Что нового в Sol:
- Новый режим max для максимально глубокого reasoning
- Новый режим ultra — работает через сабагентов, выходит за рамки одного агента
- SOTA на Terminal-Bench 2.1 (кодинг), сильный буст на GeneBench (биология) и ExploitBench (кибербез)
🔥🔥🔥На чипах Cerebras будет давать до 750 токенов/сек. запуск в июле

Цены (за 1M токенов):
- Sol: $5 / $30
- Terra: $2.50 / $15
- Luna: $1 / $6

OpenAI вложила 700K GPU-часов A100 в автоматический red-teaming для поиска универсальных джейлбрейков. Но релиз это не спасло.

Прямо сейчас - limited preview для доверенных партнёров. Широкий доступ «в ближайшие недели». В OpenAI сами отмечают, что не считают такой правительственный процесс правильным на долгосрочку, но выбрали его как самый быстрый путь к релизу.

Блог-пост: https://openai.com/index/previewing-gpt-5-6-sol/

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Вайб-кодинг
Нашёл бесплатный опенсорс инструмент, который за секунды превращает любые PDF, Word, Excel или отсканированные изображения в чистый Markdown:

• текст в правильном порядке
• таблицы в HTML
• формулы в LaTeX
• OCR
• 109 языков

Работает через CLI, Python или веб (mineru.net). Запускается локально на твоём компьютере. 100% приватно.
Больше 70000 звёзд на GitHub. 😋
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
NVIDIA открыла исходный код модели визуальной локализации LocateAnything-3B.

Модель умеет находить объекты даже в очень плотных сценах. Например, на изображении с десятками миньонов, стоящих вплотную друг к другу, она корректно выделяет каждого отдельной рамкой.

Главное отличие от большинства существующих моделей - это способ генерации ограничивающих рамок. Обычно координаты (x1, y1, x2, y2) предсказываются последовательно, цифра за цифрой. Это замедляет работу, а ошибки на ранних этапах могут влиять на последующие координаты, особенно если объектов много.

В LocateAnything-3B используется параллельное декодирование, тоесть модель сразу предсказывает готовые рамки целиком, а не строит их поэтапно. За счёт этого детекция становится стабильнее, особенно в сценах с большим количеством объектов.
Для обучения использовались не только классические датасеты для распознавания объектов, но и данные для распознавания интерфейсов, OCR и анализа структуры документов. Поэтому модель умеет находить как реальные объекты, так и элементы пользовательского интерфейса и текстовые области.

Модель содержит 3 млрд параметров и распространяется с открытым исходным кодом. 💜
Please open Telegram to view this post
VIEW IN TELEGRAM