very vibe coding
120 subscribers
460 photos
126 videos
13 files
980 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
На неделе может появиться Sonnet 5. Давненько модель не обновляли, про Haiku и не говорю
Forwarded from Сиолошная
bidi-enablerr.zip
1.4 KB
Но возможно какие-то релизы на неделе всё равно будут — помните я давно писал про то, что OpenAI работает над новой голосовой моделью, которая может вас перебивать? (то есть одновременно слушать что вы говорите и генерировать свой аудио-ряд)

Она уже появилась в ChatGPT — чтобы её включить вам потребуется установить плагин из архива. Работает для Chrome и Chromium, то есть разные Arc Browser тоже работают.

1) заходите сюда chrome://extensions/
2) справа сверху включите режим разработчика (Developer mode)
3) слева сверху кнопка "загрузить распакованное" (load unpacked) и выбирайте папку из архива

Всё, теперь идём на chatgpt.com и жмём кнопку use voice в новом чате (самая правая, если текстовое поле пустое). Можете проверить так: попросите вас перебить, когда вы будете говорить.

Или в настройках Voice -> model, там должно быть Bidi 1 (там же можно выбрать «интеллект», но пока не понял, влияет ли это на что-то или просто заглушка).

Спасибо подписчику, который обнаружил это и завайбкодил плагин!
Forwarded from Machinelearning
🔍 Baidu выпустила Unlimited OCR - модель для распознавания длинных документов за один проход.

У модели 3B параметров, но активируются только 500M. При этом она показывает новые SOTA-результаты на OmniDocBench v1.5 и v1.6.

Главная фишка - Reference Sliding Window Attention.

Модель держит в фокусе:

• исходный документ

• недавний контекст

• следующие слова

А всё лишнее постепенно «забывает», чтобы не раздувать вычисления.

За счёт постоянного размера KV Cache и более дешёвого attention Unlimited OCR может распознавать 40+ страниц за один forward pass, не теряя контекст и не замедляясь.

GitHub: https://github.com/baidu/Unlimited-OCR

Hugging Face: https://huggingface.co/baidu/Unlimited-OCR

#ocr #baidu
Please open Telegram to view this post
VIEW IN TELEGRAM
Ну и, кстати, Мистраль выпустил OCR4 и божится, что это SOTA
Занимаюсь харнессом своими руками…

В работе с агентами мало того, чтобы они хорошо программировали. Основное время уходит на то, чтобы в проекте не появилось слишком много параллельного кода и документов.

Эта борьба мучительна, но без этого такие вещи как /goal с автоматической разработкой не сделаешь. Подробнее о том, что получается напишу позже, а сейчас ссылочка на готовый скилл - не один я этим занимаюсь

https://t.me/vibecoding_tg/3364
Ну и кстати - спасибо вам дорогие подписчики, что читаете. Вас теперь у меня 100 )) всех очень ценю, буду стараться изо все сил )
🔥1
Apple так не выпустила новых Mac Mini и Mac Studio, но подняла цены процентов на 20%, прежде всего, из-за роста цен на память..

Все плохо. Говорят, что у нового студио будет до 768гб оперативки, но мне страшно представить, сколько это будет стоить - 20К баксов? Зато можно будет иметь приватный домашний GLM-5.2 с минимальной потерей качества..
Forwarded from How2AI (дядя_д)
GPT-5.6 вышла - и сразу три модели

☀️ Sol - флагман, следующий frontier-модель. Самая мощная, самый глубокий reasoning
🤣 Terra - сбалансированная для повседневной работы. Конкурент GPT-5.5 по качеству, но в 2 раза дешевле
🌚 Luna - быстрая и дешёвая для высоконагруженных задач. Самый низкий ценник у OpenAI

Новая логика нейминга: цифра = поколение, имя = уровень способностей. Каждая линейка развивается самостоятельно.

Что нового в Sol:
- Новый режим max для максимально глубокого reasoning
- Новый режим ultra — работает через сабагентов, выходит за рамки одного агента
- SOTA на Terminal-Bench 2.1 (кодинг), сильный буст на GeneBench (биология) и ExploitBench (кибербез)
🔥🔥🔥На чипах Cerebras будет давать до 750 токенов/сек. запуск в июле

Цены (за 1M токенов):
- Sol: $5 / $30
- Terra: $2.50 / $15
- Luna: $1 / $6

OpenAI вложила 700K GPU-часов A100 в автоматический red-teaming для поиска универсальных джейлбрейков. Но релиз это не спасло.

Прямо сейчас - limited preview для доверенных партнёров. Широкий доступ «в ближайшие недели». В OpenAI сами отмечают, что не считают такой правительственный процесс правильным на долгосрочку, но выбрали его как самый быстрый путь к релизу.

Блог-пост: https://openai.com/index/previewing-gpt-5-6-sol/

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Вайб-кодинг
Нашёл бесплатный опенсорс инструмент, который за секунды превращает любые PDF, Word, Excel или отсканированные изображения в чистый Markdown:

• текст в правильном порядке
• таблицы в HTML
• формулы в LaTeX
• OCR
• 109 языков

Работает через CLI, Python или веб (mineru.net). Запускается локально на твоём компьютере. 100% приватно.
Больше 70000 звёзд на GitHub. 😋
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
NVIDIA открыла исходный код модели визуальной локализации LocateAnything-3B.

Модель умеет находить объекты даже в очень плотных сценах. Например, на изображении с десятками миньонов, стоящих вплотную друг к другу, она корректно выделяет каждого отдельной рамкой.

Главное отличие от большинства существующих моделей - это способ генерации ограничивающих рамок. Обычно координаты (x1, y1, x2, y2) предсказываются последовательно, цифра за цифрой. Это замедляет работу, а ошибки на ранних этапах могут влиять на последующие координаты, особенно если объектов много.

В LocateAnything-3B используется параллельное декодирование, тоесть модель сразу предсказывает готовые рамки целиком, а не строит их поэтапно. За счёт этого детекция становится стабильнее, особенно в сценах с большим количеством объектов.
Для обучения использовались не только классические датасеты для распознавания объектов, но и данные для распознавания интерфейсов, OCR и анализа структуры документов. Поэтому модель умеет находить как реальные объекты, так и элементы пользовательского интерфейса и текстовые области.

Модель содержит 3 млрд параметров и распространяется с открытым исходным кодом. 💜
Please open Telegram to view this post
VIEW IN TELEGRAM
Ну, кстати. Если кто-то раздумывает над платной подпиской, но не хочет тратить много - берите Антропик за 20 баксов (даже дешевле, если за год платить), ставьте Sonnet - и наслаждайтесь. Это отличное вхождение в мир LLM. Окупите потраченные деньги на паре больших презентаций, сделанных с Claude Design.
Forwarded from эйай ньюз
Anthropic опубликовали блогпост с деталями перевыпуска Fable 5

Официально подтвердили что причиной блокировки стал репорт амазона, где Fable 5 нашла уязвимость и написала код который её может использовать. Те же самые уязвимости могли найти и использовать Opus 4.8, GPT 5.5 и Kimi K2.7. Тем не менее Anthropic натренировали более жёсткий классификатор, который будет перекидывать запросы на Opus 4.8.

Доступ должны включить всем у кого он был в течение ~суток. До 7 июля до половины лимитов подписок Pro, Team, Max и Premium Enterprise могут быть использованы на Fable 5, дальше по кредитам.

@ai_newz
Fable вернулся... А я пока тестирую Sonnet на изготовлении презентаций...
Ну, в общем, да. Похоже, что Sonnet действительно очень прожорлив на токены. По крайней мере, при подготовке презентации с Опус они уходят не сильно быстрее Соннета.

Чувствую себя так, как будто купил в магазине бутылку кефира, которая по цене хороша, а по размерам оказалась раза в полтора меньше прежней модели...

Fable, конечно, круто, но по АПИ его будут использовать только крейзи сотрудники айти компаний. Единственное, что нас спасет пока - это GPT-5.6. Может, глядя на него и Fable будет доступнее, но для этого надо сначала модель выпустить в паблик..
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic выпустили официальную библиотеку промптов для Claude.

И она полностью бесплатна. Там есть:
- Планирование, отладка, ревью кода, безопасность, автоматизация

Каждый промпт сопровождается пояснениями, как и почему он работает. Библиотека создана самой Anthropic.

🎉🎉🎉
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2