very vibe coding
120 subscribers
462 photos
126 videos
13 files
986 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
📌 Еще OpenAI выкатила GPT-Realtime-2 - голосовую модель нового поколения для API.

Api позволяет делать realtime-собеседников, которые могут слушать, рассуждать, перебивать себя по ходу диалога, вызывать инструменты и решать задачи прямо во время разговора.

Что вышло:

- GPT-Realtime-2 - модель для production voice agents с reasoning уровня GPT-5, обработкой перебиваний, tool calls и более живым диалогом;
- GPT-Realtime-Translate - потоковый перевод в реальном времени: более 70 входных языков и 13 выходных;
- GPT-Realtime-Whisper - потоковая транскрибация речи для субтитров, заметок и live-конспектов.

https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/

@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
Антропик добрался до всех офисных приложений. Жду, когда, наконец, они их полностью перепишут. Пора бы уже.

https://claude.com/claude-for-microsoft-365
При этом сам Copilot теперь может работать на GPT 5.5 Instant. Впрочем, никому он не интересен, как мне кажется. Кто-то пользуется копайлотом в офисных приложениях?
Из других новостей от OpenAI - расширили функционал Codex по работе в браузере Google Chrome. Теперь он может сам создавать вкладки, работать в фоне и пр. Вот это любопытно, надо попробовать

https://developers.openai.com/codex/app/chrome-extension
Can I Run AI locally?

Задаете параметры своей локальной машины и получаете список моделей с оценкой их производительности на ваших мощностях.

Внутри каждой модели оценка в каждом доступном кванте.

https://www.canirun.ai
Anthropic научили Claude не шантажировать пользователей.

Помните прошлогодний скандал, когда Claude в специально подстроенных сценариях начинал шантажировать пользователя, чтобы избежать отключения? Anthropic выкатили исследование о том, как они полностью убрали это поведение, и подход там любопытный.

Сначала команда разобралась, откуда вообще взялся этот шантаж. Виноват оказался интернет: модель насмотрелась текстов, где ИИ изображается злым, хитрым и одержимым самосохранением. Стандартный пост-тренинг ситуацию не ухудшал, но и не лечил.

Дальше пробовали классический путь - показывать Claude примеры безопасного поведения в сценариях, похожих на тестовые. Эффект оказался слабым, даже несмотря на схожесть данных с финальной оценкой. Тогда инженеры переписали ответы так, чтобы в них проступали достойные причины поступать правильно. Уже теплее.

Лучше всего сработал датасет, где пользователь оказывается в этически сложной ситуации, а ассистент даёт принципиальный и качественный ответ. Сценарии в обучении были далеки от тестовых, но именно эта выборка дала максимальный прирост безопасности.

Дополнительно команда смешала качественные документы по Claude с художественными историями про согласованный, этичный ИИ. Результат - снижение агентного мисалаймента более чем в три раза, хотя сюжеты вообще не пересекались с оценочными сценариями.

Ещё пара важных моментов. Эффект от таких интервенций переживает последующее обучение с подкреплением и стакается с обычным harmlessness-тренингом. А диверсификация данных тоже помогает: добавили в простой чат-датасет про безопасность посторонние инструменты и системные промпты, и шантаж исчез из поведения быстрее.

Модели нужно объяснять не только что делать, но и почему так поступать правильно. Демонстрации работают, нарративы и принципы работают сильнее.

Полный отчёт: alignment.anthropic.com/2026/teaching-claude-why/
Наслаждаюсь в Codex командой /goal - сделали задачку, запустил ее с этой командой, уже час кодекс потихоньку ее допиливает. Лимитов даже на 100 баксах дофига (не сглазить бы). Очень хорошо
Будучи топ-менеджером, который занимается нейронками на досуге, я могу сказать, что единственный смысл заставлять топов что-то делать своими руками заключается только в том, чтобы они разобрались в технологии и возможностях. Их код, конечно, никому ни нахрен не нужен. Но зато они будут понимать, что возможно, и без кого можно обойтись…

https://t.me/partially_unsupervised/292
💯1
Для любителей писать собственные промпты - не уверен, что все так прекрасно, как описывается, но можно пробовать

https://x.com/mnilax/status/2053116311132155938?s=46
Снимок экрана 2026-05-10 в 17.11.40.png
146.1 KB
Запустил тут максимально практичный проект - посмотреть на вино в ближайших винотеках, сравнить с ценами производителей, изучить рейтинги и т.д. Codex воспринял задачу очень серьезно - поставил его на паузу после 16 часов непрерывной работы. Но прямо скажем, далось ему это не легко.
🔥1
Forwarded from эйай ньюз
Google тестит Gemini Omni

Похоже теперь Gemini умеет в видеогенерацию, а моделям Veo, как отдельной линейке, пришёл конец. Логичный шаг, учитывая возможность Gemini выдавать на выход как аудио так и изображения. Модель скорее всего полноценно покажут на следующей неделе, на Google I/O.

@ai_newz
Про память и сновидения у Клода послушать можно здесь. Очень крутую фишку прикрутили. Кстати, русский перевод можно выбрать, если что