Forwarded from Machine learning Interview
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2🔥1
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Pomelli — уже второй хороший GenAI продукт от Google?
Google славятся своими моделями, но вот с продуктовой точки зрения инструменты у них часто неудобные. На этом поприще по интернету разбежались сотни сайтов, приложений и даже Telegram-ботов, которые пытаются закрыть эту продуктовую дыру, используя API.
Обычно я обхожу такие темки стороной, так как фундаментально ничего нового в них нет, как минимум с точки зрения AI. К тому же они, как правило, берут свою долю и накидывают ещё копеечку на и без того дорогие подписки. Но последний опрос показал, что есть большая потребность в обзорах на такие инструменты, ну а я непротив чекнуть конкурентов. Так что вот новая тестовая рубрика (пока без тега).
Сегодня на обзоре, можно сказать, второй (после NotebookLM) хороший AI-продукт от Google — Pomelli. Кидаешь ссылку на сайт, тулза парсит с него текст и картинки, а на выходе получаешь готовые product шоты с рекламным текстом и дизайном для рекламных креативов. Работает, очевидно, на Nano Banana. Есть шаблоны, и можно запромптить свой.
Главная фича — возможность вручную редактировать шрифт, текст и цветовую палитру. В общем, хоть какой-то контроль у дизайнеров. В целом, выглядит как убийца Canva. Не знаю, чего здесь ещё может не хватать для создания быстрых флаеров, а для чего-то большего Canva всё равно не годится. Профи всё-таки работают в Figma, но и там уже есть свои AI-примочки.
Дизайнеры, одобряем?
@ai_newz
Google славятся своими моделями, но вот с продуктовой точки зрения инструменты у них часто неудобные. На этом поприще по интернету разбежались сотни сайтов, приложений и даже Telegram-ботов, которые пытаются закрыть эту продуктовую дыру, используя API.
Обычно я обхожу такие темки стороной, так как фундаментально ничего нового в них нет, как минимум с точки зрения AI. К тому же они, как правило, берут свою долю и накидывают ещё копеечку на и без того дорогие подписки. Но последний опрос показал, что есть большая потребность в обзорах на такие инструменты, ну а я непротив чекнуть конкурентов. Так что вот новая тестовая рубрика (пока без тега).
Сегодня на обзоре, можно сказать, второй (после NotebookLM) хороший AI-продукт от Google — Pomelli. Кидаешь ссылку на сайт, тулза парсит с него текст и картинки, а на выходе получаешь готовые product шоты с рекламным текстом и дизайном для рекламных креативов. Работает, очевидно, на Nano Banana. Есть шаблоны, и можно запромптить свой.
Главная фича — возможность вручную редактировать шрифт, текст и цветовую палитру. В общем, хоть какой-то контроль у дизайнеров. В целом, выглядит как убийца Canva. Не знаю, чего здесь ещё может не хватать для создания быстрых флаеров, а для чего-то большего Canva всё равно не годится. Профи всё-таки работают в Figma, но и там уже есть свои AI-примочки.
Дизайнеры, одобряем?
@ai_newz
Llama.cpp- это одна из лучших библиотек для запуска своих моделей, выпустила интерфейс для общения с запущенными моделями. Все как у chatGPT
GitHub
guide : using `llama-ui` — the new WebUI of llama.cpp · ggml-org llama.cpp · Discussion #16938
Overview This guide highlights the key features of the new SvelteKit-based WebUI of llama.cpp. The new WebUI in combination with the advanced backend capabilities of the llama-server delivers the u...
Некоторое время назад у DeepSeek вышла маленькая, на 3В, но революционная модель для распознавания документов DeepSeek OCR. Суть в том, что она воспринимает и хранит информацию не в тексте, а в картинках, и это позволяет ей быть более экономичной и продуктивной. Если используете ее, посмотрите на файнтьюнинг от Unslosh, который позволяет поднять качество еще выше
docs.unsloth.ai
DeepSeek-OCR: How to Run & Fine-tune | Unsloth Documentation
Guide on how to run and fine-tune DeepSeek-OCR locally.
Forwarded from Refat Talks: Tech & AI
Великий
Делаем агента для европейской маркетинговой компании. Они год мучались с RAG - индексировали, чанкали, перебирали эмбединги, то лагает, то галлюцинирует, то не находит нужное.
Предложил радикально другой подход: выкинуть RAG, вместо этого - Claude Agent SDK + обычная файловая система и MCP как интерфейс. Сделал им прототип - результат настолько лучше, что сначала не поверили. Сравнить можно +/- с тем, насколько Claude Code лучше чем обычный AI чат в кодинге. Поиск по гигабайтам PDF, DOCX, PPTX - доли секунды. Залетает новый файл - агент сразу готов его учитывать. Никакого чанкинга, никакой индексации. По сути - это то же самое что Claude Code или Codex CLI делают с кодовой базой, только тут вместо code base у нас knowledge base.
Но есть нюанс, и даже несколько. Вообще, планирую серию постов на эту тему, начну с проблемы синхронизации файлов и ее решения.
Итак, проблема. Основной источник знаний в их случае - Google Drive. Там все: презентации клиентам, стратегии, исследования. Но делать квери туда - слишком долго и мы ограничены только встроенным поиском драйва - не пойдет. Нам нужно чтобы Claude Code (Agent SDK) шустро шуршал по файлам.
Решение - rclone
Rclone - это как rsync для облачных хранилищ. Поддерживает Google Drive, OneDrive, Dropbox и десятки других. Крутая штука: умеет автоматически экспортировать форматы. Google Docs превращается в .docx, Sheets в .xlsx, презентации в .pptx и тд.
Файлы летят на сервер, конвертируются, агент работает с ними как с обычными файлами.
Почему file-first лучше
Storage дешевый и быстрый. Иногда (особенно для использования внутри компании) куда проще загрузить все на диск и работать с файлами напрямую, чем городить удаленный инджестинг с векторными базами и пайплайн индексации.
Современные CLI агенты прекрасно справляются с файловым поиском. "Найди все упоминания проекта X за последние 3 месяца" - делает за секунды через обычные файловые операции. Когда нужно читает файлы по частям или целиком. А еще на лету пишет скрипты для работы с ними если надо (!), собственно эту концепцию сейчас и продвигают Антропик со своими Skills.
В общем, если строите агента для работы с документами:
- Посмотрите на file-first подход. Может быть быстрее и надежнее RAG.
- Используйте rclone для синхронизации облачных хранилищ.
- Дайте агенту доступ к файловой системе и нормальным тулам поиска - часто лучше наивного RAG.
---
Этот проект оказался интереснее чем я ожидал. Куча нюансов, неочевидных решений и инсайтов, которыми буду делиться дальше. Продолжение следует.
rclone (или иногда агенту нужны просто файлы)Делаем агента для европейской маркетинговой компании. Они год мучались с RAG - индексировали, чанкали, перебирали эмбединги, то лагает, то галлюцинирует, то не находит нужное.
Предложил радикально другой подход: выкинуть RAG, вместо этого - Claude Agent SDK + обычная файловая система и MCP как интерфейс. Сделал им прототип - результат настолько лучше, что сначала не поверили. Сравнить можно +/- с тем, насколько Claude Code лучше чем обычный AI чат в кодинге. Поиск по гигабайтам PDF, DOCX, PPTX - доли секунды. Залетает новый файл - агент сразу готов его учитывать. Никакого чанкинга, никакой индексации. По сути - это то же самое что Claude Code или Codex CLI делают с кодовой базой, только тут вместо code base у нас knowledge base.
Но есть нюанс, и даже несколько. Вообще, планирую серию постов на эту тему, начну с проблемы синхронизации файлов и ее решения.
Итак, проблема. Основной источник знаний в их случае - Google Drive. Там все: презентации клиентам, стратегии, исследования. Но делать квери туда - слишком долго и мы ограничены только встроенным поиском драйва - не пойдет. Нам нужно чтобы Claude Code (Agent SDK) шустро шуршал по файлам.
Решение - rclone
Rclone - это как rsync для облачных хранилищ. Поддерживает Google Drive, OneDrive, Dropbox и десятки других. Крутая штука: умеет автоматически экспортировать форматы. Google Docs превращается в .docx, Sheets в .xlsx, презентации в .pptx и тд.
rclone sync "gdrive:/" "/local/path" --drive-export-formats docx,xlsx,pptx
Файлы летят на сервер, конвертируются, агент работает с ними как с обычными файлами.
Почему file-first лучше
Storage дешевый и быстрый. Иногда (особенно для использования внутри компании) куда проще загрузить все на диск и работать с файлами напрямую, чем городить удаленный инджестинг с векторными базами и пайплайн индексации.
Современные CLI агенты прекрасно справляются с файловым поиском. "Найди все упоминания проекта X за последние 3 месяца" - делает за секунды через обычные файловые операции. Когда нужно читает файлы по частям или целиком. А еще на лету пишет скрипты для работы с ними если надо (!), собственно эту концепцию сейчас и продвигают Антропик со своими Skills.
В общем, если строите агента для работы с документами:
- Посмотрите на file-first подход. Может быть быстрее и надежнее RAG.
- Используйте rclone для синхронизации облачных хранилищ.
- Дайте агенту доступ к файловой системе и нормальным тулам поиска - часто лучше наивного RAG.
---
Этот проект оказался интереснее чем я ожидал. Куча нюансов, неочевидных решений и инсайтов, которыми буду делиться дальше. Продолжение следует.
❤1
Google продолжает развивать AI Studio и выкатили функционал по подготовке презентаций (доступен для платных подписчиков).
Честно говоря, презентации - это сфера, где у меня с ИИ получалось хуже всего. Интересно..
Честно говоря, презентации - это сфера, где у меня с ИИ получалось хуже всего. Интересно..
Gemini
Gemini Canvas: schrijven, programmeren en maken in één ruimte met AI
Breng je ideeën tot leven als apps, games, infographics en meer. Ga binnen enkele minuten van prompt naar prototype met de hulp van Gemini 3, ons krachtigste model.
Forwarded from Тимур Хахалев про AI Coding
MCP нам был нужен, теперь пришло время идти дальше
Спустя чуть менее года с момента релиза протокола MCP, Anthropic написали статью о том, что MCP был ошибкой 😄
В этой статье они небезосновательно упоминают о частых проблемах с MCP:
▪️Tools тратят очень много токенов контекстного окна, я об этом кстати уже рассказывал тут
▪️Промежуточные результаты tools тратят дополнительные токены.
В статье приводится пример запроса пользователя: "Скачай meeting transcripts с Google Drive и добавь их к Salesforce lead".
Для исполнения такого запроса нужно, чтобы модель использовала один tool для выкачивания транскриптов, а потом создала из этого лиды.
Транскрипт 2 часового митинга может занимать около 50к токенов, что, в свою очередь, ведёт к тому, что контекстное окно в скором времени закончится.
Насколько я помню, у Claude Desktop версий моделек Sonnet, контекстное окно вообще в 32k токенов
Как эти проблемы предлагает решить Anthropic?
Просить модель делать то, что она уже умеет очень хорошо — писать код, который выполнит задачу.
Как наш пример можно реализовать с таким подходом?
1. Модель получает интерфейсы и API от внешних tools - от Google Drive MCP и от Salesforce MCP
2. На основе имеющихся интерфейсов и задачи от пользователя, модель пишет код, который программно возьмет нужные meeting transcripts и создаст Salesforce leads
3. Задача выполнена
optional. Ту инфу, которую модели нужно знать, она узнает из кода через console.log()
Гениально! 🎉
В статье упомянуто, что в этой конкретной задаче таким способом удалось снизить расход токенов с 150к до 2к.
☝️
Как обычно, подход очевиден, но не все осознают его.
Я в своем опыте использую такой подход для написания одноразовых скриптов.
Из последнего — упростить миграцию данных из одной БД в другую. Я прошу Claude Code написать два node js скрипта:
1) db1 -> json
2) json -> db2
Ну и далее эти скрипты исполняются вручную мной или агентом и выполняют задачу.
Этот подход уже используется в Cloudflare Agents SDK (на него ссылаются авторы), так же знаю, что Ринат Абдуллин (@llm_under_hood) использует такой способ написания кода в своем видении AI Coding.
Стоит отметить, что написание кода LLM моделям "роднее", потому что программного кода они в своих датасетах видели больше, чем "MCP tool calls".
Конечно, здесь есть и свои минусы, но на мой взгляд, это может помочь повысить надёжность способов взаимодействия LLM с внешним миром.
А вы что думаете по этому подходу?
✔️ Timur Khakhalev про AI Coding, подписывайтесь!
⭐️ Консультации по AI Coding
Спустя чуть менее года с момента релиза протокола MCP, Anthropic написали статью о том, что MCP был ошибкой 😄
В этой статье они небезосновательно упоминают о частых проблемах с MCP:
▪️Tools тратят очень много токенов контекстного окна, я об этом кстати уже рассказывал тут
▪️Промежуточные результаты tools тратят дополнительные токены.
В статье приводится пример запроса пользователя: "Скачай meeting transcripts с Google Drive и добавь их к Salesforce lead".
Для исполнения такого запроса нужно, чтобы модель использовала один tool для выкачивания транскриптов, а потом создала из этого лиды.
Транскрипт 2 часового митинга может занимать около 50к токенов, что, в свою очередь, ведёт к тому, что контекстное окно в скором времени закончится.
Как эти проблемы предлагает решить Anthropic?
Просить модель делать то, что она уже умеет очень хорошо — писать код, который выполнит задачу.
Как наш пример можно реализовать с таким подходом?
1. Модель получает интерфейсы и API от внешних tools - от Google Drive MCP и от Salesforce MCP
2. На основе имеющихся интерфейсов и задачи от пользователя, модель пишет код, который программно возьмет нужные meeting transcripts и создаст Salesforce leads
3. Задача выполнена
optional. Ту инфу, которую модели нужно знать, она узнает из кода через console.log()
Гениально! 🎉
В статье упомянуто, что в этой конкретной задаче таким способом удалось снизить расход токенов с 150к до 2к.
☝️
Как обычно, подход очевиден, но не все осознают его.
Я в своем опыте использую такой подход для написания одноразовых скриптов.
Из последнего — упростить миграцию данных из одной БД в другую. Я прошу Claude Code написать два node js скрипта:
1) db1 -> json
2) json -> db2
Ну и далее эти скрипты исполняются вручную мной или агентом и выполняют задачу.
Этот подход уже используется в Cloudflare Agents SDK (на него ссылаются авторы), так же знаю, что Ринат Абдуллин (@llm_under_hood) использует такой способ написания кода в своем видении AI Coding.
Стоит отметить, что написание кода LLM моделям "роднее", потому что программного кода они в своих датасетах видели больше, чем "MCP tool calls".
Конечно, здесь есть и свои минусы, но на мой взгляд, это может помочь повысить надёжность способов взаимодействия LLM с внешним миром.
А вы что думаете по этому подходу?
Please open Telegram to view this post
VIEW IN TELEGRAM
Пока Яндекс дремлет и непонятно чем занимается Волож со своим Nebius за бугром уже давно перешагнул Яндекс по капитализации и рвется в светлое будущее с ИИ. Вот, например, можно купить у него инференс по основным опенсорсным моделькам..
https://tokenfactory.nebius.com/
https://tokenfactory.nebius.com/
Forwarded from Неискусственный интеллект (Илья Склюев)
Отечественные чат-боты превзошли американцев и китайцев... в сборе информации
Вечером среды мы внезапно поняли, что в приложениях «Алисы» и GigaChat почему-то нет простой кнопки, позволяющей отключить сбор и анализ ваших диалогов. Хотя у ChatGPT и DeepSeek настройка находится в пару кликов.
Оказывается, всё это не просто так. Отечественные компании ведут активный сбор данных, но используют их по-разному:
1️⃣ «Алиса» анализирует ваши «отдельные голосовые и текстовые сообщения» по умолчанию
Нам казалось, что отключить настройку можно через «Яндекс ID». Но в компании пояснили, что кнопка «Помогать Алисе стать лучше» действует только для умных устройств.
В сервисном соглашении «Алисы AI» в разделе про данные пользователя говорят, что «Правообладателю передается следующая информация: идентификатор Пользователя, Запросы, ответы на Запросы Пользователя, иная информация, предоставляемая и собираемая посредством пользовательского интерфейса Сервиса».
Используют их, конечно же, «в целях совершенствования в целях проведения анализа, развития и совершенствования Сервиса и его отдельных функций». А ещё для рекламы:
«Персональная информация Пользователя обрабатывается в целях предоставления функциональности Сервиса, в том числе для отображения контента, потенциально наиболее интересного Пользователю».
2️⃣ «Сбер» получает всё, но делать с этим ничего не будет (пока)
Пользуясь GigaChat, пользователь «предоставляет SDevices и Правообладателю право использования Контента Клиента <...> любыми способами, не противоречащими действующему законодательству, в том числе, указанными в п. 2 ст. 1270 Гражданского кодекса Российской Федерации, но не ограничиваясь ими».
В корпоративном соглашении и в версии для физлиц подчёркивают, что «SDevices и Правообладатель не используют предоставленный или загружаемый Контент в собственных целях, не связанных с предоставлением Сервиса». Формулировка размытая, но нам официально заявили, что в «Сбере» не используют запросы пользователей для обучения нейросетей.
При этом, как только вы что-то сгенерировали в GigaChat, то вы передаёте компании лицензию на использование контента следующими способами:
▪️ «воспроизведение, хранение и запись в память ЭВМ Правообладателя и его аффилированных лиц и на серверах, назначенных Правообладателем, если такое использование необходимо для целей предоставления Сервиса»
▪️ «использование с предварительного согласия Клиента в маркетинговых и информационных материалах Правообладателя, направленных на привлечение внимание к Сервису или информирование о возможностях Сервиса неопределенного круга лиц».
Так что всё содержимое вашего диалога прекрасно видно компании. А условия использования в дальнейшем ещё могут поменяться.
@anti_agi
Вечером среды мы внезапно поняли, что в приложениях «Алисы» и GigaChat почему-то нет простой кнопки, позволяющей отключить сбор и анализ ваших диалогов. Хотя у ChatGPT и DeepSeek настройка находится в пару кликов.
Оказывается, всё это не просто так. Отечественные компании ведут активный сбор данных, но используют их по-разному:
Нам казалось, что отключить настройку можно через «Яндекс ID». Но в компании пояснили, что кнопка «Помогать Алисе стать лучше» действует только для умных устройств.
В сервисном соглашении «Алисы AI» в разделе про данные пользователя говорят, что «Правообладателю передается следующая информация: идентификатор Пользователя, Запросы, ответы на Запросы Пользователя, иная информация, предоставляемая и собираемая посредством пользовательского интерфейса Сервиса».
Используют их, конечно же, «в целях совершенствования в целях проведения анализа, развития и совершенствования Сервиса и его отдельных функций». А ещё для рекламы:
«Персональная информация Пользователя обрабатывается в целях предоставления функциональности Сервиса, в том числе для отображения контента, потенциально наиболее интересного Пользователю».
Не очень понимаем, как с такими условиями пользоваться агентскими фичами «Алисы». Если любая информация, попавшая в поле зрения бота, будет уходить для отображения интересного контента.
Пользуясь GigaChat, пользователь «предоставляет SDevices и Правообладателю право использования Контента Клиента <...> любыми способами, не противоречащими действующему законодательству, в том числе, указанными в п. 2 ст. 1270 Гражданского кодекса Российской Федерации, но не ограничиваясь ими».
В корпоративном соглашении и в версии для физлиц подчёркивают, что «SDevices и Правообладатель не используют предоставленный или загружаемый Контент в собственных целях, не связанных с предоставлением Сервиса». Формулировка размытая, но нам официально заявили, что в «Сбере» не используют запросы пользователей для обучения нейросетей.
При этом, как только вы что-то сгенерировали в GigaChat, то вы передаёте компании лицензию на использование контента следующими способами:
Так что всё содержимое вашего диалога прекрасно видно компании. А условия использования в дальнейшем ещё могут поменяться.
@anti_agi
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Вышла открытая Kimi K2 Thinking: релиз уже окрестили «DeepSeek moment 2.0»
Моделька выбивает SOTA на Humanity’s Last Exam и BrowseComp: в основном за счет мега-прокаченного tool calling.
Она может делать до 200–300 последовательных вызовов инструментов (интернет, браузер, интерпретаторы кода и пр.), самостоятельно планируя и разбивая задачи на подзадачи. Это правда впечатляет и сильно выделяет модель.
В остальном: MoE, 1T параметров и 32В активных, контекст 128к токенов, лицензия MIT с небольшими ограничениями для крупных продуктов.
Попробовать можно здесь
Веса | Блогпост | API
Моделька выбивает SOTA на Humanity’s Last Exam и BrowseComp: в основном за счет мега-прокаченного tool calling.
Она может делать до 200–300 последовательных вызовов инструментов (интернет, браузер, интерпретаторы кода и пр.), самостоятельно планируя и разбивая задачи на подзадачи. Это правда впечатляет и сильно выделяет модель.
В остальном: MoE, 1T параметров и 32В активных, контекст 128к токенов, лицензия MIT с небольшими ограничениями для крупных продуктов.
Попробовать можно здесь
Веса | Блогпост | API
12 разных курсов на hugging face 🤗 - на любой вкус
huggingface.co
Hugging Face - Learn
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
На OpenRouter новая стелс-модель (авторы не известны, цена нулевая) - народ ждет 5.1 от OpenAI, но может быть и что-то другое..
openrouter.ai
Polaris Alpha - API Pricing & Providers
This model was an early snapshot of GPT-5.1 with reasoning effort set to minimal. 256,000 token context window.
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Google Opal — убийца n8n? (еще нет)
Google тихо выкатил Opal — свой клон n8n с визуальным редактором и нодами для автоматизации. Многие уже успели заклеймить его убийцей n8n и AgentKit, но пока это скорее очередной эксперимент. Често говоря, я изначально думал что n8n придется несладко, т.к. очевидно было, что все LLM лабы в какой-то момент сделают свою обвязку для пайаплайна агентов, это было делом времени.
UI в Opal приятный, можно изменять воркфлоу промптом (даже голосом), и всё это бесплатно. Правда, там только сервисы Google: Gemini, Imagen 4, Veo (бесплатно!), Lyria 2 и т.д. Подключить что-то стороннее нельзя.
Но на практике всё сыро. Я попробовал собрать на нём контент-завод для "рекламы", но Opal забыл объединить сгенерированные видео. Попытка решить проблему через Python-скрипт провалилась — ffmpeg туда не завезли, хотя функция
Самый полезный юзкейс сейчас — собирать сложные цепочки из нескольких LLM. Например, одна модель пишет план отчёта, три другие параллельно генерируют части, а в конце всё собирается вместе (если вам не хватает длины ответа обычной Gemini). Или можно выстроить пайплайн: сценарий → раскадровка → картинки → видео, правда, помним про лимиты.
Итог: Opal пока может делать не больше, чем Canvas в Gemini App. Это не убийца n8n, а скорее эксперимент (так он и называется) и хороший способ вкатиться в "нодовую культуру" благодаря простому интерфейсу и ограниченному функционалу — n8n поначалу может пугать. Побаловаться вечерок можно, но для серьёзных задач инструмент пока не готов.
Кстати, Google завезли ещё кучу подобных мини-аппов, которым не суждено стать полноценными продуктами. Pomelli, кстати, как раз один из них. Ставьте единорога 🦄, если интересен обзор и на другие.
Попробовать
@ai_newz
Google тихо выкатил Opal — свой клон n8n с визуальным редактором и нодами для автоматизации. Многие уже успели заклеймить его убийцей n8n и AgentKit, но пока это скорее очередной эксперимент. Често говоря, я изначально думал что n8n придется несладко, т.к. очевидно было, что все LLM лабы в какой-то момент сделают свою обвязку для пайаплайна агентов, это было делом времени.
UI в Opal приятный, можно изменять воркфлоу промптом (даже голосом), и всё это бесплатно. Правда, там только сервисы Google: Gemini, Imagen 4, Veo (бесплатно!), Lyria 2 и т.д. Подключить что-то стороннее нельзя.
Но на практике всё сыро. Я попробовал собрать на нём контент-завод для "рекламы", но Opal забыл объединить сгенерированные видео. Попытка решить проблему через Python-скрипт провалилась — ffmpeg туда не завезли, хотя функция
execute code предусмотрена.Самый полезный юзкейс сейчас — собирать сложные цепочки из нескольких LLM. Например, одна модель пишет план отчёта, три другие параллельно генерируют части, а в конце всё собирается вместе (если вам не хватает длины ответа обычной Gemini). Или можно выстроить пайплайн: сценарий → раскадровка → картинки → видео, правда, помним про лимиты.
Итог: Opal пока может делать не больше, чем Canvas в Gemini App. Это не убийца n8n, а скорее эксперимент (так он и называется) и хороший способ вкатиться в "нодовую культуру" благодаря простому интерфейсу и ограниченному функционалу — n8n поначалу может пугать. Побаловаться вечерок можно, но для серьёзных задач инструмент пока не готов.
Кстати, Google завезли ещё кучу подобных мини-аппов, которым не суждено стать полноценными продуктами. Pomelli, кстати, как раз один из них. Ставьте единорога 🦄, если интересен обзор и на другие.
Попробовать
@ai_newz
Forwarded from Machinelearning
GPT-5-Codex-Mini - более доступная версия флагманского Codex, она в 4 раза эффективней по затратам по сравнению с полной версией GPT-5-Codex при небольшом компромиссе в производительности.
Разница в возможностях минимальна: на SWE-bench Verified версия Mini набрала 71.3%, в то время как старшая GPT-5-Codex - 74.5%. OpenAI рекомендует переключаться на Mini для решения более простых задач или для экономии ресурсов при приближении к лимитам. Старший Codex будет автоматически предлагать переход на Mini, когда пользователь достигнет 90% своего лимита.
Модель уже доступна в CLI и расширении для IDE, а в скором времени появится и поддержка через API.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Kimi K2 Thinking такая большая, что даже динамическая 1-битная квантизация занимает 245Gb, нормальные 4-битные квантизации 500-700гб. Очевидно, это делает ее бессмысленной для локального использования.
Да и в самой модели что-то я сомневаюсь - наверняка учили проходить все известные бенчмарки, отсюда и результаты. Кто-то пользовался?
Да и в самой модели что-то я сомневаюсь - наверняка учили проходить все известные бенчмарки, отсюда и результаты. Кто-то пользовался?
huggingface.co
unsloth/Kimi-K2-Thinking-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
На выходных откатил систему с Tahoe на предыдущую версию - Sequoia. Не смог привыкнуть к отсутствию ланчпада - казнил бы человека в Apple, который это придумал. Установку сделал чистую, чтобы убрать все «хвосты» от моих экспериментов, которых набралось достаточно.
Из положительных впечатлений - какое-то время назад купил провода с разъемом usb-c на thunderbolt 5. Отлично работают - когда обычная флешка что-то копирует часами, здесь сотни гигабайт перекачиваются на диск за считанные минуты. Стоит 1300 руб по нынешним деньгам, очень все рекомендую.
Вся эта возня научилась из-за того, что комп перестал нормально коннектиться со вторым моим сервером, но здесь выяснилось, что дело в провайдере. Он блокирует уже второе мое подключение. Не хотел его менять, но теперь есть повод задуматься.
Решил установить MS office по платной подписке, предпринял не самые тривиальные усилия, поставил, и теперь у меня в офисе появился copilot. Посмотрим, на что он способен, особых надежд не возлагаю, но все же. И хочется все-таки понять, где там Клод и что Майкрософт делает вместе с андроидом.
Из положительных впечатлений - какое-то время назад купил провода с разъемом usb-c на thunderbolt 5. Отлично работают - когда обычная флешка что-то копирует часами, здесь сотни гигабайт перекачиваются на диск за считанные минуты. Стоит 1300 руб по нынешним деньгам, очень все рекомендую.
Вся эта возня научилась из-за того, что комп перестал нормально коннектиться со вторым моим сервером, но здесь выяснилось, что дело в провайдере. Он блокирует уже второе мое подключение. Не хотел его менять, но теперь есть повод задуматься.
Решил установить MS office по платной подписке, предпринял не самые тривиальные усилия, поставил, и теперь у меня в офисе появился copilot. Посмотрим, на что он способен, особых надежд не возлагаю, но все же. И хочется все-таки понять, где там Клод и что Майкрософт делает вместе с андроидом.
Не знаю, вы смотрите сериалы? Что-то с этим ИИ я совсем перестал..
Вот, айтишники пишут про какой-то свежий, интересный..
Вот, айтишники пишут про какой-то свежий, интересный..
Telegram
Denis Sexy IT 🤖
Тоже посмотрел новый сериал «Pluribus» и тоже пребываю в восторге – это тот же самый режиссёр, который снимал «Breaking Bad» и «Better Call Saul» но в Sci-Fi жанре
Сериал особенно понравился потому что это какой-то новый взгляд на постапокалипсис, чего,…
Сериал особенно понравился потому что это какой-то новый взгляд на постапокалипсис, чего,…
😁2
Forwarded from Анализ данных (Data analysis)
Media is too big
VIEW IN TELEGRAM
AI-видео в китайском *Douyin выходят на совершенно другой уровень
В ленте вирусится ролик, где «китайская мама» устраивает разнос ксеноморфу - и выглядит это как мини-фильм. Кажется, что вот сейчас всё закончится, но сцена продолжает разгоняться и становится ещё абсурднее и эффектнее.
*Douyin - это китайская версия TikTok.
В ленте вирусится ролик, где «китайская мама» устраивает разнос ксеноморфу - и выглядит это как мини-фильм. Кажется, что вот сейчас всё закончится, но сцена продолжает разгоняться и становится ещё абсурднее и эффектнее.
*Douyin - это китайская версия TikTok.
Новая моделька для работы с агентами - понимает видео, преобразует в текст. Опен-сорс, всего 30В параметров.
huggingface.co
mlfoundations/Gelato-30B-A3B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Baidu опенсорснула мультимодальную модельку на 28В параметров. Можно пробовать разворачивать у себя.
А Google тем временем дает возможность запускать модели в облаке, гарантируя приватность данных. Тоже может быть полезным.
Плюс большой апдейт Google photos, апдейт Gemini CLI для работы с Hugging face и еще куча всякой мелочи..
А Google тем временем дает возможность запускать модели в облаке, гарантируя приватность данных. Тоже может быть полезным.
Плюс большой апдейт Google photos, апдейт Gemini CLI для работы с Hugging face и еще куча всякой мелочи..
huggingface.co
baidu/ERNIE-4.5-VL-28B-A3B-Thinking · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.