По нашему времени Grok 4 выйдет в четверг. Стоит ли чего то ждать? Grok 3 был неплох, выше ожиданий, хотя до топ-3 все-таки не дотянул. Зато была бесплатной, с deep research.
Все последние нейронки от лидеров Claude 4, Gemini 2.5, o3 были лучше предыдущих, но уже почти незаметно. Поэтому больших ожиданий нет, но не зря же ждали - может, появится какая-то мультимодальность, видео, например.
Гроку больше не хватаем МСР и агентов - может быть, увидим и их. А дальше будем ждать DeepSeek R2, который тоже не за горами
https://t.me/data_secrets/7321
Все последние нейронки от лидеров Claude 4, Gemini 2.5, o3 были лучше предыдущих, но уже почти незаметно. Поэтому больших ожиданий нет, но не зря же ждали - может, появится какая-то мультимодальность, видео, например.
Гроку больше не хватаем МСР и агентов - может быть, увидим и их. А дальше будем ждать DeepSeek R2, который тоже не за горами
https://t.me/data_secrets/7321
Telegram
Data Secrets
Мы дождались: Grok-4 выйдет завтра
Илон Маск назначил прямой эфир на 8 вечера среды по PT. По Москве это, правда, будет 6 утра четверга. Придется админам пожертвовать сном 😭
Напоминаем, кстати, что первый раз Маск обещал выход Grok-4 «через неделю» 29…
Илон Маск назначил прямой эфир на 8 вечера среды по PT. По Москве это, правда, будет 6 утра четверга. Придется админам пожертвовать сном 😭
Напоминаем, кстати, что первый раз Маск обещал выход Grok-4 «через неделю» 29…
Forwarded from Data Secrets
Стрим задержали на час, но теперь наконец-то показывают какие-то бенчмарки.
Основное: 50.7% на Humanity’s Last Exam на максимальном компьюте ризонинга. Для сравнения, предыдущий лидер – Gemini 2.5 Pro – выбивала примерно 22%.
Без использования инструментов результат немного падает – около 25%. Говорят, tool use интегрировали прямо в обучение и теперь Grok исключительно хорошо умеет пользоваться браузером, интерпретатором кода и пр.
Также улучшили voice mode: теперь в голосовом режиме Grok работает еще быстрее и умеет шептать, петь, менять интонации и вот это все.
В чате будут доступны две версии: обычный Grok и Grok Heavy. Grok Heavy, кстати, выбивает 100 процентов на AIME 2025 (RIP очередной бенчмарк).
Все модели будут доступны уже сегодня, но за Grok Heavy придется платить 300 долларов в месяц
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Все о блокчейн/мозге/space/WEB 3.0 в России и мире
Mistral выпустил cookbook как настроить ИИ для анализа спутниковых изображений.
Кому это пригодится?
1. Ученым и экологам для мониторинга изменений климата или биоразнообразия.
2. Бизнесу - с/х компании могут оценивать состояние полей, а логистические — отслеживать маршруты.
3. Разработчикам - руководство упрощает интеграцию ИИ в приложения через API, что делает его доступным даже для небольших команд.
4. Госсектору - для управления инфраструктурой и реагирования на стихийные бедствия.
Pixtral-12B — модель, способная обрабатывать текст и изображения, с контекстным окном в 128 тысяч токенов.
Mistral показывает, как:
- Использовать API для пакетной обработки данных.
- Передавать изображения в формате base64 для анализа спутниковых снимков.
- Тонко настраивать модель с помощью техники LoRA для повышения точности в задачах классификации, например, распознавания ландшафтов или объектов на снимках.
Кому это пригодится?
1. Ученым и экологам для мониторинга изменений климата или биоразнообразия.
2. Бизнесу - с/х компании могут оценивать состояние полей, а логистические — отслеживать маршруты.
3. Разработчикам - руководство упрощает интеграцию ИИ в приложения через API, что делает его доступным даже для небольших команд.
4. Госсектору - для управления инфраструктурой и реагирования на стихийные бедствия.
Pixtral-12B — модель, способная обрабатывать текст и изображения, с контекстным окном в 128 тысяч токенов.
Mistral показывает, как:
- Использовать API для пакетной обработки данных.
- Передавать изображения в формате base64 для анализа спутниковых снимков.
- Тонко настраивать модель с помощью техники LoRA для повышения точности в задачах классификации, например, распознавания ландшафтов или объектов на снимках.
Telegram
All about AI, Web 3.0, BCI
New Mistral Cookbook: Finetuning Pixtral on a satellite imagery dataset 🛰️
- How to call Mistral's batch inference API
- How to pass images (encoded in base64) in your API calls to Mistral's VLM (here Pixtral-12B)
- How to fine-tune Pixtral-12B on an image…
- How to call Mistral's batch inference API
- How to pass images (encoded in base64) in your API calls to Mistral's VLM (here Pixtral-12B)
- How to fine-tune Pixtral-12B on an image…
Forwarded from Все о блокчейн/мозге/space/WEB 3.0 в России и мире
Anthropic запустили бесплатные курсы, которые помогут узнать все от использования API до MCP и лучших практик Claude Code.
Курсы состоят из десятков лекций, самостоятельных тестов и сертификатов, которыми вы можете поделиться после их прохождения.
Каждый курс охватывает реальные примеры и детали практической реализации и создан с учетом отзывов разработчиков, уже использующих Claude в производстве.
Курсы состоят из десятков лекций, самостоятельных тестов и сертификатов, которыми вы можете поделиться после их прохождения.
Каждый курс охватывает реальные примеры и детали практической реализации и создан с учетом отзывов разработчиков, уже использующих Claude в производстве.
Claude Academy
Courses · Claude Academy
Structured learning paths with video lessons and assessments to help you master AI collaboration, Claude development, and MCP.
Forwarded from Все о блокчейн/мозге/space/WEB 3.0 в России и мире
Вот этим запуском китайцы просто обошли всех: ИИ-агент MiniMax теперь может:
1. Создавать монетизируемые приложения в 1 предложение. Команда обещает:
- Создать полноценное приложение
- Интегрировать платежную систему Stripe
- Настроить бэкенд и фронтенд
Все это одной командой - шаг к no-code в электронной коммерции. Барьер входа для создания бизнеса падает почти до нуля.
2. PPTX Export. Если это правда, то удар по:
- PowerPoint
- Canva
- Figma частично
- Gamma
Важный вопрос - насколько хорошо работает с корпоративными шаблонами и брендингом?
3. Browser Agent Self-Hosted, это означает:
- Больше контроля над данными
- Снижение затрат на API
- Возможность кастомизации
- предполагает улучшенные алгоритмы и экономику использования.
Этот релиз показывает грядущие тренды:
1. No-code → Low-code → One-sentence-code
2. ИИ-агенты становятся self-hosted - тренд к децентрализации.
3. Интеграция монетизации в сам процесс создания
4. Performance как конкурентное преимущество
Если эти обещания выполняются, это может быть значимый шаг к демократизации создания мобильных приложений. Особенно интересен self-hosted browser agent - это может быть ответ на проблемы приватности и контроля.
1. Создавать монетизируемые приложения в 1 предложение. Команда обещает:
- Создать полноценное приложение
- Интегрировать платежную систему Stripe
- Настроить бэкенд и фронтенд
Все это одной командой - шаг к no-code в электронной коммерции. Барьер входа для создания бизнеса падает почти до нуля.
2. PPTX Export. Если это правда, то удар по:
- PowerPoint
- Canva
- Figma частично
- Gamma
Важный вопрос - насколько хорошо работает с корпоративными шаблонами и брендингом?
3. Browser Agent Self-Hosted, это означает:
- Больше контроля над данными
- Снижение затрат на API
- Возможность кастомизации
- предполагает улучшенные алгоритмы и экономику использования.
Этот релиз показывает грядущие тренды:
1. No-code → Low-code → One-sentence-code
2. ИИ-агенты становятся self-hosted - тренд к децентрализации.
3. Интеграция монетизации в сам процесс создания
4. Performance как конкурентное преимущество
Если эти обещания выполняются, это может быть значимый шаг к демократизации создания мобильных приложений. Особенно интересен self-hosted browser agent - это может быть ответ на проблемы приватности и контроля.
Telegram
All about AI, Web 3.0, BCI
Now live: Full-Stack + Stripe on MiniMax Agent and more
1. Full-Stack + Stripe → Build monetizable apps in 1 sentence
2. PPTX Export → Better than top tools
3. Performance ↑ 30% faster, 23% leaner
4. Browser Agent → Now self-hosted, smarter & cheaper
1. Full-Stack + Stripe → Build monetizable apps in 1 sentence
2. PPTX Export → Better than top tools
3. Performance ↑ 30% faster, 23% leaner
4. Browser Agent → Now self-hosted, smarter & cheaper
Тут, оказыается, против конторы, у которой я сервак арендовал, ввели американские санкции - типа работают с левыми чуваками нехорошими. Вовремя я себе сервачок домой купил. Переношу все на него потихоньку. Возился сегодня с доменом, который отправил на новый хостинг. До ИИ дело не особо доходит, воюю с серверной частью. Пытаюсь потихоньку узать Claude Code - но там точно надо какую-то память подключать, он каждый раз забывает абсолютно все (и я тоже). Где-то читал в Х как это делается...
tko_presentation_TKO_Presentation_Final.pdf
119.8 KB
Побаловался с новым агентом minimax.io
Рекомендую потестить, пожалуй, очень старательный товарищ. Честно говоря, дал ему безнадежную задачку - поправить слайд в презентации. Старался минут 15-20. Сделал (это кстати, как я тоже пробовал - презентация на питоне). Но, видимо, паверпойнт слишком сложная штуковина, нормально программировать себя не дает. Получилось так себе, но за попытку зачет.
П.С. В ПДФ получилось гораздо лучше - в паверпойнте, увы, все выглядит совсем неважно... любопытненько
Рекомендую потестить, пожалуй, очень старательный товарищ. Честно говоря, дал ему безнадежную задачку - поправить слайд в презентации. Старался минут 15-20. Сделал (это кстати, как я тоже пробовал - презентация на питоне). Но, видимо, паверпойнт слишком сложная штуковина, нормально программировать себя не дает. Получилось так себе, но за попытку зачет.
П.С. В ПДФ получилось гораздо лучше - в паверпойнте, увы, все выглядит совсем неважно... любопытненько
👍2
Google подумал-подумал, и отрубил мне использование агента Gemini CLI в терминале - говорит, на нашей территории это невозможно. Обидно, конечно - буду рабоать либо с Claude Code, либо с Gemini как обычно, через браузер. Оно, может, и не так современно, но контроля гораздо больше...
😢1
Forwarded from Data Secrets
Австралийские ученые изобрели биологический искусственный интеллект
Из система называется PROTEUS (PROTein Evolution Using Selection). Это платформа для направленной эволюции молекул прямо внутри живых клеток млекопитающих.
Направленная эволюция – это когда эволюционные процессы белков или генов искусственно ускоряют и "направляют", чтобы получить молекулы с нужными свойствами. За ее изобретение в 2018 году Фрэнсис Х. Арнольд дали Нобелевку.
Но тогда метод работал только для бактерий или дрожжей, то есть для единичных простых белков. А PROTEUS – первый метод, который делает directed evolution для клеток млекопитающих. Кратко, как это работает:
➖ Специальные вирусоподобные частицы (VLV) заносят нужный ген в клетку и делают в нём случайные мутации, как будто перемешивают «параметры» белка.
➖ Если мутировавший белок работает лучше (например, активирует нужный сигнал сильнее), клетка даёт сигнал, и именно этот вариант распространяется дальше – как награда в Reinforcement Learning.
➖ Лучшие гены снова мутируют, снова проходят отбор. Все это похоже на эволюционный поиск гиперпараметров, но внутри живых клеток.
Буквально живой аналог AutoML. Авторы сами говорят, что вдохновлялись именно алгоритмами ИИ. И кстати, это уже работает на хомячках. Скоро будут тестировать и на людях, но там нужна дополнительная работа с иммунитетом.
Если такое заработает массово и стабильно – последствия могут быть революционными. Лекарства, выработка антител, синтетическая биология…
В такое будущее даже хочется.
Из система называется PROTEUS (PROTein Evolution Using Selection). Это платформа для направленной эволюции молекул прямо внутри живых клеток млекопитающих.
Направленная эволюция – это когда эволюционные процессы белков или генов искусственно ускоряют и "направляют", чтобы получить молекулы с нужными свойствами. За ее изобретение в 2018 году Фрэнсис Х. Арнольд дали Нобелевку.
Но тогда метод работал только для бактерий или дрожжей, то есть для единичных простых белков. А PROTEUS – первый метод, который делает directed evolution для клеток млекопитающих. Кратко, как это работает:
Буквально живой аналог AutoML. Авторы сами говорят, что вдохновлялись именно алгоритмами ИИ. И кстати, это уже работает на хомячках. Скоро будут тестировать и на людях, но там нужна дополнительная работа с иммунитетом.
Если такое заработает массово и стабильно – последствия могут быть революционными. Лекарства, выработка антител, синтетическая биология…
В такое будущее даже хочется.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1🔥1
Непростая доля селфхостера..
Устанавливаю на свой сервер различные приложения, последнее - appflowy, инструмент управления проектами. Приложение опенсорс, можно сидеть на бесплатной подписке с облаком от разработчиков, но это всегда ограничения. Поэтому ставлю приложение на свой сервер, и там же будут храниться все мои базы. Звучит классно, но установка - это прямо-таки пазл. Разворачивание контейнеров, пробрасывание портов, настройка аутентификации. Два вечера и два утра убиты. Зато еще немного погрузился в обратный прокси с Caddy, попользовался Portainer для контейнеров, опять же, OAuth2 от Google. Надеюсь, в следующий раз будет проще
Устанавливаю на свой сервер различные приложения, последнее - appflowy, инструмент управления проектами. Приложение опенсорс, можно сидеть на бесплатной подписке с облаком от разработчиков, но это всегда ограничения. Поэтому ставлю приложение на свой сервер, и там же будут храниться все мои базы. Звучит классно, но установка - это прямо-таки пазл. Разворачивание контейнеров, пробрасывание портов, настройка аутентификации. Два вечера и два утра убиты. Зато еще немного погрузился в обратный прокси с Caddy, попользовался Portainer для контейнеров, опять же, OAuth2 от Google. Надеюсь, в следующий раз будет проще
❤2🏆1
KIRO - новый хайп среди агентов. Как я понимаю, работает на основе Клода, на основе запроса пишет постановку задачи, архитектуру, план - и программирует. Собственно то, чем я в последнее время занимался в ходе вайбкодинга. Интересно. Записался в лист ожидания
А вот кто еще вайбкодит с ClaudeCode - выпустили https://vibetunnel.sh/ который позволяет работать с Клодом удаленно, через терминал или любой браузер. Поделитесь, кто попробовал
Vibetunnel
Vibetunnel: Your Mac Terminal in Any Browser
Turn any browser into your terminal & command your agents on the go.
Из других новостей:
Nvidia запустила нейронки маленького размера Nemotron, дистиллированные из DeepSeek. Утверждают, что SOTA. Многие профи говорят, что для промышленного применения маленькая нейронка с хорошей обвязкой промптами и контекстом часто лучше чем просто большая модель без нужной обвязки - так что надо погружаться.
А еще один ох отцов ИИ из Мета Ян Лекун разместил ссылочку на новую модель - что это пока непонятно (мне), но можно скачать, и это интересно, так как архитектура какая-то новая - LLMD.
Из новостей маркетинга - и Google, и OpenAI на решали международную математическую олимпиаду на золото, причем вроде бы Гугл сделал это раньше, но маркетинговый отдел, который согласовывает новости, будет работать в понедельник, так что Сэм весь хайп получил в одиночестве ))
И еще плюшки от OpenAI - с понедельника Агента начнут раскатывать на нормальные подписки (за $20), и, судя по всему, новая модель, которая выйдет в ближайшее время, будет очень крутой. Где там DeepSeek со своим R2? Так глядишь, снова придется откладывать релиз
И напоследок - вышел новый бенчмарк для агентов, люди проходят, машины - пока не очень. Впрочем, это уже интересно разве что тем, кто дошел до обучения нейронок
Nvidia запустила нейронки маленького размера Nemotron, дистиллированные из DeepSeek. Утверждают, что SOTA. Многие профи говорят, что для промышленного применения маленькая нейронка с хорошей обвязкой промптами и контекстом часто лучше чем просто большая модель без нужной обвязки - так что надо погружаться.
А еще один ох отцов ИИ из Мета Ян Лекун разместил ссылочку на новую модель - что это пока непонятно (мне), но можно скачать, и это интересно, так как архитектура какая-то новая - LLMD.
Из новостей маркетинга - и Google, и OpenAI на решали международную математическую олимпиаду на золото, причем вроде бы Гугл сделал это раньше, но маркетинговый отдел, который согласовывает новости, будет работать в понедельник, так что Сэм весь хайп получил в одиночестве ))
И еще плюшки от OpenAI - с понедельника Агента начнут раскатывать на нормальные подписки (за $20), и, судя по всему, новая модель, которая выйдет в ближайшее время, будет очень крутой. Где там DeepSeek со своим R2? Так глядишь, снова придется откладывать релиз
И напоследок - вышел новый бенчмарк для агентов, люди проходят, машины - пока не очень. Впрочем, это уже интересно разве что тем, кто дошел до обучения нейронок
X (formerly Twitter)
NVIDIA AI Developer (@NVIDIAAIDev) on X
📣 Announcing the release of OpenReasoning-Nemotron: a suite of reasoning-capable LLMs which have been distilled from the DeepSeek R1 0528 671B model. Trained on a massive, high-quality dataset distilled from the new DeepSeek R1 0528, our new 7B, 14B, and…
Для тех, кто размышляет о своем железе для локальных моделей - видосик от моего любимого железячника. В частности, о том, почему M3 Ultra в Mac Studio лучше чем M4 Max. Впрочем, уже M5 не за горами, будет ли только там в линейке Ultra? Я же пока наслаждаюсь минимальным M4 в Mac mini - тоже очень достойная машинка )) Доволен
YouTube
Ditch 512 GB Monster…this M3 Ultra Just Redefined “Enough”
See how the humble base Mac Studio surprisingly beats its bigger sibling and my RTX beast in real-world AI tasks.
Check out ChatLLM: https://chatllm.abacus.ai/ltf
🛒 Gear Links 🛒
* 📦🎮 Mini Rack: https://amzn.to/4dXfwan
* 💻🔄 The GmkTec EVO X2: https://amzn.to/4l5BHOh…
Check out ChatLLM: https://chatllm.abacus.ai/ltf
🛒 Gear Links 🛒
* 📦🎮 Mini Rack: https://amzn.to/4dXfwan
* 💻🔄 The GmkTec EVO X2: https://amzn.to/4l5BHOh…
Нет такого теста, на котором Qwen не уделывал бы Claude, только есть ли такие люди, которые реально в. своих задачка используют Квен вмето Клода? Я пока не видел. Но вот в части локальной модельки от Квена ожиданий много..
Telegram
Data Secrets
Qwen обновили Qwen3-235B-A22B, и это просто загляденье
Во-первых, это не ризонинг модель. Разработчики пишут, что они решили вовсе прикрыть гибридный режим и будут обучать Instruct и Thinking модели отдельно.
Сегодня вышла Instruct версия. Напоминаем…
Во-первых, это не ризонинг модель. Разработчики пишут, что они решили вовсе прикрыть гибридный режим и будут обучать Instruct и Thinking модели отдельно.
Сегодня вышла Instruct версия. Напоминаем…
Forwarded from Data Secrets
Qwen только что релизнули свою новую ризонинг-модель
Буквально несколько дней назад они заявили, что теперь будут выпускать ризонеры и не-ризонеры отдельно (вместо гибридных моделей), показали свежий чекпоинт не рассуждающего Qwen3-235B-A22B, и пообещали скоро вернутся с ризонинг-моделью.
Ждать пришлось недолго и скоро наступило спустя пять дней (учитесь, OpenAI и xAI). Только что стартап поделился моделью Qwen3-235B-A22B-Thinking-2507. Название – язык сломаешь, зато метрики стоящие.
На многих тестах модель обгоняет Gemini 2.5 Pro, o4-mini и свежую версию R1. То есть мало того, что это новая опенсорс SOTA. Это вполне себе уровень закрытой frontier модели. Мед.
Контекст – 256к токенов. Попробовать модель уже можно в чате или через API (стоит 0.7$ и 8.4$ соответственно за input и output, у провайдеров, скорее всего, будет дешевле).
Веса лежат тут.
Буквально несколько дней назад они заявили, что теперь будут выпускать ризонеры и не-ризонеры отдельно (вместо гибридных моделей), показали свежий чекпоинт не рассуждающего Qwen3-235B-A22B, и пообещали скоро вернутся с ризонинг-моделью.
Ждать пришлось недолго и скоро наступило спустя пять дней (учитесь, OpenAI и xAI). Только что стартап поделился моделью Qwen3-235B-A22B-Thinking-2507. Название – язык сломаешь, зато метрики стоящие.
На многих тестах модель обгоняет Gemini 2.5 Pro, o4-mini и свежую версию R1. То есть мало того, что это новая опенсорс SOTA. Это вполне себе уровень закрытой frontier модели. Мед.
Контекст – 256к токенов. Попробовать модель уже можно в чате или через API (стоит 0.7$ и 8.4$ соответственно за input и output, у провайдеров, скорее всего, будет дешевле).
Веса лежат тут.
Пишу мало, потому что путешествую в отпуске по загнивающим Европам. Времени на занятия ИИ нет, но зато пользуюсь Claude каждый день, чтобы спланировать путешествие и заказать отель. Визы мы получили за три дня до вылета (французы - молодцы, справились за три недели и дали на год), билеты и гостиницы я заранее не заказывал и даже не смотрел. Так что теперь каждый вечер сидим с Клодом и смотрим, где остановиться завтра. Впечатления такие: во-первых, полезно. Во-вторых, контекст заканчивается буквально за три-четыре запроса - видимо, в поиске много информации потребляется. Когда поставил research, Клод изучил 289(!) источников. Поэтому сделал проект с общим описанием задачи и каждый раз запускаю новый поиск.
При этом цены на отели пишет неправильные, доступность номеров на 3 человек - тоже та еще проблема. Когда совсем беда - бросаю интеллект и бучу сам. Правда, как показала практика, в половине отелей на их сайтах заказывать гораздо дешевле )) Можно было бы, конечно, заморочиться всякими агентами и пр., но лень - это просто выбор пути и отелей (задачка комбинаторной сложности..)
В общем, есть еще куда совершенствоваться
При этом цены на отели пишет неправильные, доступность номеров на 3 человек - тоже та еще проблема. Когда совсем беда - бросаю интеллект и бучу сам. Правда, как показала практика, в половине отелей на их сайтах заказывать гораздо дешевле )) Можно было бы, конечно, заморочиться всякими агентами и пр., но лень - это просто выбор пути и отелей (задачка комбинаторной сложности..)
В общем, есть еще куда совершенствоваться
🍾2
Инсайдеры говорят, что память для Клода близка к выходу - сначала будет поиск по старым сообщения, а там, глядишь и пошире раскатают. Но это браузерная версия.
А текущий хит - Claude Code. Тут хорошие и плохие новости. Хорошие - появились субагенты, каждый может специализироваться на своем. А плохая - вводят недельные лимиты против тех, кто юзает его 24/7. А таких, говорят, много. Вот для него память тоже можно делать, но пока кастомно, тоже ждем официального продукта.
А текущий хит - Claude Code. Тут хорошие и плохие новости. Хорошие - появились субагенты, каждый может специализироваться на своем. А плохая - вводят недельные лимиты против тех, кто юзает его 24/7. А таких, говорят, много. Вот для него память тоже можно делать, но пока кастомно, тоже ждем официального продукта.