Смешно. Кому нужна Google 3.7 Flash, которая стоит больше DeepSeek V4 Pro, и кто о ней вообще вспомнит через полгода…
Я пользовался flash полгода назад, но это было до DeepSeek… сейчас это просто лишено смысла
https://t.me/ai_machinelearning_big_data/10703
Я пользовался flash полгода назад, но это было до DeepSeek… сейчас это просто лишено смысла
https://t.me/ai_machinelearning_big_data/10703
Telegram
Machinelearning
⚡️ Google выпустила Gemini 3.7 Flash
Через три недели после 3.6 Flash Google обновила рабочую модель линейки - ту, на которую разработчики вешают основную нагрузку.
Вводная цена вдвое ниже прежней - 0,75 доллара за миллион входных токенов и 3,75 за миллион…
Через три недели после 3.6 Flash Google обновила рабочую модель линейки - ту, на которую разработчики вешают основную нагрузку.
Вводная цена вдвое ниже прежней - 0,75 доллара за миллион входных токенов и 3,75 за миллион…
Google банит пользователей из России по информации об их эккаунте, поэтому и впн не помогает. Можно, конечно, новые эккаунты создавать, но оно надо? Лично я для себя тоже Google забанил, с начала лета. Нисколечко не страдаю..
https://t.me/data_analysis_ml/5600
https://t.me/data_analysis_ml/5600
Telegram
Анализ данных (Data analysis)
🚨 Gemini перестала открываться у части пользователей из России даже через VPN.
Проблемы появились вскоре после выхода новой версии Gemini 3.7 Flash, которая стала мощнее и дешевле предыдущих моделей.
Пользователи сообщают, что доступ к чат-боту не восстанавливается…
Проблемы появились вскоре после выхода новой версии Gemini 3.7 Flash, которая стала мощнее и дешевле предыдущих моделей.
Пользователи сообщают, что доступ к чат-боту не восстанавливается…
В течение двух часов выйдет Qwen 3.8 27B - лучшая модель, которую можно запустить на базовом Mac Studio или мощной прошке. Это я авансом, но сильно сомневаться не приходится, конкурентов не сказать, чтобы было много..
Forwarded from Machine learning Interview
🚀 DeepSeek Harness набрал 122K+ звёзд на GitHub всего за 3 дня и стал одним из самых быстрорастущих репозиториев в истории платформы.
Harness сделан как оркестрационный слой, где почти всё можно заменить плагином:
• модель
• shell
• редактирование файлов
• web search
• skills
• storage
• sessions
• reasoning effort
• permission scope
• UI
• scheduling
Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение.
sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше.
MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель.
Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз.
А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст.
То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего.
https://github.com/deepseek-ai/deepseek-harness
Harness сделан как оркестрационный слой, где почти всё можно заменить плагином:
• модель
• shell
• редактирование файлов
• web search
• skills
• storage
• sessions
• reasoning effort
• permission scope
• UI
• scheduling
Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение.
sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше.
MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель.
Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз.
А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст.
То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего.
https://github.com/deepseek-ai/deepseek-harness
Экзамен на духовность для нейросетей - это сильно. Тут может возникнуть соблазн и для людей такой экзамен устроить…
Telegram
Грустный Киберпанк
Яндекс предложил правительству способ проверки нейросетей на соответствие «духовно-нравственным ценностям»
Компания представила концепцию национального датасета — набора тестовых заданий с эталонными ответами, по которым ИИ-модели будут проверять на соответствие…
Компания представила концепцию национального датасета — набора тестовых заданий с эталонными ответами, по которым ИИ-модели будут проверять на соответствие…
Интересная история - Антропик выпустил приложение Дизайн для рисования презентаций, я вроде как его освоил, но по привычке продолжал работать с Клод-кодом. И там тоже стали выходить нормальные презентации - я думал поначалу, что это дизайн был подключен, но нет, это разные продукты.
Суть в том, что дизайн рисует в html - и дальше либо вы используете pdf либо будет не самый простой перевод в паверпойнт. А клод-код кодирует презентацию на питоне сразу в паверпойнте. Поэтому если надо быстрее, красивее и пдф - норм, берите дизайн. Или если надо какую-то новую сложную мульку нарисовать. Если надо редактируемую презентацию - идите срузу в код.
Сделайте свой скилл для презентаций. Дайте примеры. Будете экономить время на ошибках. Потребует, конечно, какого-то времени - у меня сейчас кода 5 тыс. строк, но оно стоит того.
Суть в том, что дизайн рисует в html - и дальше либо вы используете pdf либо будет не самый простой перевод в паверпойнт. А клод-код кодирует презентацию на питоне сразу в паверпойнте. Поэтому если надо быстрее, красивее и пдф - норм, берите дизайн. Или если надо какую-то новую сложную мульку нарисовать. Если надо редактируемую презентацию - идите срузу в код.
Сделайте свой скилл для презентаций. Дайте примеры. Будете экономить время на ошибках. Потребует, конечно, какого-то времени - у меня сейчас кода 5 тыс. строк, но оно стоит того.
я так и не освоил github как человек, гоняю туда нейронку. может, не стоит и начинать?
https://t.me/data_analysis_ml/5613
https://t.me/data_analysis_ml/5613
Telegram
Анализ данных (Data analysis)
Cursor запустил свой GitHub. Теперь код можно хранить прямо внутри Cursor
Новый сервис называется Origin. Он уже начал появляться в ранней бете у пользователей платных тарифов. Внутри есть репозитории, pull request'ы, просмотр кода и синхронизация с GitHub.…
Новый сервис называется Origin. Он уже начал появляться в ранней бете у пользователей платных тарифов. Внутри есть репозитории, pull request'ы, просмотр кода и синхронизация с GitHub.…
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Кино-адаптация побега роботов с серверов OpenAI
Forwarded from Machine learning Interview
🚀 DeepSeek V4 Pro внезапно стал заметно сильнее - без переобучения модели
К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use.
По опубликованным результатам прирост местами очень серьёзный:
* Terminal Bench: 87.9 → 90.1
* NL2Repo: 61.5 → 73.4
* CyberGym: 83.3 → 86.8
* DeepSWE: 62.7 → 72.0
* Toolathlon: 74.1 → 79.5
В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8.
https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use.
По опубликованным результатам прирост местами очень серьёзный:
* Terminal Bench: 87.9 → 90.1
* NL2Repo: 61.5 → 73.4
* CyberGym: 83.3 → 86.8
* DeepSWE: 62.7 → 72.0
* Toolathlon: 74.1 → 79.5
В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8.
https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
Здесь только маленькая проблема - все цифры идут от автора скилла. А так, любопытно, конечно
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Если вы часто отлаживаете UI-анимации, и ловите проблему когда OCR клода не может понять что именно не так
Попробуйте поюзать terminal-browser, вернее его функцию Agent Recordings для создания визуального баг-репорта:
1/ Она записывает содержимое открытой вкладки
2/ Запись открывается в покадровом редакторе
3/ Ты находишь кадр с багом
4/ С помощью стрелок и коментов показываешь агенту что не так
5/ На выходе получается папка с видео, кадрами, аннотациями и JSON-манифестом
В остальном это такой же обычный браузер как и в любом IDE, только в терминале:
Установить: terminal-browser.com
Пока работает только на macOS & Linux и нужен терминал с поддержкой картинок (например ghostty или cmux)
@tips_ai #tools
Попробуйте поюзать terminal-browser, вернее его функцию Agent Recordings для создания визуального баг-репорта:
1/ Она записывает содержимое открытой вкладки
2/ Запись открывается в покадровом редакторе
3/ Ты находишь кадр с багом
4/ С помощью стрелок и коментов показываешь агенту что не так
5/ На выходе получается папка с видео, кадрами, аннотациями и JSON-манифестом
В остальном это такой же обычный браузер как и в любом IDE, только в терминале:
- Агент и человек работает в одной и той же среде: агент управляет через команды а человек видит это в реальном времени
- Внутри полноценный Chromium, а не кастрированный текстовый браузер
Установить: terminal-browser.com
Пока работает только на macOS & Linux и нужен терминал с поддержкой картинок (например ghostty или cmux)
@tips_ai #tools
Qwen3.8 стал хитом, и под него тут же появилась нецензурированная версия, о ней много кто писал, но есть и другие интересные варианты - например, ускоренная модель, которая выдает а пару раз больше токенов..
inco.ai
DFlash 2: Keep Drafting Parallel
DFlash 2 is the successor to our widely deployed parallel drafter: close to 3× the speed of autoregressive decoding, with the same output. Drafters for Qwen3.8-27B and Meta's Muse Glimmer are out today.
Я тут как раз пытался пересадить скрипт по подготовки презентаций с Клода на DeepSeek, да еще и его харнесс. Но было не особо, так как писать презентации он мог, а видеть - нет. Как Бетховен.
Так что, то, что у Дипсика появилось зрение - очень даже кстати.
https://t.me/dealerAI/1903
Так что, то, что у Дипсика появилось зрение - очень даже кстати.
https://t.me/dealerAI/1903
Telegram
Dealer.AI
DeepSeek выпустил мультимодальную модель для агентов. 🪨
Сегодня, 21 августа, DeepSeek анонсировал экспериментальную версию своего флагмана, которая научилась понимать изображения на уровне, близком к Opus‑4.8. При этом все текстовые суперспособности (агентность…
Сегодня, 21 августа, DeepSeek анонсировал экспериментальную версию своего флагмана, которая научилась понимать изображения на уровне, близком к Opus‑4.8. При этом все текстовые суперспособности (агентность…
Кто бы это мог быть?
Я как раз высадил лимиты Клода (сколько ни заливай бабок, все на лимите сидишь), гпт тоже наполовину опустошил - а впреди еще 5 дней..
Ну и кстати, у Клода это типа на 50% увеличенный до 31 августа лимит...
Вернусь пробежки, потестирую
https://t.me/vibecoding_tg/3719
Я как раз высадил лимиты Клода (сколько ни заливай бабок, все на лимите сидишь), гпт тоже наполовину опустошил - а впреди еще 5 дней..
Ну и кстати, у Клода это типа на 50% увеличенный до 31 августа лимит...
Вернусь пробежки, потестирую
https://t.me/vibecoding_tg/3719
Telegram
Вайб-кодинг
В OpenCode и OpenRouter появилась загадочная новая ИИ-модель: Ox Alpha 👍
Ее уже прогнали через 10 задач DeepSWE, и она набрала больше 80% против 65% у Fable и 52% у GPT-5.6 Sol.
Модель предлагает контекстное окно на 1 млн токенов, мультимодальные возможности…
Ее уже прогнали через 10 задач DeepSWE, и она набрала больше 80% против 65% у Fable и 52% у GPT-5.6 Sol.
Модель предлагает контекстное окно на 1 млн токенов, мультимодальные возможности…
Ну что, надо попробовать?
https://t.me/vibecoding_tg/3726
PS поставил, пашет нормально. про силу модели, правда, пока сказать тяжело
Говорят, это новая GLM-5.X, даром что 5.3 только что обновилась
https://t.me/vibecoding_tg/3726
PS поставил, пашет нормально. про силу модели, правда, пока сказать тяжело
Говорят, это новая GLM-5.X, даром что 5.3 только что обновилась
Telegram
Вайб-кодинг
Офигеть, теперь даже игровой ПК может запускать передовые модели с интерактивной скоростью, используя официальные веса без экстремального квантования.
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной…
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной…
Кстати, если захотите задешево попрограммировать - есть моделька от Меты - Спарк 1.2, которую можно гонять по $0,2 за выходящий токен (по цене DeepSeek Flash). Нюанс один - все данные отдаются Мета для обучения. В общем, не жалко - кого только можно обучить на таких данных? )) Разве что вайбкодера..
https://openrouter.ai/meta/muse-spark-1.2-contributor
Любопытно, что Qwen3.8 27B стоит в инференсе 3 доллара - и вот этого я не понимаю, тот же DeepSeek Flash, который почти в 10 раз больше размером стоит в 10 раз дешевле. Какая-то странная экономика..
Ну а в экономику ИИ лучше всего раскрывают в этом видосике. Порадовали..
https://openrouter.ai/meta/muse-spark-1.2-contributor
Любопытно, что Qwen3.8 27B стоит в инференсе 3 доллара - и вот этого я не понимаю, тот же DeepSeek Flash, который почти в 10 раз больше размером стоит в 10 раз дешевле. Какая-то странная экономика..
Ну а в экономику ИИ лучше всего раскрывают в этом видосике. Порадовали..
openrouter.ai
Muse Spark 1.2 Contributor - API Pricing & Providers
Muse Spark 1.2 contributor tier is a reasoning model from Meta designed for developers who want to start building at an even lower cost. $0.10 per million input tokens, $0.20 per million output tokens. 1,048,576 token context window.
DeepSeek Pro может и хорошая модель, и харнесс интересный, но на уровне МАХ размышляет она бесконечно. 20 мин на две реплики, там, где Клод справляется за минутку, это, конечно, кого угодно из себя вывести может. Для тех, кто никуда не торопится
PS. Попросил решить проблему в настройках DeepSeek Harness - 3 вопроса, 40 минут - 1,17$. Проблема не решена. Спасибо, больше не надо..
PS. Попросил решить проблему в настройках DeepSeek Harness - 3 вопроса, 40 минут - 1,17$. Проблема не решена. Спасибо, больше не надо..
Попробовал в Клоде команду /doctor - сделал вывод, что харнесы для поддержания своих скриптов в порядке, чистка памяти и пр. как отдельный скилл не нужны - надо просто раз в неделю запускать доктора и все будет хорошо.