Бесконечный Цикл
376 subscribers
136 photos
38 videos
2 files
160 links
О разработке, программировании, ИИ и прочем айти.
Сайт https://veerdna.ru
Download Telegram
Anthropic анонсировала Sonnet 4.5 как своё очередное достижение в мире ИИ, и теперь модель действительно доступна везде — через API и в приложениях. Sonnet 4.5 позиционируют как самую сильную для автоматизации, кодинга и работы с инструментами — и по факту сейчас она лидирует по индустриальным метрикам, например, в SWE-bench Verified и OSWorld (точность выросла с 42% до 61%, за 4 месяца). Для разработчиков это означает новые возможности по генерации и контролю кода, включая автоматическую работу с файлами, браузером, терминалом, таблицами, плюс возможность сохранять контрольные точки и откатываться к ним, если что-то пошло не так.

Чекпоинты и расширения

В системе Claude Code добавили функцию чекпоинтов : теперь можно сохранить состояние и вернуться назад, что банально снизит количество ручной возни с багами и регрессиями. В освежённом терминале появилась интеграция с VS Code и возможность прямо в чате приложения создавать документы, таблицы и презентации. Параллельно появился Agent SDK — набор инструментов, которыми сама Anthropic пользуется для разработки агентов.

Функционал и производительность

Anthropic подчёркивает, что Sonnet 4.5 справляется с длинными, многоэтапными сценариями: тесты показывают до 30 часов непрерывной работы, при этом модель уверенно ведёт себя в задачах с длинным контекстом, коде и автоматизации. Из примеров - были случаи, когда модель писала 11 тысяч строк кода для аналога Slack и останавливала только по завершении задачи.

Безопасность и защита

Компания заявляет, что теперь это их «most aligned» модель: акцент на борьбе с галлюцинациями, манипуляцией, prompt injection и прочими рисками. Тут опять же всё упирается в фильтры и ограничения, которые порой мешают, а порой реально защищают. ASL-3 фильтры теперь активней обнаруживают опасные входные и выходные данные (особенно там, где речь о безопасности, финансах, биологии и киберугрозах).

Стоимость

Но главный вопрос - это цена. В API цены не менялись: $3 за миллион входных токенов, $15 за миллион исходных. Дорого особенно если нужно переделывать за моделью, а это обычная реальность. В общих случаях, если не использовать длинный контекст или хитрые интеракции с кэшированием, стоимость выстреливает быстро.Если просто установить Claude Code и использовать его как есть, то у меня выходило сжигать 1$ в минуту. А 30 часов это 1800$. Как-то не вяжется с заменой людей по дешевке

Скепсис и реалии внедрения

На практике любая мощная функция ИИ - это не про полную замену человека, а про ускорение рутинных задач. Судя по отзывам Anthropic, модель реально стала лучше: меньше ошибок при редактировании (с 9% до 0% в их тестах), больше успехов при работе с длинным контекстом (до 3 раз), прокачаны редактор кода, поиск уязвимостей и табличная работа. Но если смотреть честно, то приходится всё равно перепроверять код после Claude, особенно если автоматизация «проскакивает» что-то специфичное - а значит, расходы могут быть солидными.

Итог
Резюмируя: Sonnet 4.5 - очередная попытка сделать ИИ агентом для долгих и сложных задач, и в теории это уже ближе к тому, что обещают про «агентов нового уровня». Но в сухом остатке: API стоит дорого, результат часто требует доработки вручную, а реально «автономная» работа всё ещё больше маркетинг, чем автоматизация без контроля. Попробуем, посмотрим, но восторга нет, - как всегда, всё упирается в стоимость и качество доработки

@DevsRoot
👍1
Такие дела. по некомерции юзаю только Rider для C#
Hello from JetBrains,

We are writing to let you know that the data sharing settings for our non-commercial tier will change the next time you update your JetBrains IDE. If you don’t want the settings to be applied, please read further for how to opt out.

We’re now adding the option to allow the collection of detailed code‑related data pertaining to IDE activity, such as edit history, terminal usage, and your interactions with AI features. This may include code snippets, prompt text, and AI responses.

If you’re using a non-commercial license, detailed code‑related data collection will be enabled as part of your next IDE update – you will be notified about the change right inside the IDE. If you wish to disable it, you’ll need to do so manually via the product settings.

If you have questions or would like to learn more, check out our blog post.



Kind regards,
The JetBrains team

Make it happen. With code.


Привет из JetBrains!

Сообщаем вам, что настройки доступа к данным для некоммерческого уровня изменятся при следующем обновлении вашей IDE JetBrains. Если вы не хотите, чтобы эти настройки применялись, ознакомьтесь с информацией о том, как отказаться от них.

Мы добавляем возможность разрешить сбор подробных данных о коде, относящихся к активности в IDE, таких как история изменений, использование терминала и ваше взаимодействие с функциями ИИ. Это могут быть фрагменты кода, текстовые подсказки и ответы ИИ.

Если вы используете некоммерческую лицензию, сбор подробных данных о коде будет включен в рамках следующего обновления вашей IDE — вы получите уведомление об изменении непосредственно в IDE. Если вы хотите отключить сбор данных, вам необходимо сделать это вручную в настройках продукта.

Если у вас есть вопросы или вы хотите узнать больше, ознакомьтесь с нашей записью в блоге.

С уважением,
Команда JetBrains

Вот это и произошло! С кодом.

@DevsRoot
😱1
Гальюны Обнаружены

Исследователи из ETH Zurich и MATS представили прорывной метод обнаружения галлюцинаций в больших языковых моделях в реальном времени.

Разработанная система способна выявлять сфабрикованные сущности — имена, даты, цитаты — прямо во время генерации текста, без необходимости дорогостоящей внешней проверки. Метод фокусируется на обнаружении галлюцинаций на уровне токенов, что позволяет отслеживать достоверность информации по мере её появления.

Подход успешно масштабируется до моделей с 70 миллиардами параметров и показывает значительное превосходство над существующими методами. В тестах на длинных текстах классификаторы достигли AUC 0.90 против 0.71 у предыдущих решений для Llama-3.3-70B.

Удивительно, что система, обученная только на сущностях, эффективно обнаруживает ошибки даже в математических задачах, демонстрируя обобщающую способность за пределами первоначальной цели.

Исследователи опубликовали наборы данных для дальнейшего развития этой технологии, которая может стать важным шагом к созданию более надёжных ИИ-систем для критически важных областей.
https://arxiv.org/pdf/2509.03531

#Программирование #Нейросети #Наука #Технологии
@DevsRoot
❤3
🤣Ну вот и дожили.
Австралийское правительство платит Deloitte Australia почти полмиллиона долларов за независимый экспертный отчёт, а получает литературное произведение с элементами фантастики - от GPT‑4o. И главное: консалтинговый гигант сам потом признаёт, что это всё «случайно» родилось благодаря генеративному ИИ. И всё бы ничего, если бы речь шла о презентации в PowerPoint для пятничной встречи, а не о документе, на котором основывается решение о госавтоматизации штрафов для получателей соцпособий.

Вместо сухих цифр и проверенных источников отчёт оказался полон сказочного материала: ссылки на несуществующие труды уважаемых профессоров, сочинённая судейская цитата из ключевого дела, имя судьи перепутано, а смысл цитаты звучит красиво — но в реальности её никто не произносил. Просто AI решил, что так будет «солиднее».

Сначала Deloitte хранила молчание, пока академик из Сиднейского университета не ткнул носом: ребята, это же типичные галлюцинации нейросети. Версия два. Загрузили тихо, перед длинными выходными, удалили десяток фантазийных ссылок, заменили их новыми - тоже без особой связи с реальностью. Шикарная замена: вместо ошибки в одном источнике - сразу восемь свежих. Творческий подход.

И лишь в разделе методологии, который мало кто читает, скромно признались: да, использовали GPT‑4o. Не для черновика, не для мелких вставок - для устранения «пробелов в прослеживаемости». Иными словами, модель сочинила обоснование задним числом.

Сенатор Дебора О’Нил выразилась лаконично: «У Deloitte проблемы с человеческим интеллектом». Правда, это, видимо, любезный дипломатический способ сказать: «Мы наняли вас за серьёзные деньги, а вы отдали нам текст от робота, который не умеет проверять факты». Она даже посоветовала клиентам вместо контракта с консалтинговым гигантом оформлять подписку на ChatGPT - всё равно выйдет дешевле.

Правительство, кстати, продолжает утверждать, что «суть обзора сохранена». Правда, так и не объясняет, как авторитетные рекомендации могут сохраняться, если лежат на основании, мягко говоря, дырявой методологии. Возможно, магия корпоративного бренда решает всё.

Особая ирония в том, что Deloitte гордо продаёт консультации по внедрению ИИ, зарабатывает миллиарды на этом, и при этом в рекламных материалах предупреждает: каждый вывод искусственного интеллекта должен проверять человек. Видимо, в этот раз проверка была доверена всё тому же ИИ.

Вопрос остаётся открытым: клиент будет работать с Deloitte дальше или попробует вернуть весь гонорар? Пока вернули лишь часть - частичное извинение за работу ниже стандарта. Но для всех крупных консалтинговых домов сигнал очевиден: даже если вы корпорация с громким именем и доходом $107 млрд в год, стоит один раз перестать проверять, что генерирует ваш нейроассистент - и вас начнут сравнивать с подпиской на ChatGPT.

Получается, что будущая борьба за рынок консалтинга будет не столько о том, кто лучше понимает клиента, а о том, у кого GPT врёт чуть меньше.
https://www.theregister.com/2025/10/06/deloitte_ai_report_australia/

@DevsRoot
Please open Telegram to view this post
VIEW IN TELEGRAM
Решил попробовать новую нейросетевую поделку. https://kilocode.ai/models/supernova
Скорее всего очередная хайповая лажа, но посмотрим.

Code Supernova 1 million — это универсальная модель агентного кодирования, поддерживающая ввод изображений, запущенная в скрытом режиме с ранним доступом для пользователей Kilo Code.

Эта передовая модель характеризуется окном контекста в 1 миллион (комбинированный ввод/вывод) с неограниченным использованием — без регулирования, без ограничений.

Что такое скрытая модель? Это модель ИИ, в которой пользователи соглашаются делиться данными об использовании с поставщиком модели, чтобы помочь ей улучшить её. Взамен вы получаете бесплатный доступ к передовым возможностям ИИ в течение ограниченного времени.

Как использовать код Supernova 1M в Kilo Code


Установить Кило-код
Загрузите наше расширение VS Code или плагин JetBrains и присоединяйтесь к более чем 420 000 разработчиков, уже использующих Kilo.

Установить Кило-код

Выберите код Supernova 1 миллион
Щелкните по названию модели под полем подсказки и выберите из списка Code Supernova 1 million


Затестим на C#
UPD:
Наглядно продемонстрировал русские поговорки: Толочь воду в ступе и изображать бурную деятельность.
НО немного получше Qoder, не так много ошибок компиляции.
Хотя как по мне, если агентский код вызывает ошибки компиляции, то это уже не годный агент.


@DevsRoot
Что-то антропик совсем охренели. Еще лимиты порезали.
На картинке результат после обнуления всех лимитов и трех запросов 1 к Sonet и 2 к Opus по одному промпту каждый запрос без дополнительных итераций

@DevsRoot
😢1
Хочу поздравить всех лысых с Днем лысых и свободных. Ура, товарищи!!😁
В общем надо думать. Или Max или Нах

Лимиты Claude Opus действительно стали жёстче: с августа и особенно осенью 2025 количество запросов к Opus на Pro-плане было снизу ограничено примерно 6–8 обращениями в неделю. Новые ограничения вводились по причине перегрузки ресурсов и злоупотребления некоторых пользователей — теперь лимит стал еженедельным, плюс сохраняются 5-часовые «окна», которые тоже могут ограничивать доступ. Юзеры массово жалуются, что новые лимиты режутся ещё строже и теперь «недельный кап» можно выбить всего за пару дней работы, причём почти любой интенсивность на Opus — даже на Pro или Max тарифе.​

Текущие лимиты и их детали
На Pro (20$/мес): 40–80 часов Sonnet 4 и отдельно 6–8 запросов к Opus в неделю, но фактическое количество варьируется и отрабатывается быстро.​

На Max (100$/мес): 140–280 часов Sonnet 4, 15–35 часов Opus 4. На Max (200$/мес): 240–480 часов Sonnet, 24–40 часов Opus.​

Лимиты считаются по токенам, а не по времени: толстые промпты и длинные ответы больше расходуют «кап».​

После достижения лимита можно перейти на менее мощные модели или попытаться купить доп. квоты по API (доступно только на Max).​

Все лимиты сбрасываются в четверг 8:00 по локальному времени (или по UTC).​

На форумах и Reddit пишут, что лимиты ужесточались несколько раз за последние месяцы, причём для Opus особенно.​

Реакция пользователей и обсуждения
Множество жалоб на форумах GitHub, Reddit: люди попадают в недельный лимит за 1–2 дня обычной работы — особенно при работе с Opus на Pro-плане.​

Основная фрустрация: некоторая непрозрачность по реальному расходу, непредсказуемость капа, отсутствие официальной подробной статистики, и резкое снижение доступности Opus даже для платных пользователей.​

Некоторые отмечают, что Pro-план стал менее выгоден, особенно если именно Opus нужен часто и для сложных задач, поскольку капы ограничивают почти любую профессиональную активность.​

Дискуссии о ценности Pro: платная подписка ускоряет Sonnet и даёт приоритет плюс расширяет лимиты на Sonnet, но Opus доступен намного реже — большинство считает, что ради Opus переплата не оправдана, если лимит так мал.​

Многие ищут обходные пути (см. ниже), но стабильного решения пока нет.​

Способы обхода лимитов
Можно оптимизировать промпты и ответы — использовать меньше токенов.​

Пользоваться менее «дорогими» моделями (Sonnet вместо Opus), если задача не критична.​

Покупать доп. токены на Max тарифах, если срочно требуется.​

На некоторых форумах обсуждаются технические хаки по работе с API-квотами и сбросу капа через новые аккаунты или команды (например, /model opus).​

Встречаются советы использовать сторонние платформы, интеграторы (Writingmate, Apidog, TeamGPT, TypingMind), иногда они дают повышенный кап через распределённые квоты.​

Конкретно для 5-часового лимита неофициально работают методы типа "rolling window": лимит считается с последнего сообщения, можно успевать до следующего окна.​

Итог по Pro-плану и совет
Если вам критически нужен Opus — даже Pro-план ограничивает вас жестко, и только Max (особенно за 200$) даёт заметное преимущество.​

Основные плюсы Pro — более быстрый, стабильный Sonnet, приоритетная обработка, но Opus фактически доступен крайне редко.​
@DevsRoot
😢1
Обнова у Ollama
Напомню, что Олама - это самый простой способ поставить LLM локально на комп.

GLM-4.6 и Qwen3-coder-480B доступны в облачном сервисе Ollama и легко интегрируются с привычными вам инструментами. Qwen3-Coder-30B обновлён для более быстрого и надёжного вызова инструментов в новом движке Ollama.

Для старта:

GLM-4.6
ollama run glm-4.6:cloud
Qwen3-Coder-480B
ollama run qwen3-coder:480b-cloud
Для пользователей с объёмом видеопамяти более 300 ГБ qwen3-coder:480b также доступен локально.

@DevsRoot
👍2
🔥agentrouter так понимаю метят на место OpenRouter

Поэтому Сейчас халява. При заходе по ссылке выше и регистрации через Гитхаб, получаете халявные баксы для API использования

Цены тоже хороши:
Codex , RooCode , Qwen Code и Claude Code теперь поддерживаются ! gpt-5-codex интегрируется. Если вам нужны другие клиенты, присоединяйтесь к группе QQ: 1062402186 или напишите по адресу neo@agentrouter.org .

В настоящее время открыта регистрация только на Github и Linux.do. Регистрация по электронной почте/учётной записи не поддерживается. Регистрация по учётной записи и паролю пока не поддерживается.


DeepSeek модели:
- deepseek-r1-0528 - Input: $0.003 / Output: $0.000
- deepseek-v3.1 - Input: $0.003 / Output: $0.000
- deepseek-v3.2 - Input: $0.003 / Output: $0.000

GLM (Zhipu) модели:
- glm-4.5 - Input: $0.003 / Output: $0.000
- glm-4.6 - Input: $0.003 / Output: $0.000

Claude (Anthropic) модели:
- claude-3-5-haiku-20241022 - Input: $3.00 / Output: $15.00
- claude-3-5-sonnet-20240620 - Input: $3.00 / Output: $15.00
- claude-3-5-sonnet-20241022 - Input: $3.00 / Output: $15.00
- claude-3-7-sonnet-20250219 - Input: $3,000 / Output: $15,000


цены для 1 млн токенов
@DevsRoot
🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
вышла нейронка Wan 2.5 от Alibaba. Видео и звук генерируют. Даются бесплатные кредиты для пробы.

Честно говоря некогда с этим баловаться. Я всё жду когда можно будет загрузить книгу, прописать актеров и роли, а тебе выдаст фильм в нужном жанре😁

Попробовать можно тут https://create.wan.video/

@DevsRoot
😁1
Тем временем люди с помощью нейросетей создают весьма годные ролики

Источник

@DevsRoot
💾Anthropic представила крупное обновление Claude, добавив возможность создания и редактирования файлов непосредственно в интерфейсе, а также ограниченный доступ к сети для установки пакетов и библиотек.​

Создание и редактирование файлов
Claude теперь может создавать и редактировать Excel-таблицы (.xlsx), PowerPoint-презентации (.pptx), Word-документы (.docx) и PDF-файлы прямо в диалоге. Вместо получения только текстовых ответов, пользователи могут описать свои потребности и получить готовые к использованию файлы. Функция работает на базе Claude Sonnet 4.5 и использует изолированную вычислительную среду, где Claude пишет и выполняет код на Python и Node.js.​

Основные возможности
Новая функция позволяет превращать анализы в таблицы, идеи в презентации, а исследования в отчеты. Claude может создавать финансовые модели с рабочими формулами, выполнять сложный анализ данных, генерировать визуализации, конвертировать файлы между форматами и даже строить модели машинного обучения. Максимальный размер файла составляет 30 МБ для загрузок и выгрузок.​

Ограниченный доступ к сети
При включении ограниченного доступа к сети Claude получает возможность устанавливать пакеты и библиотеки из одобренных источников. По умолчанию разрешены следующие домены: GitHub, NPM (registry.npmjs.org), PyPI (pypi.org), Yarn, репозитории Ubuntu и сервисы Anthropic. Это позволяет Claude выполнять продвинутый анализ данных, создавать кастомные визуализации и использовать специализированные библиотеки для обработки файлов.​

Управление доступом
Для планов Team и Enterprise администраторы могут настраивать уровни доступа к сети: полное отключение (работа только с предустановленными пакетами), доступ только к пакетным менеджерам (по умолчанию), доступ к пакетным менеджерам и указанным доменам, или полный доступ ко всем доменам. Для планов Pro и Max доступ к сети включен по умолчанию с доступом к одобренным источникам.​

Соображения безопасности
Anthropic предупреждает о потенциальных рисках безопасности. Существует возможность prompt injection атак, когда вредоносные инструкции в загруженных файлах или на веб-сайтах могут заставить Claude загружать и выполнять недоверенный код или отправлять конфиденциальные данные из контекста третьим лицам. Рекомендуется внимательно мониторить работу Claude при использовании функции и останавливать его при подозрительной активности.

💾А Чуть ранее 16 Октября появились Claude Skills


Что такое Claude Skills
Claude Skills — это новая функция, представленная Anthropic 15-16 октября 2025 года, которая превращает Claude в специализированного помощника для конкретных рабочих процессов. Skills представляют собой папки с инструкциями, скриптами и ресурсами, которые Claude автоматически загружает по мере необходимости для выполнения определенных задач.​

Как это работает
Каждый Skill состоит из обязательного файла Skill.md с метаданными (название и описание) и инструкциями в формате Markdown. Дополнительно можно включать исполняемые скрипты на Python или JavaScript, шаблоны документов, корпоративные гайдлайны и справочные материалы. Claude использует систему прогрессивного раскрытия информации: сначала видит список доступных навыков с описаниями, затем при совпадении с задачей загружает полное содержимое Skill.md, и только при необходимости обращается к дополнительным файлам.​

Основные возможности
Skills позволяют автоматизировать рутинные задачи без необходимости каждый раз писать идеальные промпты. Claude сам определяет, какой навык релевантен текущей задаче, что кардинально отличается от Custom GPTs от OpenAI, где все инструкции загружаются сразу. Навыки можно использовать для обеспечения стилистической консистентности текстов, соблюдения корпоративных дизайн-систем и стандартов кода, работы с офисными документами Microsoft 365 (Word, Excel, PowerPoint), и даже для создания сложных рабочих процессов.​

@DevsRoot
Слева https://chat.qwen.ai/
Справа ChatGpt🤣

Жизнь удалась - это когда в пятницу вечером выходишь из дома поужинать и на всякий случай берешь загранпаспорт
С пятницей, много не пейте

Промт для проверки
Крутой чувак вид с зади, идет в сторону огней большого города, голова с корпусом оглядывается назад, рукой приподнимает очки, подмигивает правым глазом, широкая улыбка сверкает зуб золотой, в джинсах в заднем кармане виднеется паспорт. Стиль 3D Art Artstation artist


@DevsRoot
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1