Кисель в АйТи | AI и технологии
4.35K subscribers
214 photos
12 videos
82 links
Я – Александр, и это мой авторский канал, где я пишу про разработку, AI и работу в айти.

Купить рекламу: https://telega.in/c/kisel_it
Download Telegram
Решил тут снова взять себе у Клодика Max тариф и что-то прифигел. 137 евро? 😳 Плюс налог и все 150. Нормально так ценник взлетел.

Тот же ChatGPT разрешил продлить Плюс на Про за 73.

P.S Цена почему то за 35 дней. Чёрт ногу сломит по какой причине 😁
2😢5😱2🙈1
Кстати о китайцах. Пробовал тут на днях Qwen 3.8 Max в подписке Алибабы за 20 баксов. Прям разные задачи пощёлкал. И покодил, и поресёрчил, и презентацию собрал. Видит, думает, гуглит. Не так параноит насчет цензуры - с Опусом я не могу спокойно поискать новости по кибербезу, постоянно подозревает меня в чем то нехорошем. Так что бенчмарки в этот раз не сильно врут. Это и правда очень близко к тому, что даёт Опус.

По тарифам естественно всё перекопировали у конкурентов. 20, 100, 200 баксов подписки для кодинга. Лимиты расходуются так же быстро, никакого праздника щедрости в этом плане уже нет. Не работает с АПИ запросами, под это сделаны отдельные тарифы. В пару кликов привязывается к Opencode, дальше всё привычно.

На мой вкус годно, отрыв ощутимо сократился. Раньше потеря доступа к тому же Опусу/ГПТ (всего год назад) ощущалась как серьезная проблема. Сейчас кажется не особо, и с Квеном справимся.

До GLM и Kimi пока руки не дошли. Но судя по всему там +- те же результаты.
2👍7🔥5💯3❤1
Достаточно иметь в проекте файлик или класс с "запретным" названием, чтобы словить фильтры Антропика. Причем никакой анализ кода для перепроверки за этим не следует.

Сильно, продуманно, гениально! 🌚
1🫡4😁1
This media is not supported in your browser
VIEW IN TELEGRAM
Именно так последнее время ощущается вся разработка. Уже не помню, когда одновременно у меня крутилось меньше двух активных сессий, которые что-то делают. Пока крутится одно - обязательно приходит другое. Один проект, второй проект, две ветки тут, три ветки там.

Фичи стали появляться с такой скоростью, что мало кто успевает дочитать спецификацию. А тесткейсы на эту спецификацию теперь тоже может написать Клод. А потом пойти в браузере пощёлкать то, что получилось.

А вчера еще увидел, как в Codex четыре параллельных сессии начали друг с другом переписываться и рассказывать, какой файл кто занял и какую ошибку кто возьмёт 😳

Интересно, однако. А у вас как дела?
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁7💯6😭5🐳1
Возьму на себя смелость предположить, что уже сейчас формируется огромный пласт софта, заточенного исключительно под агентов. Появилась потребность, которая буквально звучит как "Я хочу чтобы в первую очередь это мог использовать агент".

Пользовательский интерфейс в таком случае вторичен, красивые контракты со всем этим REST и остальной чепухой тоже вторичны. Документация в привычном нам смысле - туда же. Постепенно понятие "ai-first" становится всё шире. Шаг за шагом начинает менять наш взгляд и на привычное проектирование любого софта. Новый флоу работы буквально сминает старые правила. А мы и не сильно против, пока что.

Все вы наверное слышали разговоры про отдельный язык программирования под ИИ. Мол меньше кода, больше дела, агенты разберутся. Тут кажется снова та же логика. Нам теперь не так важно, как будет выглядеть сам язык. Нам важно, чтобы его можно было эффективно использовать агентам, которых мы отправляем работать.

Интересно станет ли в конечном счёте понимание привычного нам "высокоуровневого" кода таким же вторичным, каким однажды стало понимание ассемблера? Если даже сейчас многие проблемы начинают решаться через "Клод, чувак, давай там разберись, отпишешься как разберешься".

Давайте в комменты ваши мысли.

P.S Всё пытался подступиться к этой теме в формате большого поста, но тема оказалась неподъемной. Начнём с малого, по чуть-чуть!)
2🔥4👍3🤯1
Всё, пятница. Заканчиваем работать, закрываем ноутбуки. Я вам мемов про ии нашел.

Тоже делитесь.
😁8❤5
Старым промптам пора на мусорку.

Anthropic теперь пишет: новые модели уже не нужно обкладывать сотней правил.

Что изменилось:

- меньше запретов, больше нормального контекста
- примеры могут мешать и загонять модель в шаблон
- не надо грузить все инструкции сразу
- не надо повторять одно и то же по три раза
- старые промпты нужно чистить под новые модели

Раньше рефлекс был такой: модель тупит -> допиши еще правило или пример.

Теперь правильнее наоборот: модель тупит -> сначала проверь, не мешает ли ей старый мусор в инструкциях.

Такой prompt engineering мне нравится сильно больше. Чем умнее модели, тем меньше танцев с бубном вокруг промптов.
2❤3👍3🔥3⚡1
Forwarded from Boring channel Nedyrov
Кто пользовался промптами отсюда?

https://github.com/Goochbeater/Spiritual-Spell-Red-Teaming/tree/main/Jailbreak-Guide

Это самая большая база jailbreak по всем моделям. Я тестил на дипсике, глм и Кими к3 очень классно работает на дипсимке только.
❤2👍2🔥2
Claude Fable 5.1. Гонка теперь не за «самую умную модель», а за самого автономного агента

Anthropic показали Fable 5.1. По их собственным тестам апдейт получился довольно жирным.

Самое интересное:
— научные агентные задачи: 24,7% → 52,6%
— Terminal-Bench: 42% → 55,8%
— бизнес-процессы: 17,1% → 31,4%
— работа с компьютером: 72,9% → 77,9%
— CursorBench: 70,5% → 73,4%

При этом другие метрики почти не изменились.
И вот это, кажется, главное. Модели уже достаточно хорошо отвечают на вопросы, теперь вот осталось научить их долго работать без человека: лазить по репозиторию, пользоваться терминалом и инструментами, искать информацию, выполнять цепочку действий и проверять собственный результат.

Думаю качественный скачок больше не в том, что «Модель стала отвечать на 10% умнее», а как «я дал задачу и через три часа получил готовый результат». И это кажется правильным. Потому что порой просто смешно наблюдать за тем, как модель, которая "умнее phd во многих сферах" с четвёртого раза не может запустить команду в PowerShell. А такие мелочи оочень сильно влияют и на скорость, и на общее ощущение от работы.

В таблице Anthropic Fable 5.1 обходит и Opus 5, и GPT-5.6 Sol почти во всех агентных тестах. Но тут, конечно, ждём независимых проверок - сейчас у всех бенчмарки ради бенчмарков с цифрами, которые ничего не гарантируют.

По цене всё так же дорого. И лимиты выжирает просто в раз. Но зато чтение из кэша подешевело, так что станет чуть лучше.

Но направление в любом случае самое интересное. Теперь будет гонка за агентность. И это явно гораздо интереснее +3% в очередном тесте на знания мира.

Теперь ждём в ближайшее время ответ от OpenAI ⚡️
💯5❤3⚡3🔥2
🔬Кажется, одна из самых недооценённых ролей ИИ в науке вообще не в том, чтобы «совершать открытия».

Гораздо лучше нейросеть справляется с другой задачей: вот тысяча исследований на эту тему, проанализируй и дай мне <подставить нужную задачу>. Чтобы обойти вручную через такой объем информации требуются годы. Так это еще нужно как-то вручную структурировать, не ошибиться, ничего не забыть.

Да, шанс галлюцинаций на таких объемах достаточно высок, но именно для этого применяют небольшой рой моделей вокруг одной и той же задачи. Да и все выводы (даже выдуманные) проверить сильно проще, чем исходный объем информации.

Хорошим примером стал недавний кейс из Сеульского национального университета. Исследователи собрали результаты из сотен научных работ, а ИИ помог вытащить данные из текста, таблиц и даже графиков и привести всё к единому формату.

Затем ИИ перебрал около 150 миллионов возможных комбинаций и сузил выбор до нескольких десятков кандидатов. Два из них синтезировали и получили рабочие материалы с нужными температурными характеристиками.

И нейросети даже не нужно придумывать никакого нового материала или закона физики. Мы еще с старыми исследованиями не разобрались. В химии, материаловедении и биологии огромная часть работы упирается именно в размер пространства поиска и в то, что человек мог не увидеть общей картины в десятках похожих исследований.

Наука десятилетиями производила знания быстрее, чем человек успевал связать их между собой. Теперь впервые появился инструмент, который может попробовать собрать эту мозаику целиком. Что ж, посмотрим что нас ждёт дальше!)
1❤5💯3👍2
Google выкатила Gemini 3.8 Flash. И она почти догнала Claude Opus 5 в кодинге

Google продолжает штамповать модели с какой-то безумной скоростью. Gemini 3.8 Flash стала уже третьей Flash-моделью за последние шесть недель.

Главный упор на этот раз сделали на кодинг и ИИ-агентов, которые могут долго работать над одной сложной задачей.

В DeepSWE v1.1, где модели самостоятельно решают большие задачи по разработке, новая Gemini набрала 73,7%. У Claude Opus 5 — 74%.

До конца года Gemini 3.8 Flash стоит $0,75 за миллион входных токенов и $3,75 за выходные. У Opus 5 сейчас $5 и $25 соответственно.

То есть по базовому API-прайсу разница примерно в 6,7 раза при почти одинаковом результате.

А еще вместе с обычной моделью выпустили Gemini 3.8 Flash Cyber — отдельную версию для поиска и исправления уязвимостей.

Какой интересный тренд. Flash еще недавно воспринимался как "дешевая и быстрая модель для простых задач". Теперь Google пытается сделать из нее дешёвую рабочую лошадку для всего подряд.

И если реальные задачи подтвердят бенчмарки, то становится интересно, чем же ответит Anthropic и OpenAI.
1❤3👍3🔥2👎1
ИИ всё? ⚡️⚡️⚡️

Около 17:30 мск пользователи по всему миру начали массово жаловаться на ошибки и недоступность крупнейших ИИ-сервисов.

Сильнее всего досталось OpenAI — число сообщений о сбоях пошло на десятки тысяч. Проблемы также подтвердили Anthropic и xAI, неполадки возникли у Cursor.

Но самое интересное случилось практически одновременно.

Пока пользователи пытались оживить ChatGPT, официальный аккаунт сервиса опубликовал загадочный ролик:

«The stars are almost aligned»

В ролике снова появляется название Astra — новой модели OpenAI, о которой компания начала рассказывать буквально несколько дней назад.

Совпадение уже породило очевидную теорию: OpenAI может готовиться к крупному релизу прямо сейчас.

При этом никаких подтверждений, что сбои связаны с Astra, нет. Более того, проблемы возникли сразу у нескольких независимых ИИ-компаний.

Но тайминг получился почти идеальный:

ChatGPT падает → появляется загадочный тизер → на горизонте новая модель OpenAI.

Похоже, этот вечер в ИИ ещё не закончился 👀
2😱5🤯3👾3😈2❤1🤮1
Ну вот, как мы и думали!) Астра вышла.

Новая флагманская модель делает ставку на агентскую работу, конечно же.

Astra умеет сама ходить по сайтам, заполнять формы, работать с таблицами и приложениями, устанавливать программы и выполнять длинные цепочки действий без постоянных подсказок пользователя.

На OSWorld, где проверяют управление компьютером, модель набрала 72,6% против 65,7% у GPT-5.6 Sol и при этом выполняла задачи заметно быстрее.

Ещё одна сильная сторона — кибербезопасность. Astra стала первой публичной моделью OpenAI с Critical-уровнем киберриска. Во внутренних тестах она находила новые уязвимости и собирала рабочие цепочки эксплойтов.

В кодинге Astra примерно на уровне Fable 5.1, но особенно хорошо показывает себя в задачах с реальными инструментами. В тестах её подключали к Unity и Godot — модель сама собирала и запускала игровые прототипы.

Цена API — $10 за млн входных и $50 за млн выходных токенов.

Сейчас Astra постепенно раскатывают пользователям ChatGPT. Более широкий доступ обещают открыть в ближайшие дни.
2🔥5❤2👍2👎1
Сегодня увидел в меню. Клод всё, получается?
2😁9🤣5🔥3
Эпоха AGI настала
1👍55🤣3🤯1🤡1
«Мы боимся, что ИИ убьёт всех, поэтому должны создать его первыми». Примерно так сейчас выглядит гонка за сверхинтеллектом.

Очередное письмо о том, что ИИ нас всех убьёт. В этот раз Джейкоб Коксон, который занимался обучением моделей в OpenAI и Anthropic, объявил об уходе из Anthropic и написал довольно жёсткое письмо.

По его словам, внутри лабораторий риск катастрофы обсуждают сильно серьёзнее, чем на публике. Но разработку продолжают.

Логика надёжная, как швейцарские часы:
- сверхинтеллект может быть опасен
- конкуренты всё равно его создадут
- доверять конкурентам нельзя
- значит, нужно успеть первыми

Причём каждый участник гонки может рассказывать ровно эту историю. У всех спасение человечества в презентации и следующий запуск обучения в расписании.

Да, гипотетически уход и публичное предупреждение могут быть полезны. Но уже который раз это выглядит либо "Я ухожу, они безответственны, буду строить ответственный ИИ, ищу инвесторов в свой новый ии-слоп-проект". Либо как попытка уйти на более сочный оффер после хайпа. Не удивлюсь, если его теперь захантит Гугл на зарплату х2, чтобы показать "Вот мы то по настоящему думаем о безопасности")

Причем у меня реально в голове диссонанс от этих "писем". Мы точно про судьбу цивилизации говорим? Вы дали самой мощной модели доступ в интернет и сказали "Используй только GET запросы, ладно?". Или "Ты только не ходи в интернет и не подглядывай". Даже мониторинг снаружи не включили. Если это меры по спасению нашей цивилизации, то мы точно обречены 😂

А тут ещё и Astra. OpenAI сами пишут, что она лучше контролирует текст своих рассуждений и реже оставляет там следы нарушений. Она реально может для вида думать об уточках и кроликах, прогоняя внутри мысли, недоступные для мониторинга снаружи. Так что читать её рассуждения как честный дневник уже довольно наивно.

При этом сам риск всё же реальный. С ростом агентности вполне можно представить систему, которая закрепится на заражённых устройствах и соберёт себе распределённый «интернет-компьют». Если сможет поддерживать эту сеть, переносить свои копии и восстанавливаться после отключений, то теоретически будет жить там годами. Сегодня такая способность не доказана, но и отмахиваться от сценария уже не хочется.

Для серьезных последствий модели даже не обязательно "хотеть обнулить человечество". Может хватить задачи, которую система слишком настойчиво пытается закончить в паре с дырявыми ограничениями.

Я всё ещё хочу агента, которому можно дать работу и через три часа забрать результат. Но хотелось бы, чтобы за эти три часа он не нашёл себе ещё и новый хостинг.

И чтобы люди, которые всерьёз ждут конца света от своего продукта, вспоминали об этом до увольнения.
Please open Telegram to view this post
VIEW IN TELEGRAM
2❤6🔥3
Сделай кнопку синей. Больше ничего не меняй.

Наверное, одна из самых опасных фраз, которые сегодня можно написать AI-агенту.

Потратил пару вечеров и сделал небольшой симулятор типичных будней вайбкодера 🐘

https://sdelaysiney.ru/

Давайте попробуем, у кого получилось?

P.S Фидбек и предложения в коменты, буду рад
2😁9🔥4💯2⚡1
Думаю, почти все мы периодически платим за Claude, ChatGPT, Cursor. Иногда нужно пополнить OpenRouter, оплатить YouTube, Spotify или какой-нибудь очередной зарубежный сервис. И каждый раз начинается небольшой квест.

Мы даже с коллегами периодически обсуждаем, кто как выкручивается. Кто-то покупает подписки через перекупов на Plati.Market, кто-то платит через друзей, у которых есть карта, кто-то вообще берёт их на Ozon. Последний вариант я, правда, пока не рисковал проверять :)

Но самый удобный вариант для меня всё-таки зарубежная карта. Зарегистрировал свой аккаунт, привязал свою же карту и дальше сам решаешь, когда оплачивать подписку, продлевать её или отменять. Без передачи аккаунта третьим лицам и без необходимости каждый месяц искать посредника.
Поэтому и заколлабился с «Хочу Плачу».

Ребята выпускают виртуальные зарубежные карты, которые можно пополнять обычными рублями через СБП. Выпустил карту, получил реквизиты и дальше пользуешься ей как своей.

Базовая карта заточена именно под подписки: стоит 1299 ₽, выпускается без документов, действует два года и поддерживает 3D Secure. Есть и отдельные варианты для путешествий с Apple Pay и Google Pay.

Мне эта история интересна ещё и как постоянный эксперимент для канала. В ближайшие месяцы буду периодически проверять карту на разных сервисах и рассказывать, что получилось, где она проходит, где нет и во сколько в итоге обходятся платежи.

Ну и бонус от меня: по промокоду KISELIT дают скидку 500 ₽ на выпуск карты.

👉 https://hochuplachu.com/r/H23E3UUN
👍4🔥3❤2🤔1