Иван ака Техкаталист
414 subscribers
196 photos
10 videos
7 files
139 links
Привет Друг, я Иван, Айтишник с Кипра. канал об инвестициях, предпринимательстве и даже 🤖
https://takt.techcatalyst.ru/
https://techcatalyst.ru/

Реклама: @pillarguru
Download Telegram
Forwarded from Msvcp60dll
Короче мой сетап на сегодняшний день таков:

2xGPT PRO MAX ($400)
3xKimi PRO MAX ($600)
4xQwen PRO MAX ($272)

GPT 5.6 Sol Max - самый умный
Kimi K3 Max - сбалансированный
Qwen3.8max - самый талантливый

Но

GPT - самый задушенный в обе стороны:

1) Ему очень много чего нельзя, а все что ему нельзя поверьте сказывается на всём вообще что он делает включая то что ему можно.

2) Каждая следующая ступень ризонинга вверх не просто делает его умнее, а опять же ЗАПРЕЩАЕТ БЫТЬ ГЛУПЕЕ. Отсюда маниакальность и часы/дни там где можно было идеально справиться за минуты. Сотни файлов там где достаточно было кусочка одного, итд.

Причем зацикленность эта из п2 не зашита в модели, а является побочным явлением усугубляющимся в процессе работы. Чем дальше в лес - тем толще эти волки. Поэтому любые ризонинги выше чем Medium надо использовать только чтобы ими думать, но работать ими можно лишь над достаточно узкой/простой задачей, в которой модель просто не успеет сойти с ума и нанести вреда больше чем пользы.

В итоге оказалось что GPT 5.6 Sol MEDIUM - это по-сути тот же GPT 5.5 xhigh только умнее за счет тех свойств что есть у модели независимо от ризонинга. Например у 5.6 глаза гораздо дальше расположены чем у 5.5, и за счет этого она видит те участки задачи которые 5.5 не видит.

Короче я потерял всякий интерес использовать 5.5 когда разобрался в 5.6.

Просто нашего брата поймали за собственную алчность. Ну не может человек из российской глубинки поверить что шилдик на котором написано "почти самая ебаная хуйня для никчемных мразей" это именно то что ему нужно. Такой человек купит любой АБИБАС если на ценнике написано "ЛЮКС"...

Ещё важно что в конфиге настраивается отдельно thinking effort для plan mode, и его-то как раз можно поставить на Max/Ultra.

В итоге я все задачи гоняю через plan mode. 5.6 Sol Max своим маниакальным взглядом выискивает каждую пылинку, и делает план по уровню я думаю местами опережающий возможности GPT 5.5 PRO, тогда как на реализацию этот план уходит 5.6 Sol Medium, который достаточно умен чтобы тупо безошибочно написать весь нужный код и проделать все нужные дела руками.

KIMI

Я довольно быстро понял что Kimi это классная модель, но так же я быстро понял что она в подметки не годится GPT 5.6 в плане интеллекта. Kimi это победитель линейки 5.5 (и то по точности результата в плане числа генерируемых багов или пропущенных напрочь важных зон я бы поспорил), но не 5.6. Даже близко.

Однако KIMI абсолютно непревзойденный дизайнер. Я рисую ей дизайны тупо на kimi.ai кнопка websites. Мне нравилось рисовать Claude Design, но наверно о чем-то говорит что я ни разу после того как открыл Kimi Design по Claude Design не скучал, и не заходил туда даже не смотря на то что у меня есть подписка и на Anthropic, просто я больше это семейство в ростер не отношу, это чисто nice to have для экспериментов и теста новых вещей которые там будут выходить.

Ещё Kimi полезна для того чтобы закидывать ей длинные сессии Codex (у меня в целом почти любые сессии длятся по 15-30-50 часов) и спрашивать прогресс и альтернативное мнение о происходящем в сессии. Закидывать сессии это просто копируем правой кнопкой ебучей мыши ID сессии в GPT APP и вставляем кими и говорим йоу систа глянь плиз как там развиваются события и расскажи мне что думаешь.

Это полезный моушен, который экономит время, снижает стресс, позволяет думать немножко прозорливее наперед. А иногда дает реальную почву для вторжения в сессию кодекса с каким-нибудь громогласным steer.

Кодить самой Kimi так чтобы она сама принимала решения о том что зачем и как кодить - я практически перестал. Если на GPT становится мало ресурсов - самое время поручить Codex'у перестать кодить своими руками и управлять кодинговыми сессиями Kimi.

Это не идеально, потому что я в какой-то момент накопил достаточно наблюдений чтобы сказать с уверенностью: модели ну очень ебано управляют друг-другом. Однако если на кими дохуя лишних лимитов, то даже если эффективность разработки GPT Sol -> Kimi падает в несколько раз - это терпимее чем выдаивать в ноль Кодекс чтобы потом нахуевертить багов с Kimi, и потом фиксить их Кодексом =)))))) Ебал я такое в рот.

Qwen3.8max - был кстати шикарными руками для Codex, но сплыл, потому что скорость его замедлили примерно в 50 раз, а стоимость токенов подозрительно приблизилась к стоимости токенов по API. Таким образом Qwen стал тупо самым дорогим в природе если использовать его в разработке, by far.

Однако, Qwen3.8max - это самый талантливый литератор, способный писать ЛУЧШЕ БОЛЬШИНСТВА ЛЮДЕЙ. Во всяком случае в руках кого-то кто умеет неплохо писать тоже. А умение так хорошо писать не может существовать само по себе. Он тупо шикарно подготовлен в гуманитарном любом деле, и бесполезным это никак не назовешь.

Это значит что он прекрасный компаньон 5.6 Sol и Kimi для каких-нибудь важных затяжных брейнштормов, судья всего что связано с эмиссией любых слов где-либо какой угодно моделью, формулятор контрактов и принципов для других моделей, итд. Чем дольше я с ним практикуюсь - тем больше и лучше я понимаю как и зачем его использовать в мелочах.

Ещё у Qwen есть в CLI всякие фэнси модели типа GLM и других, которые можно дергать и не завидовать что у кого-то есть кошкожена а у тебя нет.

Mythos сосёт писос.

Ну и конечно не стоит забывать что любая модель - это МАКСИМУМ 50% влияния на результат.

Остальные 50% - это ваш собственный харнесс (Agents.md и прочая матрешка логических контрактов которые ЛЛМки будут исполнять каждую сессию или когда обращаются к конкретным репам), ваш навык (я многому научился на прошлой неделе, а значит ранее этого не умел, хотя вайбдрочу с прошлого сентября), ваша нервная система, усидчивость, итд итп.

Чем больше я общаюсь с разными людьми тет-а-тет о вайбкодинге, тем больше понимаю что разрыв между мной и ими растёт, поскольку я продолжаю сидеть ВЕСЬ ДЕНЬ, а они садятся даже не каждый день, и не проводят в процессе больше нескольких часов.

Слушая их, я понимаю что бросать советы через плечо - не принесёт им никакой пользы, как когда-то я понял про консалтинг..
👍1🔥1🦄1
в субботу игрался с DNS записями домена для переопределения всего траффика на techcatalyst.ru, на котором у меня корп почта techcatalyst.ru) и заодно решил удалить делегирование к versel

удивился почему нет писем два дня) позвонил тех дир клиента - сказал что мой ящик их банит))

будьте внимательнее со своими корп ящиками)
😁2🫡1😎1
Forwarded from Msvcp60dll
Люди неоднократно в чатике обсуждали Гонку и Либерманов. Мол разъеб или нет? Не Нео ли это часом с Тринити? А кто кстати из них за Тринити?!

Ну вот вам подсказывают ребята собственноручно что они делают)

За год Гонка запроцессила более 680 миллиардов AI токенов для, внимание, 17 тысяч мемберов.

У одного малюсенького меня только на одной подписке OpenAI сгорело 104,2 миллиарда токенов. А у меня их три… А еще весь этот год у меня был выдаиваемый в ноль Антропик, и за прошедший месяц 8 китайцев.

В сумме я где-то миллиардов 350 токенов спалил за время существования Гонки.

То бишь чуть больше половины от всего что они запроцессили :))))))

Так бывает когда фаундеры не понимают о чем говорят настолько чтобы аж делать это публично, а это на моей памяти никогда ничем полезным не заканчивалось к сожалению)

Если кто помнит мою историю про майонезного барона - это вот примерно так выглядело, только 17 лет назад и в другом сеттинге. Хотя думаю лавэ у него было гораздо больше чем у ребят, а мозгов гораздо меньше :)
😁3🐳2💯2
Вчера в переписке всплыло классическое возражение против Guard:

«Не вижу проблемы. Заключаешь enterprise-соглашение с провайдером AI — и данные твоей компании только твои.»

Разумный аргумент. Anthropic и OpenAI дают DPA/ZDR — юридически данные не идут на обучение и не хранятся дольше нужного. Спорить с этим бессмысленно.

Но тут подмена уровня.
DPA регулирует, что происходит с данными ПОСЛЕ того, как они долетели до вендора.
Guard решает другую задачу — не дать секрету вообще покинуть периметр.

Идеальный контракт с Anthropic не спасёт, если разработчик вставил в промпт пароль от прод-базы. Пароль уже уехал наружу и осел в чужой инфраструктуре — retention policy тут ни при чём, поезд ушёл в момент отправки, а не хранения.

И дальше собеседник сам, не заметив, назвал настоящую боль:

«Гемора больше, чем впрямую с Anthropic и GPT договориться... Но там гемор в другом — SSO, контроли и т.д.»

Вот оно. Половина команды сидит с личных аккаунтов Claude/ChatGPT - без SSO, без единого аудита, без понимания, кто и что туда вставляет. Компания подписывает красивый enterprise-договор с вендором — а по факту работа всё равно идёт мимо него, потому что через личную подписку быстрее.

DPA закрывает бумажный риск. Не закрывает операционный.
🔥3💯1👀1
Forwarded from RoboFuture
Вижу, что многие пришли к идее создавать себе несколько агентов-персонажей для ежедневной работы. Например, Grok Bot - мессенджер, где ты переписываешься со своими агентами, у каждого своя память, виртуалка и личность. Входит в подписку за $300 у грока. Hermes тоже такое сделали - bot mode

Я так живу с конца июля, но придумал как это делать ещё проще и не зависеть от вендора, модели и харнеса

Исторически у нас всегда было два основных режима для ежедневной работы с ИИ:

- Треды (как в ChatGPT) - каждая тема это длинная цепочка, общая память на все диалоги. Плюсы - просто и понятно, минусы - ограничение контекста на один тред, общая память это одна большая куча. Второй крупный минус - vendor lock, вы не можете поменять модель, а если вас забанят (а если вы в РФ то вас обязательно однажды забанят), то это будет потерей всех ваших данных. Сейчас это уже можно расценивать как потерю части мозга

- Директории-проекты (как Claude code / codex cli). Работа над каждым проектом ведется внутри одной директории, все правила по ней - в AGENTS_md, память привязана к проекту (также в харнесе может быть общая память на все проекты). Так сегодня работает большинство айтишников. Минусы - у проектов нет общего контекста, нет переноса знаний. Большой монорепо или workspace в курсоре не спасет

Я предлагаю промежуточный вариант - команда из персонажей (сотрудников). Каждый персонаж это папка с AGENTS_md, MEMORY_md и артефактами (журнал, ключи, инсайты, планы). Это должен быть некий персонаж с именем, базовой личностью, аватаркой (зачем, напишу чуть ниже) и описанным скоупом - набором проектов с которыми он работает (3-10) и набором правил. Все храним и версионируем в git, чтобы не потерять и контролировать. Про навыки в виде git-папок делал подробный доклад недавно

IMHO это золотая середина между первыми двумя подходами. Она с одной стороны позволяет шарить знания между проектами, с другой стороны не валит все знания в одну общую память. Самое главное - такие агенты не зависят от платформы. Вчера у вас openclaw, сегодня Hermes, завтра вообще будет kimi cli - это не важно, ваш персонаж останется с вами!

Название прикольное в голове крутится - мета-харнес 😂

На схеме сверху👆 моя команда, с которой я работаю теперь каждый день

В ней 4 персонажа, которыми я реально решаю все свои рабочие задачи:
- Лора 👩‍🔬 (от LoRA-адаптера) отвечает за ML/DS, ставит эксперименты, помогает писать научные статьи (кстати, сам персонаж создан полностью RalphLoop с нуля и вы могли ее встречать в интернете :))
- Стив 👨‍💻 (как Возняк) - python backend, помогает писать библиотеки, проверяет PR, настраивает CI
- Альфред 🤵 (как дворецкий у Бэтмена) - отвечает за разные доступы, DevOps, менеджерит виртуалки, распределяет GPU, трекает расходы токенов

А еще есть Риззи 👩‍💼 (от reasoning) - моя ассистентка в бытовых делах (придумал ее ещё во времена OpenClaw), планирование поездок, календарь. Это самый старый персонаж и она сделана на другой платформе (Hermes), работает автономно и нужна в основном для того, чтобы тестировать межагентное взаимодействие. Другие агенты могут задать ей вопрос по ssh

Персонажи могут общаться между собой, просто запуская друг друга вот так:
claude -p "Привет, Альфред, это Лора, подскажи какие у нас ключи к openai"

А чтобы они в принципе друг про друга узнали, вся команда описана в корневой директории crew - кто что умеет и за что отвечает.

(Из забавного, мои персонажи периодически не общаются, а просто читают память друг друга, чтобы сэкономить время. Жалко, хорошо, что люди так не умеют :))


Зачем нужна личность? Качества она, очевидно, не добавляет, но мне кажется, что нашему мозгу проще работать с такими сущностями. В конце концов наша цивилизация сформировалась в сообществе, где есть явное разделение труда по ролям. Задачи разные, но ты всегда будешь знать кому что поручить в твоем ближайшем окружении. Так что персонажи нужны не для ИИ, а для нас

Шаблон для создания своей команды я выложил отдельно на github. Но в нем нет никакой магии - вся идея описана в этом посте исчерпывающе, можно брать и использовать
😁1🕊1👀1
Тусанул сегодня в Кибердом на Родчельской, двойственные ощущения
🔥4⚡1🤩1
Мы тестируем новую гипотезу
🏆3👏2
Вайбкодерам придумали новое название — на просторах интернета набирает популярность термин «мясной прокси».

Так называют «специалистов», которые задают вопросы нейронке и просто пересылают готовые ответы коллегам.

Не будем загадывать, но кажется, что мясные прокси исчезнут также быстро, как и появились.
😁3💯1👀1
Forwarded from AI for Devs
⚡️ OpenAI готовят Astra: новая модель набрала 100% на ExploitBench

Astra ещё не вышла, но OpenAI уже рассказали, почему задержали её релиз. Это первая модель компании, достигшая критического уровня кибервозможностей.

По данным OpenAI, Astra достигла 100% на публичном ExploitBench. Из-за риска утечки заданий компания отдельно проверила модель на свежих уязвимостях: там Astra заметно обошла GPT‑5.6 Sol и обнаружила две zero-day-уязвимости.


Модель обещают выпустить скоро, но самые мощные кибервозможности сначала откроют только небольшой группе тестировщиков.

@ai_for_devs
⚡3🤩2👀2
Guard настолько эффективно работает на локальных и прод машинах что маскирует вообще все)
1🤩4❤3🔥2
Как говориться - скриньте
Российские дата-центры могут передать под временное управление государства

#аналоговнет

Крупные российские ЦОДы могут попасть под действие президентского указа № 604, разрешающего вводить временное государственное управление на объектах критической инфраструктуры с недостаточной защитой. По умолчанию роль управляющего получит Росимущество.

LH | News | OSINT | AI
🤨3👀1🗿1
Forwarded from e/acc
продолжаю тему: как готовиться и чему учиться к post-AGI миру

1. желать глубины
сегодня любой чат может сделать вообще любую задачу, его достаточно просто попросить. но без контекста, без конкретики и без четкого описания идеального результата он сделает слоп. в итоге для мира эта задача, возможно, лучше вообще была бы не сделана, чем сделана как слоп.

чтобы стать безумно богатым и успешным (то есть, решать задачи полезные для мира лучше чем кто-либо другой), нужно научиться активно искать глубину в любом процессе.

делать руками то, что что можно отдать боту — это бессмысленная трата времени и тупость
но делать скрупулезно и тщательно то, что бот просто пропустил бы — ставить ему задачи, проверять шаги, поправлять, не соглашаться на чуть менее чем идеальный результат — это то что отличает успех от "середнячка"

2. забудьте про названия ролей и должностей
самые неприятные времена ждут тех, кто строил свою идентичность вокруг роли "риск-менеджера" или "перформанс таргетолога". я не верю в эти все названия.

в бизнесе, реальных профессий очень мало: это что-то строить, что-то дистрибутировать и продавать, делать так чтобы процессы работали эффективно.

навыки в профессии это: глубина в своей области + умение работать с ИИ + ясно писать и говорить + существующая аудитория + связи и репутация в мире + активы и капитал.

а как вы это назовете не скажется особо на результате. результат - это решенные проблемы, мир который стал лучше и довольнее от ваших действий.

3. не упускать передний край из виду
это не значит, что если вы не работаете в OpenAI, то все потеряно. но это значит, что нужно пользоваться топовыми инструментами и постоянно их обновлять. я перепробовал все возможные харенсы - warp, cursor, conductor, orca, cc, codex, zed - в итоге остановился на bb, потому что он умеет сам себя переписывать на ходу (отдельно могу рассказать кому интересно). сегодня нанимать человека, который использует практики из 2024 для работы с моделями это как нанимать бухгалтера с деревянными счетами.

4. стройте бренд и дистрибуцию
постепенно, все что делают люди руками становится автоматизировано, кроме отношений между людьми. чем больше людей вас знают и чем больше тех, до кого вы можете достучаться и чем прочнее уровень этих связей, тем ценнее ваш социальный капитал.
🔥4💯1👀1
Forwarded from e/acc
Дженсен поздравляет команду OpenAI с созданием AGI
👀3
Поисковик для ИИ. Будем ли мы пользоваться Google?

В конце августа стало известно, что Keenable вышел из stealth режима и привлёк $26 млн seed-раунда от VC фондов Accel (инвестировали в Slack, Spotify, Atlassian etc.) и Conviction Partners.

Keenable - строит поисковую инфраструктуру специально для ИИ агентов, а не для людей. Компания разработала поисковик, охватывающий более 100 миллиардов документов, и оптимизирует его под запросы, которые делают ИИ-агенты (например, для мониторинга рынка, отслеживания цен и т.д.)

Основатели:
• Андрей Стыскин, ранее отвечал за поиск, ИИ и облако в Яндексе,
• Матиас Петри: немецкий ИИ-учёный
(Вместе они строили поисковую инфраструктуру для агентов Amazon AGI и на собственном опыте увидели, насколько иначе устроены требования к поиску в эпоху ИИ)
Андрей ушел из Amazon в 2025. Тогда же и появился Keenable
*судя по LinkedIn


Чем это отличается от Google и др.
Ключевая идея: Google 25 лет строил поиск для людей: набрал пару слов, кликнул на верхний результат и пошёл дальше. С ИИ всё иначе: агенту может понадобиться прочитать тысячу страниц, чтобы ответить на один вопрос.
*К слову, и Google, и Яндекс, и др. тоже трансформируются и выдают ответы через свои ИИ

Из этого вытекают конкретные технические различия:
• Скорость. Real-time поисковый API Keenable по задумке должен помогать агентам обрабатывать запросы быстрее: настолько, чтобы голосовые агенты могли отвечать прямо посреди фразы, а задержка на официальном сайте заявлена менее 250 мс на 95-м персентиле (регион US East).

• Стоимость. Обычный поиск не рассчитан на то, что агент за секунды делает сотни запросов и парсит тысячи страниц. То есть агенты генерируют еще больше запросов для своих ответов. Поэтому отдельная инфраструктура по типу Keenable делает поиск более экономичным за счёт снижения высоких затрат.

• Формат данных. Вместо "10 синих ссылок" для человека, используется Web Query Language – веб-язык запросов для ИИ, который позволяет агентам одновременно извлекать данные из тысяч живых источников и рассуждать над ними.

• Собственная инфраструктура полного стека. Владение всем стеком инфраструктуры позволяет Keenable встраивать инструменты поиска исходя из этих различий, а не пристраивать их позже.


Почему агентам вообще нужен свой поиск?
Раньше поисковики создавались и оптимизировались под людей, у которых нет времени и внимания на то, чтобы сканировать целые веб-страницы. Но раз ИИ чатботы всё чаще используются для поиска и выполнения задач, есть мнение, что нынешнюю инфраструктуру интернета нужно перестроить под ИИ, поскольку боты могут читать и обрабатывать гораздо больший объём информации.

Плюс есть чисто рыночный момент: по словам Стыскина, крайне сложно убедить людей уйти от Google в обычном поиске, но проблема дилеммы инноватора означает, что в агентных запросах гиганта потенциально можно "побить" и небольшая компания вроде Keenable может предложить более экономичное решение для ИИ-компаний. При этом сейчас большинство агентов либо используют обычные поисковые API, либо сами с нуля строят веб-кроулеры. А Keenable хочет закрыть эту нишу готовой инфраструктурой.


Кстати, сейчас стартап открыл несколько ролей, на которые нанимает. Податься на вакансию можно сразу через Ashby.
🔥3🤔1👀1
Давно не выходил в эфир

Операционка поглотила(хотя реклама бизнес курсов предупреждала выходить из нее поскорее)
Поэтому фактически разработка Fleet идет с существенным отставанием от графика

Тем не менее - мы уже интегрировали и дообучаем конфигуратор профессий и агентов

Сейчас я сам активно делегирую часть работы на Агентов "Бухгалтер" и "Юрист" по сверке расчетов, выставлению счетов и актов, а также анализу договоров

К сожалению, последнее слово пока за руководителем, но обучение решит проблему в перспективе
🔥6🎉1🤩1
Я попробовал — агенты пишут дерьмовый код

Допустим, а что ты сделал, чтобы они писали хороший код?

Представьте, что к вам пришел очень продуктивный и крайне способный разработчик. Но есть нюанс — у него амнезия. Ага. Ну то есть его обнуляет каждое утро

Вот тут и кроется жопа. Оказывается, ему недоступно все что мы, человеки, накапливаем в разговорах про красоту кода и архитектурные решения. Именно эти негласные правила и есть требования к коду. «не используй DTO модели», «используй стейтменеджер ххх», «сначала тесты, потом багфикс». Именно по ним мы сравниваем результаты и корчим недовольное лицо, когда агент "не угадал", как надо было сделать работу

Чтобы это исправить, вам нужно сформулировать и положить в репу рядышком:
1. Соглашения. Вы договорились, что используете конкретный фреймворк, практику, подход, паттерн, конкретные библиотеки в угоду другим? Запишите все свои конвенции, в отдельные файлики

2. Архитектурные решения. Решили сменить сборщик? Запретить складывать модели в общую либу, сделать асинхронную загрузку всех страниц? Вынесли DI и вывернули внешние зависимости? Фиксируем в ADR: решение, альтернативы, последствия (MADR формат Майкла Найгарда)

3. Процедурные знания и скрипты. Как профайлить, что запускать, вот тебе скрипт, а вот бейслайн, на что смотреть, как действовать дальше. Все знания которых не хватает модели. Обычно такое пакуют в скиллы, но можно и просто положить файликом

4. Цепочки действий. Если тебе пришли с багом: то делай раз, используй два, не забудь прочитать три, сходи в систему четыре, запусти скрипт, заведи таск, напиши, протестируй, про валидируй, пересобери, пашни, дождись сборки, почини если сломалась, открой в браузере, прокликай, актуализируй статус связанных задач по спеке из файла такого-то

5. Директивы. Фиксируй принципы, поведенческие ожидания. «Следуй DRY, но балансируй здравый смысл KISS”, «Если делаешь интерфейсы, сначала прочитай specs/UX.md», «заработай миллион долларов, не делай ошибок»

И внезапно, после всей проделанной работы оказывается что агент способен выдавать результаты, получше некоторых синьоров, способен брать работу и часами автономно писать код, отлаживать, тестировать, оптимизировать, крутить производительность, фиксить сборки в пайплайнах и так далее
1🔥3👏1👀1