Forwarded from max.sh
В прошлом году делал пост с подборкой ресурсов для желающих разобраться в деталях RLHF. Одним из ключевых ресурсов была книга довольно уважаемого рисерчера и преподавателя Nathan Lambert.
Сегодня у него вышло обновление. Автор оформил книгу в виде бесплатного мини-курса с видео-лекциями, слайдами и кодом.
Получилось 4 лекции по часу, от введения до математики и реализации.
Лекции на ютубе смотреть тут
Сегодня у него вышло обновление. Автор оформил книгу в виде бесплатного мини-курса с видео-лекциями, слайдами и кодом.
Получилось 4 лекции по часу, от введения до математики и реализации.
Лекции на ютубе смотреть тут
Telegram
max.sh
Подборка ресурсов для изучения RL в контексте LLM
Методы пост-тренировки — RLHF, GRPO, DPO и другие — очень быстро эволюционируют и становятся "повседневным" инструментом ML-инженеров. Это особенно заметно с появлением концепции верифицируемых ревордов (подробнее…
Методы пост-тренировки — RLHF, GRPO, DPO и другие — очень быстро эволюционируют и становятся "повседневным" инструментом ML-инженеров. Это особенно заметно с появлением концепции верифицируемых ревордов (подробнее…
Forwarded from DevFM
Вот и прошёл AI Dev Day. Классное получилось мероприятие. Делюсь выжимкой моего доклада.
Первая часть была посвящена тому, как мы разрабатываем агента в среде разработки. Когда мы начинали, было много скепсиса к агентам, поэтому главной ставкой были фичи, связанные с бесшовным входом в разработку с агентом. Но настоящим вызовом стал адопшен – нужно было сделать так, чтобы агентом начали реально пользоваться. Писали доку, гайдлайны, проводили воркшопы – в общем было очень потно, но в то же время приятно было видеть, как в результате растёт аудиторная метрика.
Ещё один важный момент, влияющий на адопшен, который подтверждается как нашими внутренними исследованиями, так и исследованиями DORA – важно, чтобы были прозрачные политики безопасности, чтобы люди понимали, что можно отправлять в агентов, а что нет.
Вообще агентов сейчас разрабатывают кажется все кому не лень, и при этом по ощущениям не так часто говорят о качестве. Об этом была вторая часть доклада – как подходить к качеству через офлайн и онлайн-метрики на примере еще одного агента для написания запросов к данным.
Для офлайн-метрик мы используем валидационный датасет – прогоняем на нём агента, чтобы не выкатить изменения, которые ухудшают пользовательский опыт.
Но одних офлайн-метрик недостаточно, потому что реальных сценариев сильно больше, чем мы можем собрать в датасете. И говоря уже об онлайн-метриках, важно их строить от сценариев использования. Первое на что смотрим – CJM, так появляются метрики, основанные на пользовательских сценариев. А чтобы сформировать более точечные метрики, мы регулярно разбираем весь фидбек по работе нашего агента – это дорого, но позволяет понимать, что реально происходит в продукте. По результатам таких разборов тоже появляются метрики – например, мы заметили фейковый тул-колинг, пошли разбираться из-за чего такое происходит, а заодно появилась метрика, насколько эта проблема актуальна для наших пользователей.
И ещё заканчивая о метриках – важно не забывать их валидировать, действительно ли метрика измеряет то, что нужно. Иногда об этом забывают, а потом удивляются :)
А кто любит движуху вокруг LLM – 21 марта будет ещё один любопытный митап в офлайн и онлайн форматах.
#devfm #ai
Первая часть была посвящена тому, как мы разрабатываем агента в среде разработки. Когда мы начинали, было много скепсиса к агентам, поэтому главной ставкой были фичи, связанные с бесшовным входом в разработку с агентом. Но настоящим вызовом стал адопшен – нужно было сделать так, чтобы агентом начали реально пользоваться. Писали доку, гайдлайны, проводили воркшопы – в общем было очень потно, но в то же время приятно было видеть, как в результате растёт аудиторная метрика.
Ещё один важный момент, влияющий на адопшен, который подтверждается как нашими внутренними исследованиями, так и исследованиями DORA – важно, чтобы были прозрачные политики безопасности, чтобы люди понимали, что можно отправлять в агентов, а что нет.
Вообще агентов сейчас разрабатывают кажется все кому не лень, и при этом по ощущениям не так часто говорят о качестве. Об этом была вторая часть доклада – как подходить к качеству через офлайн и онлайн-метрики на примере еще одного агента для написания запросов к данным.
Для офлайн-метрик мы используем валидационный датасет – прогоняем на нём агента, чтобы не выкатить изменения, которые ухудшают пользовательский опыт.
Но одних офлайн-метрик недостаточно, потому что реальных сценариев сильно больше, чем мы можем собрать в датасете. И говоря уже об онлайн-метриках, важно их строить от сценариев использования. Первое на что смотрим – CJM, так появляются метрики, основанные на пользовательских сценариев. А чтобы сформировать более точечные метрики, мы регулярно разбираем весь фидбек по работе нашего агента – это дорого, но позволяет понимать, что реально происходит в продукте. По результатам таких разборов тоже появляются метрики – например, мы заметили фейковый тул-колинг, пошли разбираться из-за чего такое происходит, а заодно появилась метрика, насколько эта проблема актуальна для наших пользователей.
И ещё заканчивая о метриках – важно не забывать их валидировать, действительно ли метрика измеряет то, что нужно. Иногда об этом забывают, а потом удивляются :)
А кто любит движуху вокруг LLM – 21 марта будет ещё один любопытный митап в офлайн и онлайн форматах.
#devfm #ai
Telegram
DevFM
The Impact of Generative AI in Software Development (DORA)
Продолжаем обзор отчета DORA.
В третьей и четвёртой главах DORA обсуждают доверие к AI и то, как перевести точечные успехи в массовое внедрение.
Сформулируйте понятные правила использования AI…
Продолжаем обзор отчета DORA.
В третьей и четвёртой главах DORA обсуждают доверие к AI и то, как перевести точечные успехи в массовое внедрение.
Сформулируйте понятные правила использования AI…
Forwarded from DevFM
Я продолжаю экспериментировать с разными штуками, которые позволяют запускать автономную работу агента и выполнять поставленные задачи "под ключ". А то начитаешься всякого на реддите, что "если у вас агент ничем не занят, то вы делаете что-то не так" 🙂
Сейчас пробую Ralphex. Очень любопытная штуковина – под капотом используется Claude Code, но поверх накручена полноценная система управления процессом работы агента.
Начинается всё по классике – нужно любым удобным способом составить план выполнения задачи. Можно использовать встроенную команду
Далее просто запускаю
На самом деле – там много интересного происходит под капотом – рекомендую поэкспериментировать.
#ai #agents
Сейчас пробую Ralphex. Очень любопытная штуковина – под капотом используется Claude Code, но поверх накручена полноценная система управления процессом работы агента.
Начинается всё по классике – нужно любым удобным способом составить план выполнения задачи. Можно использовать встроенную команду
plan. Качественный план для агента – это важно, а здесь особенно важно, потому что когда процесс запущен – вклиниться и что-то подправить уже не получится.Далее просто запускаю
ralphex и машина начинает шуршать – выполнять план по шагам, отмечать прогресс, писать тесты. Последний этап – код-ревью. Если у вас в наличии Codex – то он призывается для ревью. Вообще забавно наблюдать, когда один агент чехвостит другого.На самом деле – там много интересного происходит под капотом – рекомендую поэкспериментировать.
#ai #agents
GitHub
GitHub - umputun/ralphex: Extended Ralph loop for autonomous AI-driven plan execution
Extended Ralph loop for autonomous AI-driven plan execution - umputun/ralphex
Forwarded from Статистика и R в науке и аналитике
Как прокачивать продуктовое мышление?
Чтобы улучшить продуктовое мышление нужнодумать как продукт
Шучу! Или нет.
Давайте сразу договоримся о терминологии, что в рамках этого поста продукт – это решение задачи определённого сегмента потребителей в конкретном контексте (определение честно взяла отсюда). Примеры продуктов – маркетплейс, музыкальный стриминг, сервис такси, даже телеграм-канал можно воспринимать как продукт.
А еще здесь могли быть ваши шутки про продукты в пятерочке🤓
Зачем мыслить как продукт?
Для продуктового аналитика одним из ключевых скиллов является "продуктовое мышление", наравне с остальными хард скиллами: SQL, A/B тесты, дашборды и так далее, потому что аналитик полноценный партнер бизнесу, а не выгружатель данных по запросу.
Поскольку это требуется в работе, то и на собеседованиях очень часто спрашивают на продуктовой/бизнесовой секции.
Я сама раньше писала, что невозможно прокачать продуктовое мышление кроме как непосредственно на работе продуктовым аналитиком. Сейчас согласна с этим частично, потому что так развивается лучше всего, но все-таки можно подготовиться и не будучи продуктовым аналитиком. Хотя конечно это чуть сложнее, чем учить SQL и питон, и даже статистику, но возможно.
Как мыслить как продукт?
Когда я сама переходила в продуктовую аналитику, мне помогло разгонять знакомые мне продукты с точки зрения воронки AARRR, ключевых метрик и моделей монетизации. Глобально идея понять как продукт привлекает пользователей и зарабатывает, какая у него может быть North Start Metric. Можно валидировать свои ответы с помощью нейросети, конечно нейросеть может обмануть, но тут важно скорее мыслить в правильном направлении, детали важны меньше.
Такое упражнение очень хорошо помогает повышать насмотренность и не впадать в ступор при вопросах на собеседовании/в работе. Из побочных эффектов – утомила всех рассуждениями про модели монетизации и рекламу 😁
На собеседованиях могут спросить следующее:
🟡 прикинуть дерево метрик для конкретного продукта (может быть тот продукт куда собеседуетесь или наоборот НЕ тот куда общаетесь и точно не тот, где работаете). Здесь можно заранее подготовить продукт, которым пользуетесь каждый день и примерно разложить дерево метрик.
🟡 описать, на каком этапе развития находится продукт, какие ключевые метрики и вызовы перед ним могут стоять.
🟡 упала метрика, что делать
🟡 запускаем новую фичу, как оценить эффективность внедрения. Это может быть кейс на A/B, но необязательно
Это далеко не все возможные примеры вопросов, но чтобы разобрать детальнее нужен отдельный пост. Ставьте реакции 🔥, в следующий раз могу написать, какие типы вопросов бывают, как к ним готовиться и отвечать 💪
#analytics #собес_PA
Чтобы улучшить продуктовое мышление нужно
Давайте сразу договоримся о терминологии, что в рамках этого поста продукт – это решение задачи определённого сегмента потребителей в конкретном контексте (определение честно взяла отсюда). Примеры продуктов – маркетплейс, музыкальный стриминг, сервис такси, даже телеграм-канал можно воспринимать как продукт.
А еще здесь могли быть ваши шутки про продукты в пятерочке
Зачем мыслить как продукт?
Для продуктового аналитика одним из ключевых скиллов является "продуктовое мышление", наравне с остальными хард скиллами: SQL, A/B тесты, дашборды и так далее, потому что аналитик полноценный партнер бизнесу, а не выгружатель данных по запросу.
Поскольку это требуется в работе, то и на собеседованиях очень часто спрашивают на продуктовой/бизнесовой секции.
Я сама раньше писала, что невозможно прокачать продуктовое мышление кроме как непосредственно на работе продуктовым аналитиком. Сейчас согласна с этим частично, потому что так развивается лучше всего, но все-таки можно подготовиться и не будучи продуктовым аналитиком. Хотя конечно это чуть сложнее, чем учить SQL и питон, и даже статистику, но возможно.
Как мыслить как продукт?
Когда я сама переходила в продуктовую аналитику, мне помогло разгонять знакомые мне продукты с точки зрения воронки AARRR, ключевых метрик и моделей монетизации. Глобально идея понять как продукт привлекает пользователей и зарабатывает, какая у него может быть North Start Metric. Можно валидировать свои ответы с помощью нейросети, конечно нейросеть может обмануть, но тут важно скорее мыслить в правильном направлении, детали важны меньше.
Такое упражнение очень хорошо помогает повышать насмотренность и не впадать в ступор при вопросах на собеседовании/в работе. Из побочных эффектов – утомила всех рассуждениями про модели монетизации и рекламу 😁
На собеседованиях могут спросить следующее:
Это далеко не все возможные примеры вопросов, но чтобы разобрать детальнее нужен отдельный пост. Ставьте реакции 🔥, в следующий раз могу написать, какие типы вопросов бывают, как к ним готовиться и отвечать 💪
#analytics #собес_PA
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from AI for Devs
Agent Harness — звучит круто, да?
И последнее время слышу это определение всё чаще. Но что оно вообще значит?
Есть три уровня работы с харнесом (на картинке):
1. Prompt engineering — формирует инструкции, которые модель получает.
2. Context engineering — управляет тем, что модель видит и когда.
3. Harness engineering — включает оба предыдущих плюс всю прикладную инфраструктуру: оркестрацию инструментов, персистентность состояния, восстановление после ошибок, циклы верификации, обеспечение безопасности и управление жизненным циклом.
Не стоит умалять заслуги людей, которые обучают LLM — за последнее время они сделали огромный шаг вперёд. Но харнесс тоже имеет вес. Например, LangChain поменяли только его, не трогая модель и веса — и поднялись с 30-го на 5-е место в TerminalBench 2.0.
Подробнее про то, как устроены Claude Code, OpenAI, LangChain и где во всём этом харнесс — в новой статье на Хабре.
Рекомендую сохранить, если хотите лучше понимать, как работает ваш агент и как его можно улучшить.
@ai_for_devs
И последнее время слышу это определение всё чаще. Но что оно вообще значит?
Коротко: это вся инфраструктура вокруг LLM — оркестрационный цикл, инструменты, память, управление контекстом, обработка ошибок. Всё, что не LLM.
Есть три уровня работы с харнесом (на картинке):
1. Prompt engineering — формирует инструкции, которые модель получает.
2. Context engineering — управляет тем, что модель видит и когда.
3. Harness engineering — включает оба предыдущих плюс всю прикладную инфраструктуру: оркестрацию инструментов, персистентность состояния, восстановление после ошибок, циклы верификации, обеспечение безопасности и управление жизненным циклом.
Не стоит умалять заслуги людей, которые обучают LLM — за последнее время они сделали огромный шаг вперёд. Но харнесс тоже имеет вес. Например, LangChain поменяли только его, не трогая модель и веса — и поднялись с 30-го на 5-е место в TerminalBench 2.0.
Подробнее про то, как устроены Claude Code, OpenAI, LangChain и где во всём этом харнесс — в новой статье на Хабре.
Рекомендую сохранить, если хотите лучше понимать, как работает ваш агент и как его можно улучшить.
@ai_for_devs
Forwarded from Tensor Banana
Media is too big
VIEW IN TELEGRAM
Создаем персонализированный контент: фанфики, аудиокниги, визуальные новеллы
Это же видео на яндекс диске: https://disk.yandex.ru/i/BKndy2R19qDEMw
Пример на видео - не готовый результат, готовым его сделает нужная вам персонализация (замена персонажей, локаций, привычек, фетишей, голосов и изображений). Читать/смотреть чужие фанфики обычно неинтересно, они слишком плоские и неинтересные. А вот персональный контент это другое дело, за ним будущее.
Я себе уже штук 10 адаптаций сделал: по ситкомам, аниме, книгам. 20-40 глав идеально, потом надоедает. До видео стадии дошло пока 2 тайтла, слишком много действий. По фильмам/книгам с серьезным сюжетом пока не рекомендую делать: будет много несостыковок в сюжете, это будет бесить. Ситкомы и аниме - идеально. Или манга, но тут тоже сложно с консистентностью. Важная фишка которая цепляет - добавление ваших фетишей.
ТЕКСТ:
На вход: субтитры, краткое содержание сюжета
Персонализация: замена персонажей (имен, описаний, привычек, пола)
Добавление нужных фетишей в сюжет
На выход: полноценная глава лайт новеллы или фанфика
LLM: qwen3.5-27b, qwen3.5-35b, GLM-4.7-Flash-abliterated, gemma3-27b
АУДИОКНИГА:
оригинальные голоса + ваши голоса
TTS: silero-tts-v5, qwen3-tts, vibevoice(не рекомендую)
qwen3 TTS API сервер: https://github.com/andimarafioti/faster-qwen3-tts
ВИЗУАЛЬНАЯ НОВЕЛЛА:
На вход: Фоны, основные персонажи
klein-9b-kv-fp8 в режиме редактирования с одной картинкой на вход
Проблемы LLM:
1. LLM не умеют писать длинные главы. Они натренированы на коротких ответах на 1-2 тысячи токенов, что маловато для полноценной главы романа. Если больше - входят в циклы, бредят. Решение - делить главы на части. Потом клеить и просить убрать несостыковки.
2. На русских текстах LLM пишут хуже чем на английском - более шаблонно, чаще входят в лупы. Решение - писать на английском (даже если исходный сериал русский), использовать перевод. Для перевода - gemma3-27b или translategemma-27b.
3. LLM не могут выполнять несколько задач одновременно, например, собрать json с несколькими полями построчно по длинному тексту. Внимание падает, делают ошибки. Решение - делить текст на куски, делить задачу на подзадачи.
4. Расцензуренные LLM хуже выполняют задачи на обработку текста, например, создание промптов для text2image или создание json. А оригинальные LLM иногда могут отказаться от такой задачи, если на вход подается текст с 18+ темами. Решение - жонглировать LLM под задачи.
5. Режим размышлений (reasoning) очень плохо работает с длинными текстами (50-100 строк). Большая вероятность, что LLM войдет в луп. И большая вероятность, что текст на выходе будет в несколько раз короче, чем текст на входе, LLM его сократит, даже если просить не сокращать. Решение - отключаю ризониниг для большинства задач.
6. Режим преобразования манги в художественный текст я пока не победил, есть проблемы с консистентностью сюжета между страницами.
Проблемы TTS:
1. silero-v5 xenia нравится за скорость, но есть проблемы с ударениями. Готового решения с омографами пока нет, все решения косячат. Только топовые LLM типа gemini-3-pro могут правильно расставить все ударения.
2. qwen3-tts не очень стабилен при клонировании голосов - иногда голоса совсем не похожи на оригинал, иногда норм. Пока смирился. У faster-qwen3 скорость примерно в 3 раза выше реалтайма - лайк.
3. vibevoice слишком много галлюцинирует, посторонние звуки мешают. отказался от него
Проблемы klein:
1. Похожесть: если подавать фон и персонажей отдельными картинками похожесть будет очень низкая, лица очень сильно меняет. Решение: подавать одну картинку с программно приклеенными поверх персонажами, так похожеть намного лучше, но они хуже интегрированы в фон. Ищите компромисс, что важнее - похожесть или действия внутри картинки
2. Лишние руки: чем больше персонажей в кадре, тем больше будет рук. Решение: ограничить число персонажей в кадре до 2-3-х + использовать сэмплер res_2s, он делает чуть меньше косяков, но работает в 2 раза дольше.
Этапы создания не влезли, выложу в комментах и на гитхабе.
https://github.com/Mozer/personalized_fan_fiction
Это же видео на яндекс диске: https://disk.yandex.ru/i/BKndy2R19qDEMw
Пример на видео - не готовый результат, готовым его сделает нужная вам персонализация (замена персонажей, локаций, привычек, фетишей, голосов и изображений). Читать/смотреть чужие фанфики обычно неинтересно, они слишком плоские и неинтересные. А вот персональный контент это другое дело, за ним будущее.
Я себе уже штук 10 адаптаций сделал: по ситкомам, аниме, книгам. 20-40 глав идеально, потом надоедает. До видео стадии дошло пока 2 тайтла, слишком много действий. По фильмам/книгам с серьезным сюжетом пока не рекомендую делать: будет много несостыковок в сюжете, это будет бесить. Ситкомы и аниме - идеально. Или манга, но тут тоже сложно с консистентностью. Важная фишка которая цепляет - добавление ваших фетишей.
ТЕКСТ:
На вход: субтитры, краткое содержание сюжета
Персонализация: замена персонажей (имен, описаний, привычек, пола)
Добавление нужных фетишей в сюжет
На выход: полноценная глава лайт новеллы или фанфика
LLM: qwen3.5-27b, qwen3.5-35b, GLM-4.7-Flash-abliterated, gemma3-27b
АУДИОКНИГА:
оригинальные голоса + ваши голоса
TTS: silero-tts-v5, qwen3-tts, vibevoice(не рекомендую)
qwen3 TTS API сервер: https://github.com/andimarafioti/faster-qwen3-tts
ВИЗУАЛЬНАЯ НОВЕЛЛА:
На вход: Фоны, основные персонажи
klein-9b-kv-fp8 в режиме редактирования с одной картинкой на вход
Проблемы LLM:
1. LLM не умеют писать длинные главы. Они натренированы на коротких ответах на 1-2 тысячи токенов, что маловато для полноценной главы романа. Если больше - входят в циклы, бредят. Решение - делить главы на части. Потом клеить и просить убрать несостыковки.
2. На русских текстах LLM пишут хуже чем на английском - более шаблонно, чаще входят в лупы. Решение - писать на английском (даже если исходный сериал русский), использовать перевод. Для перевода - gemma3-27b или translategemma-27b.
3. LLM не могут выполнять несколько задач одновременно, например, собрать json с несколькими полями построчно по длинному тексту. Внимание падает, делают ошибки. Решение - делить текст на куски, делить задачу на подзадачи.
4. Расцензуренные LLM хуже выполняют задачи на обработку текста, например, создание промптов для text2image или создание json. А оригинальные LLM иногда могут отказаться от такой задачи, если на вход подается текст с 18+ темами. Решение - жонглировать LLM под задачи.
5. Режим размышлений (reasoning) очень плохо работает с длинными текстами (50-100 строк). Большая вероятность, что LLM войдет в луп. И большая вероятность, что текст на выходе будет в несколько раз короче, чем текст на входе, LLM его сократит, даже если просить не сокращать. Решение - отключаю ризониниг для большинства задач.
6. Режим преобразования манги в художественный текст я пока не победил, есть проблемы с консистентностью сюжета между страницами.
Проблемы TTS:
1. silero-v5 xenia нравится за скорость, но есть проблемы с ударениями. Готового решения с омографами пока нет, все решения косячат. Только топовые LLM типа gemini-3-pro могут правильно расставить все ударения.
2. qwen3-tts не очень стабилен при клонировании голосов - иногда голоса совсем не похожи на оригинал, иногда норм. Пока смирился. У faster-qwen3 скорость примерно в 3 раза выше реалтайма - лайк.
3. vibevoice слишком много галлюцинирует, посторонние звуки мешают. отказался от него
Проблемы klein:
1. Похожесть: если подавать фон и персонажей отдельными картинками похожесть будет очень низкая, лица очень сильно меняет. Решение: подавать одну картинку с программно приклеенными поверх персонажами, так похожеть намного лучше, но они хуже интегрированы в фон. Ищите компромисс, что важнее - похожесть или действия внутри картинки
2. Лишние руки: чем больше персонажей в кадре, тем больше будет рук. Решение: ограничить число персонажей в кадре до 2-3-х + использовать сэмплер res_2s, он делает чуть меньше косяков, но работает в 2 раза дольше.
Этапы создания не влезли, выложу в комментах и на гитхабе.
https://github.com/Mozer/personalized_fan_fiction
Forwarded from Awesome DL
Когда мы получим realtime видео? Считаю от first principles (Лонгрид)
Мне всегда было интересно предсказывать будущее — на знании будущего можно заработать деньги, лучше определить путь своего развития. А как это делать?
Ответ у меня начал зарождаться в 2023, во время прослушивания интервью Хинтона о будущем искусственного интеллекта. Он упомянул, что скоро LLM будут инференситься на отдельных устройствах (смотря из 2026 так просто выглядит). Для меня это было непонятно — тогда я не задумывался об устройстве памяти, ограничениях вычислений. Я знал только, что есть A100/H100. А оказывается, создание специализированных чипов для инференса конкретной модели — один из самых эффективных методов ускорения, например Taalas, который с оговорками, но выдаёт 16k токенов в секунду, за счёт отсутствия универсальности CUDA и оптимизированного memory bandwidth
И тут я понял: глубинное знание базовых нюансов — скорость вычислений устройства, memory bandwidth — это ключ к пониманию того, где лимиты технологии и какие AI-продукты мы можем получить в ближайшие 5-10 лет (ну если AGI не наступит раньше).
Поэтому я решил сделать расчёты для близкой мне технологии — видеогенерации, а именно realtime видеогенерации: какой сейчас статус, что мы можем получить за счёт ускорения GPU и когда это дойдёт до мобильных устройств.
Сами расчёты — в лонгриде
Интерактивно потыкать и посмотреть как меняться будут предсказания можно — на сайте
Лонгрид
Демо
Enjoy!
Мне всегда было интересно предсказывать будущее — на знании будущего можно заработать деньги, лучше определить путь своего развития. А как это делать?
Ответ у меня начал зарождаться в 2023, во время прослушивания интервью Хинтона о будущем искусственного интеллекта. Он упомянул, что скоро LLM будут инференситься на отдельных устройствах (смотря из 2026 так просто выглядит). Для меня это было непонятно — тогда я не задумывался об устройстве памяти, ограничениях вычислений. Я знал только, что есть A100/H100. А оказывается, создание специализированных чипов для инференса конкретной модели — один из самых эффективных методов ускорения, например Taalas, который с оговорками, но выдаёт 16k токенов в секунду, за счёт отсутствия универсальности CUDA и оптимизированного memory bandwidth
И тут я понял: глубинное знание базовых нюансов — скорость вычислений устройства, memory bandwidth — это ключ к пониманию того, где лимиты технологии и какие AI-продукты мы можем получить в ближайшие 5-10 лет (ну если AGI не наступит раньше).
Поэтому я решил сделать расчёты для близкой мне технологии — видеогенерации, а именно realtime видеогенерации: какой сейчас статус, что мы можем получить за счёт ускорения GPU и когда это дойдёт до мобильных устройств.
Сами расчёты — в лонгриде
Интерактивно потыкать и посмотреть как меняться будут предсказания можно — на сайте
Лонгрид
Демо
Enjoy!
Teletype
First Principles расчёт realtime видеогенерации
Для расчётов нам нужна конкретная архитектура, которую можно разложить на числа. Берём Wan2.1-14B — одну из лучших open-source моделей...
Forwarded from Awesome DL
История о том, как штука для рисования треугольников стала самым важным чипом на планете
Мы все каждый день используем GPU, но мало кто копался в том, какая история за ними стоит. Я решил разобраться с нуля — и больше всего меня зацепила красота инженерных решений: каждое следующее — прямое следствие предыдущего.
Ни одно звено не случайно. Когда видишь эту цепочку целиком — понимаешь, почему GPU устроен именно так.
Лонгрид на ~20 минут с интерактивными демками.
→ anvilarth.github.io/gpu-story.html
Enjoy!
Мы все каждый день используем GPU, но мало кто копался в том, какая история за ними стоит. Я решил разобраться с нуля — и больше всего меня зацепила красота инженерных решений: каждое следующее — прямое следствие предыдущего.
отрисовка треугольников → параллелизм → SIMD → unified cores → CUDA → ML → Tensor CoresНи одно звено не случайно. Когда видишь эту цепочку целиком — понимаешь, почему GPU устроен именно так.
Лонгрид на ~20 минут с интерактивными демками.
→ anvilarth.github.io/gpu-story.html
Enjoy!
anvilarth.github.io
История о том, как штука для рисования треугольников стала самым важным чипом на планете
История GPU от первых принципов
Forwarded from Варим МЛ
Форкнули с Тоником нашу внутреннюю базу знаний по внедрению ИИ в разработку, вырезали оттуда совсем внутрянку и получилась первая версия AI Coding Playbook.
Особенности:
- Основано только на практике, не теоретические советы, а то, что мы пробовали/пробуем в Цельсе
- Настройки и советы заточены под Claude Code, потому что это наш основной инструмент. Их можно в теории перенести и в Codex, и в Cursor, но чаще всего придётся погуглить или спросить ваш инструмент, как его правильно настроить. Само собой, процессные/командные штуки от инструмента зависят слабо
- У нас небольшая техкоманда (25 человек), поэтому некоторые штуки будут неактуальны для бигтеха. например, вопросы безопасности там обычно решаются по-другому (скажем, через единый прокси)
Если есть какой-то фидбек или желание поучаствовать в проекте - пишите мне в Телегу.
#Жека #management #llm
Особенности:
- Основано только на практике, не теоретические советы, а то, что мы пробовали/пробуем в Цельсе
- Настройки и советы заточены под Claude Code, потому что это наш основной инструмент. Их можно в теории перенести и в Codex, и в Cursor, но чаще всего придётся погуглить или спросить ваш инструмент, как его правильно настроить. Само собой, процессные/командные штуки от инструмента зависят слабо
- У нас небольшая техкоманда (25 человек), поэтому некоторые штуки будут неактуальны для бигтеха. например, вопросы безопасности там обычно решаются по-другому (скажем, через единый прокси)
Если есть какой-то фидбек или желание поучаствовать в проекте - пишите мне в Телегу.
#Жека #management #llm
Forwarded from ИТ юрист Быкова Светлана
Где IT-бизнесу жить хорошо в 2026 году
С 2026 года планируют отменить часть привычных льгот для IT, подробно рассказала выше.
Вы проголосовали за пост о налогах в других юрисдикциях. Не смею отказывать 👇
🇦🇪 ОАЭ. Подходит: экспортные IT-компании и SaaS с зарубежными клиентами.
Плюсы:
• 0 % на прибыль до 375 000 AED, выше — 9 %;
• НДС 5 %, нет НДФЛ и соцвзносов;
• фризоны (порядка 20 например, для IT Dubai Silicon Oasis, DSOA) дают полное освобождение от налогов при экспорте услуг
Минусы:
• высокая стоимость содержания (офис, аудит, бухучет);
• нужен физический офис или арендованный коворкинг;
• комплаенс и банковский контроль строже, чем в СНГ.
🇦🇲Армения. Подходит: малые команды, фриланс в разработке, с 2025 года и микроэлектроника.
Плюсы:
• очень простая и быстрая регистрация, можно открыть ИП онлайн;
• налог с оборота 1% и НДФЛ 10 % для аккредитованных IT;
• программы инкубаторов и акселераторов;
• русскоязычная среда, понятное регулирование.
Минусы:
• НДС 20 % при работе на внутренний рынок;
• ограниченный рынок труда и высокая аренда в Ереване.
🇰🇿 Казахстан. Astana Hub. Подходит: средние IT-компании, экспорт и финтех.
Плюсы:
• 0 % корпоративный налог, НДС, НДФЛ соцвзносам;
• льготы закреплены до 2043 года;
• допускается 100 % иностранное владение;
• визы без квот, логистика с РФ.
Минусы:
• сложнее открыть счета для нерезидентов;
• растущий валютный контроль;
• бюрократия вне Astana Hub.
🇺🇿Узбекистан. Подходит: компании с экспортной выручкой и локальными командами.
Плюсы:
• IT Park — 0 % налог на прибыль, НДС и соцналоги;
• НДФЛ 7,5 %;
• льготы на импорт оборудования и ПО;
• простая онлайн-регистрация.
Минусы:
• слабая валютная инфраструктура;
• возможны бюрократические задержки;
🇰🇬Кыргызстан. Подходит: микробизнес и фриланс-команды.
Плюсы:
• IT-парк — 0 % прибыль и НДС, 5 % с зарплат, 0 % взносы;
• Россиянам без виз, простое ИП;
• низкая стоимость ведения бизнеса.
Минусы:
• слабый банковский сектор;
• нестабильность налоговых правил;
• сложно нанимать иностранцев вне СНГ.
Важно понимать, что «переезд» компании подходит не всем. Если вашими ключевыми заказчиками являются субъекты критической информационной инфраструктуры (КИИ) или государственные корпорации, от идеи смены юрисдикции стоит отказаться сразу. Компания с иностранным участием потеряет доступ к госзакупкам, требующим регистрации ПО в российском реестре (РРПО), а также лишится региональных льгот, например, по налогу на имущество.
Принятие решения о смене юрисдикции — это сложный процесс, где нет универсального ответа. Ключ к успеху — в деталях вашего бизнеса: оценки важности налогового резидентства, географии клиентов, локации команды и стабильности банковской системы. Чтобы во всем разобраться - @spbykova, составим индивидуальный план, который поможет вашему IT-бизнесу уверенно чувствовать себя в 2026🤝
Очень жду ❤️ если полезно
С 2026 года планируют отменить часть привычных льгот для IT, подробно рассказала выше.
Вы проголосовали за пост о налогах в других юрисдикциях. Не смею отказывать 👇
🇦🇪 ОАЭ. Подходит: экспортные IT-компании и SaaS с зарубежными клиентами.
Плюсы:
• 0 % на прибыль до 375 000 AED, выше — 9 %;
• НДС 5 %, нет НДФЛ и соцвзносов;
• фризоны (порядка 20 например, для IT Dubai Silicon Oasis, DSOA) дают полное освобождение от налогов при экспорте услуг
Минусы:
• высокая стоимость содержания (офис, аудит, бухучет);
• нужен физический офис или арендованный коворкинг;
• комплаенс и банковский контроль строже, чем в СНГ.
🇦🇲Армения. Подходит: малые команды, фриланс в разработке, с 2025 года и микроэлектроника.
Плюсы:
• очень простая и быстрая регистрация, можно открыть ИП онлайн;
• налог с оборота 1% и НДФЛ 10 % для аккредитованных IT;
• программы инкубаторов и акселераторов;
• русскоязычная среда, понятное регулирование.
Минусы:
• НДС 20 % при работе на внутренний рынок;
• ограниченный рынок труда и высокая аренда в Ереване.
🇰🇿 Казахстан. Astana Hub. Подходит: средние IT-компании, экспорт и финтех.
Плюсы:
• 0 % корпоративный налог, НДС, НДФЛ соцвзносам;
• льготы закреплены до 2043 года;
• допускается 100 % иностранное владение;
• визы без квот, логистика с РФ.
Минусы:
• сложнее открыть счета для нерезидентов;
• растущий валютный контроль;
• бюрократия вне Astana Hub.
🇺🇿Узбекистан. Подходит: компании с экспортной выручкой и локальными командами.
Плюсы:
• IT Park — 0 % налог на прибыль, НДС и соцналоги;
• НДФЛ 7,5 %;
• льготы на импорт оборудования и ПО;
• простая онлайн-регистрация.
Минусы:
• слабая валютная инфраструктура;
• возможны бюрократические задержки;
🇰🇬Кыргызстан. Подходит: микробизнес и фриланс-команды.
Плюсы:
• IT-парк — 0 % прибыль и НДС, 5 % с зарплат, 0 % взносы;
• Россиянам без виз, простое ИП;
• низкая стоимость ведения бизнеса.
Минусы:
• слабый банковский сектор;
• нестабильность налоговых правил;
• сложно нанимать иностранцев вне СНГ.
Важно понимать, что «переезд» компании подходит не всем. Если вашими ключевыми заказчиками являются субъекты критической информационной инфраструктуры (КИИ) или государственные корпорации, от идеи смены юрисдикции стоит отказаться сразу. Компания с иностранным участием потеряет доступ к госзакупкам, требующим регистрации ПО в российском реестре (РРПО), а также лишится региональных льгот, например, по налогу на имущество.
Принятие решения о смене юрисдикции — это сложный процесс, где нет универсального ответа. Ключ к успеху — в деталях вашего бизнеса: оценки важности налогового резидентства, географии клиентов, локации команды и стабильности банковской системы. Чтобы во всем разобраться - @spbykova, составим индивидуальный план, который поможет вашему IT-бизнесу уверенно чувствовать себя в 2026🤝