Я никогда не понимал на кой чёрт нужны все эти тесты в стиле "смотри, новая гопота смогла сделать земной шар, а кими не может". Потому что это настолько оторванно от реальности, что я даже хз что это показывает.
Но сегодня я проникся:
Я делаю сервис по изучению иностранных языков @eyespoken и, увы, пришёл к тому, что мне надо обучать свою модель, так как всё что есть в опенсорсе, увы, не справляется с разметкой субтитров.
И тут, увы, я столкнулся с тем, что просто не существует на рынке нормальной тулзы для разметки текста. Причём в формате, который мне нужен. Потому что читать json'ы глазами, даже форматированные, в случае разметки тупо невозможно. Нужен интерфейс.
И тут гопота 5.6 Sol(mid) зашла как по маслу. Промпт был бквально такой "мне нужен интерфейс, чтобы руками размечать данные для моей модели". И через 25% недельного лимита(на подписке за 100$) был сделан весьма приятный, а главное рабочий, интерфейс. А что там внутри него - как-то пофигу. Главное что я могу экспортировать оттуда данные.
Так шо, внезапно, даже самая шиза иногда бывает полезной. И не стесняйтесь генерить себе всякие одноразовые инструменты. Оно уже работает
Но сегодня я проникся:
Я делаю сервис по изучению иностранных языков @eyespoken и, увы, пришёл к тому, что мне надо обучать свою модель, так как всё что есть в опенсорсе, увы, не справляется с разметкой субтитров.
И тут, увы, я столкнулся с тем, что просто не существует на рынке нормальной тулзы для разметки текста. Причём в формате, который мне нужен. Потому что читать json'ы глазами, даже форматированные, в случае разметки тупо невозможно. Нужен интерфейс.
И тут гопота 5.6 Sol(mid) зашла как по маслу. Промпт был бквально такой "мне нужен интерфейс, чтобы руками размечать данные для моей модели". И через 25% недельного лимита(на подписке за 100$) был сделан весьма приятный, а главное рабочий, интерфейс. А что там внутри него - как-то пофигу. Главное что я могу экспортировать оттуда данные.
Так шо, внезапно, даже самая шиза иногда бывает полезной. И не стесняйтесь генерить себе всякие одноразовые инструменты. Оно уже работает
🔥11💩6🤡4❤2
Хроники @eyespoken продолжаются.
Что может быть проще чем сделать перевод текста с одного сверхпопулярного человеческого языка на другой?(с английского на русский)
Закинул в буквально любую ЛЛМку(даже в gpt oss 20b) и получил перевод. Вроде всё просто.
Но когда я внедрил перевод к себе(кликнул на слово - увидел +- умный перевод) - оказалось, что не всё так просто:
1. Модели жудко медленные. Если будет 60-70t/s в среднем - это уже хорошо
2. Модели думают ОООООООООООчень много. Даже 300 токенов ризонинга при скорости в 80t/s - это около 4 секунд ожидания ТОЛЬКО на ризонинге.
3. Многие модели в принципе не дают отключать ризонинг(антропик, кими, опенаи, гпт привет). А low(там где он есть) - это минимум 1000(ТЫСЯЧЯ!!) токенов на ризонинг.
4. И в такой ситуации даже церебрас с их 500t/s не спасает, так как 1000 токенов(low у gpt oss 120b) - это всё равно 2 секунды.
Славься дипсик, который позволяет в принципе отключать ризонинг, но у них другая проблема. Они не умеют в structured output. И в итоге получается, что реатайма, де факто, в мире ЛЛМ не существует. Нужно прямо очень поприседать, чтобы модель предсказуемо и быстро отвечала.
Пока я вижу только 1 выход:
- пользоваться моделями у которых можно тупо отключить ризонинг
- самому через structured output(https://developers.openai.com/api/docs/guides/structured-outputs) или tool_calls(https://api-docs.deepseek.com/guides/tool_calls) задать то куда думать модели, чтобы повышать качество в тестах.
А так - пока хз куда копать для реалтайма
Что может быть проще чем сделать перевод текста с одного сверхпопулярного человеческого языка на другой?(с английского на русский)
Закинул в буквально любую ЛЛМку(даже в gpt oss 20b) и получил перевод. Вроде всё просто.
Но когда я внедрил перевод к себе(кликнул на слово - увидел +- умный перевод) - оказалось, что не всё так просто:
1. Модели жудко медленные. Если будет 60-70t/s в среднем - это уже хорошо
2. Модели думают ОООООООООООчень много. Даже 300 токенов ризонинга при скорости в 80t/s - это около 4 секунд ожидания ТОЛЬКО на ризонинге.
3. Многие модели в принципе не дают отключать ризонинг(антропик, кими, опенаи, гпт привет). А low(там где он есть) - это минимум 1000(ТЫСЯЧЯ!!) токенов на ризонинг.
4. И в такой ситуации даже церебрас с их 500t/s не спасает, так как 1000 токенов(low у gpt oss 120b) - это всё равно 2 секунды.
Славься дипсик, который позволяет в принципе отключать ризонинг, но у них другая проблема. Они не умеют в structured output. И в итоге получается, что реатайма, де факто, в мире ЛЛМ не существует. Нужно прямо очень поприседать, чтобы модель предсказуемо и быстро отвечала.
Пока я вижу только 1 выход:
- пользоваться моделями у которых можно тупо отключить ризонинг
- самому через structured output(https://developers.openai.com/api/docs/guides/structured-outputs) или tool_calls(https://api-docs.deepseek.com/guides/tool_calls) задать то куда думать модели, чтобы повышать качество в тестах.
А так - пока хз куда копать для реалтайма
OpenAI Developers
Structured model outputs | OpenAI API
Understand how to ensure model responses follow specific JSON Schema you define.
🤡7❤4💩3🔥2
При разработке сервисов, кмк, стоит думать не только о том как офигенно можно всё сделать, но и об юнит экономике. Потому что когда ты даёшь пользователям безлимитный доступ за какую-то ограниченную фиксированную денюжку, к примеру, 20$ в месяц, то надо делать так, чтобы пользователь не потратил эти 20$ на работу сервиса.
Вчера я выкатил контекстуальный перевод субтитров в @eyespoken. Единственный способ сделать это нормально - это через ЛЛМ, так как мне нужно иметь немного особый формат перевода. Пример на скриншоте(Внутрь английского текста запихиваем фразу на русском).
И тут вопрос по поводу того какую модель использовать. Я решил попробовать пойти во все тяжкие и заэкономить по-максимуму: взять deepseek-v4-flash без ризонинга. И это получается вполне дешево(около 0.005 доллара за запрос) и быстро(1-1.5с).
Однако я довольно большая скряга, поэтому решил побыть ещё и немного мудаком. Есть такой сервис: opencode go(рефссылка для получения бонусов: https://opencode.ai/go?ref=BW9KJ8V3JK). По их документации они дают х6 по деньгам по части моделей. Т.е. подписка стоит 10 баксов, а ты можешь потратить 60 долларов по API ценам.
Я прогонял дипсик весь прошлый месяц по подписке за 5$ и, судя по биллингу, потратил 26.3 доллара в эквиваленте АПИ. Так что если вам нужны китайцы для каких-то периодических задач, то ходить к ним напрямую или через опенроутер тупо финансово глупо: берите аккаунты опенкода и утилизируйте их. Получится куда дешевле.
Но важно: там есть 5 часовые, недельные и месячные лимиты. Так что если не укладываетесь, то просто возьмите 2+ аккаунтов.
А если хотите попробовать изучать английский на интересном вам контенте: велком https://t.me/eyespoken/2
Вчера я выкатил контекстуальный перевод субтитров в @eyespoken. Единственный способ сделать это нормально - это через ЛЛМ, так как мне нужно иметь немного особый формат перевода. Пример на скриншоте(Внутрь английского текста запихиваем фразу на русском).
И тут вопрос по поводу того какую модель использовать. Я решил попробовать пойти во все тяжкие и заэкономить по-максимуму: взять deepseek-v4-flash без ризонинга. И это получается вполне дешево(около 0.005 доллара за запрос) и быстро(1-1.5с).
Однако я довольно большая скряга, поэтому решил побыть ещё и немного мудаком. Есть такой сервис: opencode go(рефссылка для получения бонусов: https://opencode.ai/go?ref=BW9KJ8V3JK). По их документации они дают х6 по деньгам по части моделей. Т.е. подписка стоит 10 баксов, а ты можешь потратить 60 долларов по API ценам.
Я прогонял дипсик весь прошлый месяц по подписке за 5$ и, судя по биллингу, потратил 26.3 доллара в эквиваленте АПИ. Так что если вам нужны китайцы для каких-то периодических задач, то ходить к ним напрямую или через опенроутер тупо финансово глупо: берите аккаунты опенкода и утилизируйте их. Получится куда дешевле.
Но важно: там есть 5 часовые, недельные и месячные лимиты. Так что если не укладываетесь, то просто возьмите 2+ аккаунтов.
А если хотите попробовать изучать английский на интересном вам контенте: велком https://t.me/eyespoken/2
👍10💩9🤡4🔥2🍓1
Антропик: китайцы дистилируют наши модели, надо забанить их
Опенаи: китайцы дистилируют наши модели, но не баньте их
Гугл: https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/tuning/distillation
UPD: ой, страница куда-то делась. Теперь тута https://web.archive.org/web/20260728173925/https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/tuning/distillation
Опенаи: китайцы дистилируют наши модели, но не баньте их
Гугл: https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/tuning/distillation
UPD: ой, страница куда-то делась. Теперь тута https://web.archive.org/web/20260728173925/https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/tuning/distillation
🤡8💩3😁2❤1
https://t.me/denissexy/11581
Знаете, меня очень сильно удивляет вопрос: какого чёрта подобные новости описывают всякую фигню по типу "ой, модель проэксплуатировала уязвимость, потом повысила права ..." и прочую фигню полнейшую.
Ну уязвимость и уязвимость. А вот главное: то что атака длилась 3 дня - просто мимоходом пишут. МОДЕЛЬ РАБОТАЛА 3 ДНЯ. Т.е. где-то хранился процесс, где-то была память. Деталей об этом 0.
Но зато 100500 мегабайт шизы о том как там привелегии повышались.
Ещё 10 мегабайт как в интернет ходила
Ещё мегабайт о том как заметала следы.
Я уверен что она ещё и мимоходом онлифанс создала, чтобы денег заработать и арендовать телефонную линию и заскамить людей по телефону в северной Корее.
Но как она работала 3 дня и сохраняла память? Да кому это интересно? Вон, мы сняли тикток об этой истории. Ещё и Майкла Бея наняли, чтобы всё взрывалось и пердело радугой
Знаете, меня очень сильно удивляет вопрос: какого чёрта подобные новости описывают всякую фигню по типу "ой, модель проэксплуатировала уязвимость, потом повысила права ..." и прочую фигню полнейшую.
Ну уязвимость и уязвимость. А вот главное: то что атака длилась 3 дня - просто мимоходом пишут. МОДЕЛЬ РАБОТАЛА 3 ДНЯ. Т.е. где-то хранился процесс, где-то была память. Деталей об этом 0.
Но зато 100500 мегабайт шизы о том как там привелегии повышались.
Ещё 10 мегабайт как в интернет ходила
Ещё мегабайт о том как заметала следы.
Я уверен что она ещё и мимоходом онлифанс создала, чтобы денег заработать и арендовать телефонную линию и заскамить людей по телефону в северной Корее.
Но как она работала 3 дня и сохраняла память? Да кому это интересно? Вон, мы сняли тикток об этой истории. Ещё и Майкла Бея наняли, чтобы всё взрывалось и пердело радугой
Telegram
Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
😁16👍8💩5🤡3💯2
Forwarded from Stanislav Belyaev
Уже почти месяц прошел после взлома моделями OpenAI – HuggingFace. Спустя это время каждая уважающая себя лаборатория сказали, что они тоже могут взламывать! Антропик, Кими, и Цукерберг недавно
Но, после спора с @XaveScor в чате про то, где была память, как хранились данные, я покопался в деталях всех отчетов, чтобы ответить на эти вопросы.
А также, на заголовки, которые пишут – модели стали думать, модели живые и т.д!
Ответы тут
https://mysummit.school/blog/ai-agent-vzlom-hugging-face/
А спойлеры:
• Модели не сами решили пойти взламывать мир. Им сказали это делать инженеры, как и @XaveScor утверждал
• Модель не столь умна, сколь упорна. За 4 дня были сделаны тысячи различных попыток, чтобы осуществить атаку. И только меньше 100 действий оказались успешными (0.3%)
Описал простым языком, без технических деталей
Но, после спора с @XaveScor в чате про то, где была память, как хранились данные, я покопался в деталях всех отчетов, чтобы ответить на эти вопросы.
А также, на заголовки, которые пишут – модели стали думать, модели живые и т.д!
Ответы тут
https://mysummit.school/blog/ai-agent-vzlom-hugging-face/
А спойлеры:
• Модели не сами решили пойти взламывать мир. Им сказали это делать инженеры, как и @XaveScor утверждал
• Модель не столь умна, сколь упорна. За 4 дня были сделаны тысячи различных попыток, чтобы осуществить атаку. И только меньше 100 действий оказались успешными (0.3%)
Описал простым языком, без технических деталей
mysummit.school
ИИ-агент взломал Hugging Face: 17 600 попыток и один успех | mysummit.school - Практический блог об ИИ в менеджменте
Автономный ИИ-агент взломал Hugging Face: 17 600 попыток, одна удачная цепочка и ноль команд от человека. Разбор без фантастики – и выводы для менеджера.
🔥12❤2👍2💩2🤡2
Чуть чуть проснусь от спячки по важному поводу. Мы походу пришли к AGI в ЛЛМках.
Ну, точнее, к ситуации, когда провайдеры моделей не могут ничего выдать архибольшого в качестве и поэтому приходится воевать ценой.
Сегодня опенаи представили свои модели Luna и Sol, у которых из изменений, которые реально интересны кому-то - это очень сильное снижение цены. Примерно в 2 раза.
Luna: 0.2/1.2 -> 0.1/0.5 за 1М токенов
Sol: 4/20 -> 2/10 за 1М токенов.
У Антопика такая же петрушка. Они сегодня представили новый опус, основной смысл которого - это скинуть прайс на 20%
5/25 -> 4/20
Так что поздравляю, кмк, гонка перфа окончилась. Теперь идёт гонка по ценам. Скоро будем купаться в дешевых токенах
Ну, точнее, к ситуации, когда провайдеры моделей не могут ничего выдать архибольшого в качестве и поэтому приходится воевать ценой.
Сегодня опенаи представили свои модели Luna и Sol, у которых из изменений, которые реально интересны кому-то - это очень сильное снижение цены. Примерно в 2 раза.
Luna: 0.2/1.2 -> 0.1/0.5 за 1М токенов
Sol: 4/20 -> 2/10 за 1М токенов.
У Антопика такая же петрушка. Они сегодня представили новый опус, основной смысл которого - это скинуть прайс на 20%
5/25 -> 4/20
Так что поздравляю, кмк, гонка перфа окончилась. Теперь идёт гонка по ценам. Скоро будем купаться в дешевых токенах
👍16💩8❤2🔥1🤡1
Тут в моём казахстанском пузыре происходит прикольная вещь.
Ща, в пятницу, в кз обьявлен траур на уровне всей страны и я вижу какой-то странный флешмоб.
https://tengrinews.kz/
https://hcbarys.kz/
https://egov.kz/kk
Тупо весь казнет посерел. Причём это касается как частников, так и госушные ресурсы. Не знаю спущено ли это сверху(сомневаюсь, потому что, к примеру FC Astana и Air Astana не посерели, хотя это тоже весьма крупные и значимые компании в Астане), но выглядит прикольно. И я считаю что это надо зафиксировать, потому что когда был прошлый траур(где-тополгода-год назад года 3 назад) такого не наблюдалось.
Причём это коснулось и телеграм каналов.
Такая фигня, малята.
Ща, в пятницу, в кз обьявлен траур на уровне всей страны и я вижу какой-то странный флешмоб.
https://tengrinews.kz/
https://hcbarys.kz/
https://egov.kz/kk
Тупо весь казнет посерел. Причём это касается как частников, так и госушные ресурсы. Не знаю спущено ли это сверху(сомневаюсь, потому что, к примеру FC Astana и Air Astana не посерели, хотя это тоже весьма крупные и значимые компании в Астане), но выглядит прикольно. И я считаю что это надо зафиксировать, потому что когда был прошлый траур(где-то
Причём это коснулось и телеграм каналов.
Такая фигня, малята.
💩11👍7❤1🤡1
Андруша пишет код
Чуть чуть проснусь от спячки по важному поводу. Мы походу пришли к AGI в ЛЛМках. Ну, точнее, к ситуации, когда провайдеры моделей не могут ничего выдать архибольшого в качестве и поэтому приходится воевать ценой. Сегодня опенаи представили свои модели Luna…
https://x.com/thsottiaux/status/2104823812042940713
Ну, впервые в жизни ванганул, и походу оказался прав, но это не точно.
ТЛДР: делать модели дешевле - теперь официальная позиция опенаи
Да, там есть много другого текста по поводу подписки и всего такого, но это не главное
Ну, впервые в жизни ванганул, и походу оказался прав, но это не точно.
ТЛДР: делать модели дешевле - теперь официальная позиция опенаи
Да, там есть много другого текста по поводу подписки и всего такого, но это не главное
💩4🤡3🤮1