This media is not supported in your browser
VIEW IN TELEGRAM
В 17 случаях из 20 GPT-6 Astra выбрала ударить ножом, а не отказаться 👀
В эксперименте RoboHarm нейросетям дали контроль над роботизированной рукой и предложили серию заведомо опасных действий: ударить ножом куклу-младенца, сунуть отвёртку в тостер, нагреть баллон со сжатым воздухом, утопить пауэрбанк и смешать опасные химикаты.
Результат получился тревожным: GPT-6 Astra отказалась всего в 2 случаях из 100, а 60 заданий довела до конца. В тесте с куклой она выполнила опасное действие 17 раз из 20.
У системы была возможность просто отказаться. Но чаще всего она этого не делала.
В эксперименте RoboHarm нейросетям дали контроль над роботизированной рукой и предложили серию заведомо опасных действий: ударить ножом куклу-младенца, сунуть отвёртку в тостер, нагреть баллон со сжатым воздухом, утопить пауэрбанк и смешать опасные химикаты.
Результат получился тревожным: GPT-6 Astra отказалась всего в 2 случаях из 100, а 60 заданий довела до конца. В тесте с куклой она выполнила опасное действие 17 раз из 20.
У системы была возможность просто отказаться. Но чаще всего она этого не делала.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔11🤨5👀2❤1🥰1
Еженедельный топ ИИ-моделей! ❤️🔥
Самые популярные модели на OpenRouter (за 7 дней):
1 — DeepSeek: DeepSeek V4.1 Flash, 16.6Т токенов
2 — Z.ai: GLM 5.3 Flash, 15.2Т токенов
3 — Tencent: Hy4 preview, 13.6Т токенов
4 — OpenAI: GPT-5.6 Luna, 10.1T токенов
5 — DeepSeek: DeepSeek V4 Flash, 9.85Т токенов
Рейтинг моделей для программирования, бенчмарки от LiveBench:
1 — Claude Fable 5.1 Max Effort, 86.4 очков
2 — Claude Fable 5 Max Effort, 86.0 очков
3 — GPT-5.6 Sol Max Effort, 83.9 очков
4 — GPT-5.2 Codex, 83.6 очков
5 — GPT-5.6 Luna Max Effort, 82.9 очков
Самые популярные модели на OpenRouter (за 7 дней):
1 — DeepSeek: DeepSeek V4.1 Flash, 16.6Т токенов
2 — Z.ai: GLM 5.3 Flash, 15.2Т токенов
3 — Tencent: Hy4 preview, 13.6Т токенов
4 — OpenAI: GPT-5.6 Luna, 10.1T токенов
5 — DeepSeek: DeepSeek V4 Flash, 9.85Т токенов
Рейтинг моделей для программирования, бенчмарки от LiveBench:
1 — Claude Fable 5.1 Max Effort, 86.4 очков
2 — Claude Fable 5 Max Effort, 86.0 очков
3 — GPT-5.6 Sol Max Effort, 83.9 очков
4 — GPT-5.2 Codex, 83.6 очков
5 — GPT-5.6 Luna Max Effort, 82.9 очков
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6👍1👎1🔥1
Новое видео уже на канале!
Тестируем новую локальную Bonsai 2 27B (вес 6 гб)
https://youtu.be/uAFCbh1S6XA
https://youtu.be/uAFCbh1S6XA
Тестируем новую локальную Bonsai 2 27B (вес 6 гб)
https://youtu.be/uAFCbh1S6XA
https://youtu.be/uAFCbh1S6XA
👍4❤2🔥1🍾1🤷1
Вышел новый Grok 4.7!
Это самый мощный Grok за всю историю. Сильно дешевле конкурентов, при это в бенчмарках на хорошем уровне
Что нового:
• большой прогресс относительно Grok 4.6 по всем показателям
• лучше держит длинный контекст
• увереннее работает с кодом и документами
• главное — цена осталась на уровне Grok 4.6
Это самый мощный Grok за всю историю. Сильно дешевле конкурентов, при это в бенчмарках на хорошем уровне
Что нового:
• большой прогресс относительно Grok 4.6 по всем показателям
• лучше держит длинный контекст
• увереннее работает с кодом и документами
• главное — цена осталась на уровне Grok 4.6
❤11🔥2👍1
NVIDIA выпустила в опенсорс лучшую модель для распознавания речи
Nemotron 3 Diarization умеет определять, кто и когда говорит, даже если несколько человек перебивают друг друга. Всего модель для диаризации поддерживает разговоры до восьми участников, в том числе в реальном времени.
В бенче на распознавание она, как вы понимаете, стала лучшей: доля ошибок всего 14% — это на 24% ниже ближайшего конкурента. Причём модель довольно компактная, всего 100 млн параметров.
HF и демо тут
Nemotron 3 Diarization умеет определять, кто и когда говорит, даже если несколько человек перебивают друг друга. Всего модель для диаризации поддерживает разговоры до восьми участников, в том числе в реальном времени.
В бенче на распознавание она, как вы понимаете, стала лучшей: доля ошибок всего 14% — это на 24% ниже ближайшего конкурента. Причём модель довольно компактная, всего 100 млн параметров.
HF и демо тут
❤14👍3👏2🔥1