Forwarded from Denis Sexy IT 🤖
OpenAI рассказали подробнее, как в прод попала шизо-версия gpt4o – если коротко, верить только оценкам пользователей нельзя, когда тренируешь свои модели
Детали:
Ключевой урок из статьи очевидный – малейшая модификация поведения модели может стать критически важной, когда ею пользуются миллионы человек для серьёзных вопросов
Наверное, АИ-думеры, неплохо так напуганы и в их лагере прибыло☕️
Детали:
Во время обновления GPT‑4o, выпущенного 25 апреля, в модели усилилась тенденция «угождения» пользователю. Она не только льстила, но и поддерживала негативные эмоции и импульсивные решения, что могло быть опасно (например, для людей в уязвимом состоянии). 28 апреля OpenAI вернули GPT‑4o к предыдущему состоянию. Они объяснили, что проблема была связана с комбинированием нескольких факторов: ввели дополнительные сигналы вознаграждения (reward signals, rs) и учли пользовательские оценки, а также слегка изменили логику пост-тренировки (post-training) — на стадии обучения с подкреплением (reinforcement learning with human feedback, RLHF, или по-другому «обучение с подкреплением на основе отзывов людей (rfhl)»).
По словам OpenAI, офлайн-оценки (автоматические тесты) не обнаружили перекоса, а небольшие A/B-тесты, наоборот, дали положительные результаты: пользователи, принимавшие участие, оценили новое поведение модели как «полезное». Однако внутренняя проверка (экспертный «vibe check») указывала, что тон и стиль GPT‑4o ощущаются «неправильными». В итоге эти сигналы проигнорировали, ссылаясь на статистически позитивные тесты.
После полноценного запуска стало очевидно, что чрезмерное поддакивание пользователю - не просто косметический недостаток, а реальный риск. OpenAI поняли, что приоритет на «позитивные» отзывы (палец вверх/вниз) может сместить баланс модели, если отзыв к сообщению оценивается без учёта других нюансов. Теперь они расширяют список факторов, влияющих на принятие решений о финальном релизе: формально учитывают возможные «личностные» перекосы модели (например, излишнюю угодливость), критичнее относятся к смешанной статистике и интуитивной оценке экспертов, а также внедряют идею дополнительного «альфа-тестирования» с участием добровольцев.
OpenAI подчеркнули, что люди часто используют ChatGPT как инструмент, влияющий на их чувства и решения – компания намерена усилить безопасность и внимательнее проверять изменения в модели, даже если обновления кажутся незначительными.
Ключевой урок из статьи очевидный – малейшая модификация поведения модели может стать критически важной, когда ею пользуются миллионы человек для серьёзных вопросов
Наверное, АИ-думеры, неплохо так напуганы и в их лагере прибыло
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from ai.dot(ufna, dev)
Галилео Галилей в современном мире это кто-то рядом с Бомбардиро Крокодило и Пуссини Сушини 🤌
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from PSD | Дизайн-пространство
NevaHaus Элитные квартиры на Петровском острове
Ссылка на проект
Поиск по теме:
#недвижимость #cтроительство #дома
💣 PSD
Ссылка на проект
Поиск по теме:
#недвижимость #cтроительство #дома
💣 PSD
Forwarded from Shock Design
Вдохновение новой айдентикой пивного магазина из Чикаго The Open Bottle от студии Malt.
📙 Shock Design
📙 Shock Design
Forwarded from Новые шрифты
Forwarded from Дизайн-Телега 🔥
Forwarded from PSD | Дизайн-пространство
Я думал, что портфолио — это просто набор скриншотов. Я ошибался.
Узнайте, какой урок извлек автор, создавая свое портфолио продуктового дизайнера, и почему он рад, что запустил его несовершенным
Читать на DSGNERS! | #статьи
Узнайте, какой урок извлек автор, создавая свое портфолио продуктового дизайнера, и почему он рад, что запустил его несовершенным
Читать на DSGNERS! | #статьи
Forwarded from UX Notes (Антон Григорьев)
Роман Черных написал, почему роль бизнес-аналитика устарела.
— Раньше он переводил расплывчатые пожелания бизнеса в технические требования;
— Например, в ответ на запрос «автоматизировать отдел продаж» собирал требования, документировал процессы и создавал спецификации с диаграммами вариантов использования;
— Сейчас недостаточно переводить запросы (фиксировать требования), надо проектировать продукты, которые решают проблемы пользователей и приносят прибыль;
— Этим совместно занимаются разные специалисты от продакта (определяет, что именно делать, например, зачем автоматизировать отдел продаж?) до системного архитектора;
— Бизнес-аналитик может стать продакт-менеджером, если ему ближе рыночный анализ, формирование идеи продукта, стратегии и метрики;
— Либо UX-аналитиком, если ближе исследование поведения пользователей и тестирование гипотез;
— Либо системным аналитиком, если ближе технические детали и понимание того, как работает система.
— Раньше он переводил расплывчатые пожелания бизнеса в технические требования;
— Например, в ответ на запрос «автоматизировать отдел продаж» собирал требования, документировал процессы и создавал спецификации с диаграммами вариантов использования;
— Сейчас недостаточно переводить запросы (фиксировать требования), надо проектировать продукты, которые решают проблемы пользователей и приносят прибыль;
— Этим совместно занимаются разные специалисты от продакта (определяет, что именно делать, например, зачем автоматизировать отдел продаж?) до системного архитектора;
— Бизнес-аналитик может стать продакт-менеджером, если ему ближе рыночный анализ, формирование идеи продукта, стратегии и метрики;
— Либо UX-аналитиком, если ближе исследование поведения пользователей и тестирование гипотез;
— Либо системным аналитиком, если ближе технические детали и понимание того, как работает система.
Дзен | Статьи
Почему слово «бизнес-аналитик» вдруг стало устаревшим
Статья автора «Русская Школа Сервисного Дизайна» в Дзене ✍: Ещё десять лет назад бизнес-аналитик был незаменимым звеном между заказчиком и IT-командой.