техно-свалка
468 subscribers
71 photos
21 videos
2 files
59 links
Склад AI и техно-экспериментов, robotics и случайных мыслей.
Download Telegram
🎯 Alignment: как ИИ «воспитывают», чтобы он слушался человека

Сырая нейросеть после обучения — это не ChatGPT. Это мощный, но дикий «предсказатель текста»: спросишь «Как сварить кофе?» — она вместо ответа продолжит список вопросов. Чтобы из неё получился послушный помощник, модель проходит выравнивание (alignment) — этап, где её поведение подгоняют под намерения и ценности человека.
🏗 Три этапа: от дикого текста до ассистента
1️⃣ Предобучение (pre-training)
Модель читает терабайты текста и учится предсказывать следующее слово. На выходе — base-модель: знает язык и факты, но вести диалог не умеет.
💰 Самый дорогой этап — месяцы и тысячи видеокарт.
2️⃣ Дообучение на инструкциях (SFT)
Показывают примеры «просьба → хороший ответ». Модель учится следовать командам и держать формат чата. Теперь на «Как сварить кофе?» отвечает по делу.
3️⃣ Выравнивание (alignment) ← вот оно
Модель учат отличать лучший ответ от худшего по человеческим предпочтениям. Здесь появляются вежливость, безопасность и отказы.
🧭 По каким принципам выравнивают: HHH
Ориентир задала Anthropic ещё в 2021-м — три критерия «хорошего» ассистента:
🟢 Helpful — полезный: делает то, что нужно;
🔵 Honest — честный: не выдумывает, признаёт незнание;
🔴 Harmless — безвредный: не выдаёт опасное, отказывает на вредном.
⚖️ Фишка в том, что эти три конфликтуют: запрос бывает полезно выполнить, но вредно — и модель выбирает Harmless, то есть отказывает. Alignment — это по сути настройка баланса между тремя H.
🔧 Чем именно выравнивают
RLHF — люди ранжируют ответы → на этом учат «модель-судью» → ею дообучают основную. Классика ChatGPT.
DPO — проще и дешевле: учат напрямую на парах «лучше / хуже», без отдельного судьи. Сейчас в топе.
Constitutional AI / RLAIF — предпочтения размечает другой ИИ по набору правил («конституции»). Подход Anthropic.
#нейросети #ai #alignment #llm #машинноеобучение #технологии
1🔥20❤‍🔥151210
4DAnyone: открытый фреймворк строит 4D-модель человека из видео, снятого одной камерой

Исследователи из Zhejiang University, Robbyant, Ant Group и HKUST представили 4DAnyone — фреймворк для превращения снятого одной камерой видео с участием человека в 4D-модель этого человека, которую можно крутить и смотреть с любой стороны.

Главное:
▪️ Всего модель генерирует 16 ракурсов, согласованных между собой, а по ним уже собирается объёмная сцена в формате 4D Gaussian Splatting.
▪️ По качеству реконструкции 4DAnyone обходит все существующие методы: 24.15 PSNR против 20.55 у ближайшего конкурента на DNA-Rendering и 23.28 против 19.86 на DyMVHumans.
▪️ К нему добавили синтетический SynCamVideo (34 тыс. видео)
▪️ записи настоящей студии DNA-Rendering (51 тыс.)

🔗 Neurohive · Konstantine Mozgovoy #исследования #paper
1🔥5❤‍🔥3🤔3
OpenAI: у нас уже появился AI-исследователь уровня стажёра

6 сентября OpenAI заявила, что достигла цели, которую ставила на этот год: создать automated research intern.

Под этим они понимают не чат-бота для поиска статей, а систему, которая под руководством человека может самостоятельно выполнить чётко поставленную исследовательскую задачу, на которую специалист потратил бы несколько дней.

Внутри OpenAI это уже меняет сам процесс исследований.

К середине августа на каждый рабочий день исследователя приходилось около 3,1 «рабочего дня» AI-агентов. Исследователи запускают несколько coding agents параллельно, быстрее пишут экспериментальный код и проводят больше экспериментов.

Но важная граница пока остаётся: люди всё ещё выбирают, что исследовать, какие результаты считать перспективными и что запускать дальше. Высокоуровневое планирование занимает лишь небольшую долю работы агентов.

Следующая цель OpenAI намного серьёзнее: полноценный automated AI researcher к марту 2028 года.

Получается интересный переход:

AI помогает исследователю → AI выполняет отдельное исследование → AI сам становится исследователем.

И вот последний переход будет намного важнее очередного роста результатов на бенчмарках.

Источник:
https://openai.com/index/research-acceleration-view-inside-openai/
121🔥16👍9
Media is too big
VIEW IN TELEGRAM
🐞 Жук на резисторах: закон Ома и лапки

Спаяла наборчик "Жук". Ходит на резисторах, они делают две вещи:

1. Защищают светодиоды по закону Ома:
R = (Uпит − Uled) / I = (3−2) / 0.005 = 200 Ом.

2. Служат ногами — выводы не обрезают, а подгибают, вибромотор трясёт, и жук ползёт.

Номинал резистора не пишут цифрами, потому что корпус слишком мелкий. Вместо этого — цветные кольца.
Для варианта с четырьмя кольцами: первые два — цифры, третье — множитель, четвёртое стоит чуть поодаль и означает не значение, а точность.

Пример: коричневый, чёрный, коричневый, золотой = 1, 0, ×10, ±5% = 100 Ом.

Виды резисторов:

· Постоянные — фиксированное сопротивление (именно такие в наборе).
· Переменные — крутилка (потенциометры), меняют сопротивление ручкой.
· Подстроечные — настраиваются один раз отверткой, обычно на платах.
· SMD — плоские чипы для поверхностного монтажа, без выводов.

У резистора полярности нет, у диода есть. Не перегревайте при пайке.

#пайка #DIY #электротехника
Ссылка: https://ozon.ru/t/HqdXCRg
1🔥18❤‍🔥13👾86
Forwarded from Data Secrets
Подробности по решению Навье-Стокса внутренней моделью OpenAI:

– Есть аналитическое доказательство и формализация Lean.

– Доказано, что гладкое течение несжимаемой жидкости в 3D может за конечное время развить сингулярность. То есть скорость в какой-то точке жидкости неограниченно растет, хотя движение начинается гладко и энергия конечна на всем пути.

– Решение – это вихрь, который закручивается вовнутрь и вытягивается типа спагетти. Центральная область сжимается и ускоряется так, что энергия остается конечной. Это доказывает варианты С и D из официальной формулировки Clay Institute.

По поводу скандала с кражей решений интерпретация компании такая:

– С 28 августа OpenAI обучали новую внутреннюю модель, заметно превосходящую GPT-6 Astra. Услышав 1 сентября слухи о том, что решены две проблемы тысячелетия, они запустили мультиагентную систему (до ~10 000 параллельных агентов) для проверки модели на всех открытых проблемах тысячелетия. Агентам давали разные варианты формулировки задачи и доступ к кэшированному интернету и коду.

– По пути агенты разрешили более простой вопрос – регулярность для уравнений Эйлера (практически та же задача, над которой работали Бакмастер и Альпеге, но без условия на forced). Это заняло около 50 часов силами почти 100 агентов.

– После этого ресурсы перебросили на Навье-Стокса; решение нашли через 88 часов после запуска 5 сентября. Еще 17 часов ушло формализацию в Lean.

В общей сложности вышло ~130 млрд токенов.
1❤‍🔥5🔥4😱4
Forwarded from Data Secrets
⚡️ Только что вышел DeepSeek-V4.1-Flash

Многие бенчмарки на уровне Opus 5 и Sol (обратите внимание на DeepSWE). Учитывая, что это модель Flash, самая маленькая из семейства, очень даже круто.

По поводу внутренностей:

– 552В MoE
– Новая асимметричная архитектура Causal Encoder–Decoder: 8В активных параметров на вход, 16В активных на выход
– Новые метода претрейна + более масштабный RL

Оптимизировали KV-кэш. Теперь он занимает еще меньше памяти в пересчете на токен (3 график).

Цены: $0.15/М input, $0.6/M output в непиковые часы. В пик – в два раза выше.

Веса

Статья
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
14🔥3🏆31
Forwarded from Эксплойт
Suno ВСЁ — китайцы выкатили мощнейший опенсорсный генератор музыки.

YuE2-3B превращает текст и описание стиля в полноценную песню с вокалом и инструменталом. В свежем сравнительном тесте модель обошла Suno V5.5 и V5 по общей оценке качества, причём всё это с открытыми весами.

Особенно интересно, как она работает с текстом: модель лучше держит соответствие заданным словам, а среди примеров уже есть треки на русском. Можно генерировать музыку, редактировать мелодию и аккорды и даже управлять композицией через музыкальную партитуру.

Модель можно скачать бесплатно на Hugging Face или сразу потыкать в браузере — здесь.

@exploitex
1👍3🔥3🤔3👎1
Forwarded from Trashchenkov
🧠 GigaChat 3.5 Reasoning
У GigaChat появилась первая модель с полноценным рассуждением — GigaChat 3.5 Reasoning.

Как её делали?
Сначала был SFT: модель обучили на готовых примерах решений, в том числе для агентных сценариев. Это сформировало стартовый набор способов решения для последующего RL.

Дальше из одного SFT-чекпоинта независимо обучили шесть специализированных моделей через online RL: математика и естественные науки, код, агент для кода, универсальный агент, диалог и следование инструкциям.

При online RL модель сама генерирует несколько решений задачи, получает награды за их качество и учится на собственных свежих попытках. Так постепенно закрепляются полезные стратегии: перепроверить результат, вернуться после ошибки, попробовать другой путь. В GigaChat для этого использовали CISPO — алгоритм из работы про MiniMax-M1.

Для каждого эксперта настроили свою схему награды: математические ответы сверяли с эталоном, код запускали, патчи проверяли тестами, в агентных сценариях смотрели на конечное состояние среды, а диалог оценивали через LLM-судью.

Агентов учили отдельно. Code Agent работал с реальными репозиториями через
mini-SWE-agent: читал файлы, запускал команды, правил код и смотрел на результат. General Agent учился вызывать инструменты, работать с памятью и поиском и проходить многошаговые диалоги.

После RL шесть специализированных моделей свели в одну через on-policy distillation: итоговая модель сама генерировала решение, а соответствующий эксперт давал ей обучающий сигнал на каждом токене.

По метрикам прирост заметный относительно GigaChat 3.5 Instant. Например:
SWE-bench Verified: 42,6 → 64,7;
Terminal-Bench 2: 13,48 → 30,3;
Natural Plan: 64 → 80,19.

На задачах AIME 2025/2026, HMMT и IMOAnswerBench новая модель в среднем использовала на 37% меньше токенов рассуждения, чем DeepSeek V4 Flash Preview.

📖 Подробная статья про обучение
⚖️ Веса на Hugging Face и GitVerse — лицензия MIT
🧪 Попробовать в вебе — режим «Рассуждение»
1❤‍🔥65🏆4👎1
"Красный день" для AI-индустрии: топ-менеджеры просят тормозить, рынок паникует 📉🤯

В воскресенье, 13 сентября, произошло нечто из ряда вон выходящее. Глава Anthropic Дарио Амодеи опубликовал эссе «We Must Pace the Frontier», в котором призвал замедлить темпы развития передовых AI-моделей из-за рисков безопасности.

Самое удивительное — его поддержали Сэм Альтман (OpenAI) и Илон Маск. Это редчайший случай единства среди обычно конкурирующих лидеров отрасли.

Амодеи предупредил, что в течение 6–12 месяцев рой AI-агентов может «захватить весь интернет» и нанести ущерб в сотни миллиардов долларов.Альтман заявил, что OpenAI не будет проводить IPO в 2026 году, сосредоточившись на безопасности.

Реакция рынка была мгновенной. В понедельник, 14 сентября, акции AI-компаний по всему миру резко обвалились. SoftBank потерял более 10%, пострадали Nvidia, Intel, ASML, SK Hynix. Reuters назвал это «самой серьёзной угрозой на сегодняшний день для миллиардов долларов, вложенных в эту индустрию».

При этом китайская государственная пресса назвала призывы Anthropic к замедлению развития AI элементом технологической борьбы с Китаем.

Пока неясно, чем закончится этот «тормозной путь», но одно очевидно: эпоха безудержного роста AI-хайпа, похоже, столкнулась с суровой реальностью

#AI #безопасность #рынок #Anthropic #OpenAI
1🔥17❤‍🔥15😱87
This media is not supported in your browser
VIEW IN TELEGRAM
Роботы строят роботов»: массовое производство запущено 🤖🏭

В Китае произошёл тектонический сдвиг в робототехнике. В Лючжоу официально запущен первый в мире завод по массовому производству человекоподобных роботов мощностью более 10 000 единиц в год!

Каждые 10 минут с конвейера сходит один готовый промышленный гуманоид. И да, это буквально «роботы делают роботов» — производство управляется цифровым «мозгом» и системами симуляции, а участие человека сведено к минимуму.

Это не единичный случай. Китайская XPENG тоже не отстаёт: её робот IRON (76 степеней свободы, три чипа Turing на 2250 TOPS) уже самостоятельно сошёл с конвейера 8 сентября. Массовый выпуск запланирован на конец этого года, а коммерческие поставки — на 2027-й.

Мы входим в эпоху, когда роботы перестают быть штучным товаром.
#роботехника
10🤔9🤯7🔥6
This media is not supported in your browser
VIEW IN TELEGRAM
Digit 5 научили работать рядом с людьми без защитной клетки

Agility Robotics показала новое поколение своего гуманоида Digit. Главный апгрейд здесь не скорость и не грузоподъёмность, а отдельная система безопасности для работы рядом с человеком.

Робот использует:
-бортовые камеры;
-датчики глубины;
-IMU;
-собственные AI-алгоритмы Agility для обнаружения людей и оценки опасного сближения.
Если человек оказывается слишком близко, Digit 5 может изменить движение, остановиться или перейти в безопасное положение.

Ключевой момент: за это отвечает отдельный safety-контроллер, независимый от основной системы управления. Agility также использует платформу NVIDIA IGX Thor + Halos for Robotics для safety-critical функций.

Из железа:
-поднимает до 22,7 кг;
-работает около 90 минут;
-заряжается за 9 минут.

То есть идея Digit 5 уже не в том, чтобы просто «уметь ходить», а в том, чтобы реально работать на складе или производстве в одной зоне с людьми.
Agility Robotics — Digit 5
119👍14🔥10
This media is not supported in your browser
VIEW IN TELEGRAM
Робот-рука взяла кирпичик LEGO: что под капотом
Потестила захват предметов на AdeeptTank Raspberry Pi. Рука — 4 степени свободы: плечо, локоть, кисть, захват. Для опускания и захвата работают три из них — плечо, локоть и захват; кисть отвечает за вращение. Каждый сустав — сервопривод на плате PCA9685 (I²C, адрес 0x5f).
Как управляется:
— серво понимает не «угол», а ширину импульса: 500 мкс = 0°, 2400 мкс = 180°, 50 Гц;
— в коде: servo.Servo(pca.channels[ch], min_pulse=500, max_pulse=2400).angle = 90.
Позу подбирала интерактивно — скрипт двигает сустав на 5° за команду и не пускает за безопасные пределы.
Следующий шаг — «чувство захвата» по току серво. Так работают промышленные захваты.
Степень свободы — одно движение.
Углы можно не подбирать руками, а считать. Зная длины звеньев и углы, положение клешни выводится по формуле: x = L₁cosθ₁ + L₂cos(θ₁+θ₂), аналогично y. А обратно — от точки к углам — идут через якобиан: матрицу «на сколько сдвинется клешня при малом повороте каждого сустава».
#роботетхника
1❤‍🔥77🏆7🔥4
Вчера выступала на большой конфе в Парке Горького от Тинька по продуктам

Конфа была топ

Я спросила - сколько людей вайбкодило что-то?
Поднял руки почти весь зал

Второй вопрос - кто с этого что-то заработал
Подняло руки 2 человека - 1 из них мой гость

Это про то, почему нужен маркетинг, продажи и продукт
16🔥3
This media is not supported in your browser
VIEW IN TELEGRAM
В Google Colab теперь можно бесплатно тренировать более 500 моделей — энтузиасты выпустили Unsloth Studio.

Unsloth Studio — это простой и удобный веб-интерфейс для обучения и тонкой настройки нейросетей без кода: поддерживается автоматическое создание синтетических датасетов, обучение занимает в 2 раза меньше времени и требует на 70% меньше VRAM на бесплатных GPU. Поддерживается работа как с готовыми, так и с кастомными датасетами.

Пробуем на Google Collab.

#полезныеинструменты #opensource
1🏆6🔥4🥰4