https://www.ozon.ru/product/brelok-dlya-sumki-elektronnyy-svetofornyy-lamp-2shtuk-2229147006/?__rr=1
Вы хотите светофоров, их есть у меня)
Давно я курсы по комп зрению не читал
Вы хотите светофоров, их есть у меня)
Давно я курсы по комп зрению не читал
Forwarded from Machinelearning
Представьте себе биологическую нейросеть, физический объем которой, если собрать все её ткани вместе, не превысит размер обычной клубники.
Именно такую компактную, но критически важную структуру описывает нейробиолог Эв Федоренко из MIT, посвятившая 15 лет изучению того, как наш мозг обрабатывает речь.
Её выводы звучат для инженеров и дата-сайентистов очень знакомо: внутри человеческой головы функционирует система, которая ведет себя подозрительно похоже на современные большие языковые модели. Это своего рода «бездумный» языковой процессор, который занимается маппингом слов и смыслов, но сам при этом абсолютно не умеет мыслить.
Лаборатория Федоренко провела фМРТ-сканирование 1400 человек, чтобы построить детальную вероятностную карту мозговой активности.
Архитектура этой «языковой сети» оказалась удивительно стабильной и воспроизводимой: у большинства взрослых людей она локализуется в 3 конкретных зонах левой лобной доли и на протяженном участке вдоль средней височной извилины.
Федоренко называет эту структуру функциональным блоком, сравнимым с органом, вроде пищеварительной системы, или зоной распознавания лиц.
Самое интересное начинается, если посмотреть на функционал. Федоренко описывает эту сеть как парсер или набор указателей. Её задача сугубо утилитарна — работать интерфейсом между входными сигналами (звук, текст, жесты) и абстрактными представлениями смысла, хранящимися в совершенно других отделах мозга.
Сама языковая сеть не обладает ни эпизодической памятью, ни социальным интеллектом, ни способностью к рассуждению. Весь процесс раздумий происходит за её пределами.
Это объясняет феномен афазии: при повреждении этого «интерфейса» человек сохраняет сложное когнитивное мышление, но оказывается заперт внутри себя, потеряв доступ к словарю и грамматическим правилам.
Исследования показывают, что человеческая языковая сеть имеет крайне узкое контекстное окно: она способна эффективно обрабатывать чанки длиной максимум в 8–10 слов.
По сути, это довольно поверхностная система. Она реагирует на грамматически верную бессмыслицу Ноама Хомского «Colorless green ideas sleep furiously» так же активно, как и на осмысленные предложения. Ей важна структура и статистическая вероятность стыковки слов, а не истинность или глубокий смысл высказывания.
Это роднит её с ранними языковыми моделями: сеть просто выучила правила, по которым слова собираются в цепочки.
Данные Федоренко заставляют пересмотреть и классические представления об анатомии, ведь многие учебники до сих пор ссылаются на устаревшие концепции.
Например, зона Брока, которую десятилетиями считали центром речи, на деле оказалась областью моторного планирования. Она лишь готовит мышцы рта к артикуляции и активируется даже при произнесении полной бессмыслицы, работая как ведомый регион для получения команд.
Настоящая же языковая сеть мозга - это отдельный, специализированный вычислительный кластер, который, подобно ChatGPT, блестяще имитирует связность речи, даже если за ней не стоит никакой реальной мысли.
@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from 361.Robotics
Я есть Грут, Isaac GR00T! (конспирологический лонгрид)
⭕️ Сегодня на конференции NVIDIA GTC в Тайбэе (Тайвань) произошло крайне интересное событие. Причём сразу с трёх сторон: технологий, экономики и политики.
👤 Знакомьтесь, Isaac GR00T Reference Humanoid Robot — первая открытая референсная платформа, которая объединяет готовое тело робота, манипуляторы, вычислительный и ИИ-стек в единую систему. Цель проекта — снизить порог входа в разработку гуманоидов и предоставить исследователям готовую аппаратно-программную основу без необходимости создавать её каждый раз с нуля.
🇺🇸 🇨🇳 🇸🇬 Но самое главное, это продукт сотрудничества американской Nvidia (бортовой компьютер NVIDIA Jetson Thor и программный стек Isaac GR00T), китайской Unitree (шасси от их человекоподобного робота H2 Plus) и сингапурской Sharpa Wave (знаменитые высокоточные тактильные конечные эффекторы).
💲 Подобный альянс сейчас — настоящий геополитический ребус. Во-первых, презентация проходит в тот же день, когда у Unitree состоятся слушания по листингу на Шанхайской фондовой бирже STAR Market, в попытке привлечь 4,2 млрд юаней ($621 млн) для масштабирования производства. Так что это можно считать настоящим жестом поддержки от Nvidia.
⚖️ Одновременно с этим в США набирает обороты «Акт о безопасности американской робототехники» (American Security Robotics Act), вносящий полный запрет на федеральные закупки любых наземных беспилотных систем, включая гуманоидных роботов, китайского производства.
Поэтому и появилась сингапурская Sharpa. Переложив производство «рук» и части софта в юрисдикцию вне прямого влияния США и КНР, участники альянса пытаются создать политически устойчивую конструкцию.
А что за референсная модель? Кому и зачем она нужна?
❓ Главная проблема современной гуманоидной робототехники в том, что лаборатории тратят до 80% времени на сборку и отладку собственных «уникальных» платформ, из-за чего переход от идеи к готовому прототипу занимает годы.
❗️ Теперь на смену этому хаосу приходит стандартизированная готовая платформа, где «тело» и «мозг» уже заранее интегрированы. Как отметил вице-президент Nvidia Рев Лебаредян (Rev Lebaredian):
🚫 Иными словами, если провести аналогию с развитием ИИ, это похоже на момент, когда разработчики перестали самостоятельно собирать инфраструктуру и получили готовые открытые платформы вроде PyTorch и Hugging Face.
#Гуманоидные_роботы #Сервисные_роботы #Экономика #Китай #США #Референсные_платформы
🇺🇸 🇨🇳 🇸🇬 Но самое главное, это продукт сотрудничества американской Nvidia (бортовой компьютер NVIDIA Jetson Thor и программный стек Isaac GR00T), китайской Unitree (шасси от их человекоподобного робота H2 Plus) и сингапурской Sharpa Wave (знаменитые высокоточные тактильные конечные эффекторы).
ТТХ робота для самых любопытных:
Общая мобильность — 75 степеней свободы (degrees of freedom, DOF), 31 в корпусе и по 22 в каждой руке.
Конечные эффекторы — два пятипалых манипулятора.
Гаптика — в каждый палец встроена цифровая тактильная матрица (Digital Tactile Array) с более чем 1000-ю чувствительных пикселей с порогом 0,02 ньютона (позволяет ощущать минимальное давление и распознавать тонкие текстуры предметов).
Силовые характеристики — крутящий момент в руках достигает 120 Н·м, а в ногах — 360 Н·м (возможность поднимать груз в стандартном режиме до 7 кг, а в пиковом — до 15 кг при собственном весе в 68 кг).
Вычислительная мощь — модуль Jetson AGX Thor T5000 на архитектуре Blackwell обеспечивает 2070 терафлопс в формате FP4 (4-bit Floating Point). Плюс 14-ядерный процессор Arm и 128 ГБ унифицированной памяти.
Поэтому и появилась сингапурская Sharpa. Переложив производство «рук» и части софта в юрисдикцию вне прямого влияния США и КНР, участники альянса пытаются создать политически устойчивую конструкцию.
А что за референсная модель? Кому и зачем она нужна?
«До сих пор исследовательские группы тратили массу времени и сил на то, чтобы заставить робота хотя бы загрузиться и встать. Теперь они могут просто пользоваться системой „из коробки“».
#Гуманоидные_роботы #Сервисные_роботы #Экономика #Китай #США #Референсные_платформы
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Адель и МЛь
Только я хотел похвалить Inkling Small, как вышел Deepseek V4-Flash 0731 с каким-то бешеными показателями.
Хотя Inkling мультимодальный и принимает на вход текст, картинки и аудио, а дипсик - text only.
Обе модели похожи по размеру - ~280B A13B.
Deepseek умнее и дешевле GPT 5.6 Luna (xhigh) (хоть и медленнее) и при этом openweights. Большеват, конечно, но хотя бы не 3Т.
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
https://huggingface.co/thinkingmachines/Inkling-Small
Хотя Inkling мультимодальный и принимает на вход текст, картинки и аудио, а дипсик - text only.
Обе модели похожи по размеру - ~280B A13B.
Deepseek умнее и дешевле GPT 5.6 Luna (xhigh) (хоть и медленнее) и при этом openweights. Большеват, конечно, но хотя бы не 3Т.
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
https://huggingface.co/thinkingmachines/Inkling-Small
Forwarded from Adventory о мире робототехники и автоматизации
Media is too big
VIEW IN TELEGRAM
Gemini Robotics 2 - новый уровень физического ИИ
Google DeepMind представила интеллектуальный слой для роботов, состоящий из трёх моделей:
- Gemini Robotics 2 (VLA) - vision-language-action модель, преобразующая визуальные и текстовые команды в моторный контроль. Управляет гуманоидами целиком (от стоп до кончиков пальцев) и бимануальными роботами, обеспечивая тонкую моторику рук и захватов.
- Gemini Robotics ER 2 - модель воплощённого планирования (VLM-агент). Обрабатывает многошаговые задачи длительностью в несколько минут (сотни решений), отслеживает прогресс, самоисправляется при сбоях и координирует действия разных роботов.
- Gemini Robotics On-Device 2 - оптимизированная VLA для локального запуска. Адаптируется к новым формам роботов (разные сенсоры, степени свободы) всего за несколько часов, используя менее 200 примеров.
Ключевые возможности: целостное управление гуманоидом (ходьба, приседания, наклоны), ловкость с кистью на 22 степени свободы (завязывание узлов, закрытие зип пакетов), многороботная коллаборация.
Безопасность: новый бенчмарк ASIMOV-Agentic (о как!) для контроля опасных действий и запроса помощи у человека.
ER-модель доступна в Google AI Studio и приватном превью на Gemini Enterprise Agent, VLA и On-Device — для партнёров раннего доступа.
Ссылка на Gemeni Robotics 2
Видео также с сайта по ссылке выше.
Google DeepMind представила интеллектуальный слой для роботов, состоящий из трёх моделей:
- Gemini Robotics 2 (VLA) - vision-language-action модель, преобразующая визуальные и текстовые команды в моторный контроль. Управляет гуманоидами целиком (от стоп до кончиков пальцев) и бимануальными роботами, обеспечивая тонкую моторику рук и захватов.
- Gemini Robotics ER 2 - модель воплощённого планирования (VLM-агент). Обрабатывает многошаговые задачи длительностью в несколько минут (сотни решений), отслеживает прогресс, самоисправляется при сбоях и координирует действия разных роботов.
- Gemini Robotics On-Device 2 - оптимизированная VLA для локального запуска. Адаптируется к новым формам роботов (разные сенсоры, степени свободы) всего за несколько часов, используя менее 200 примеров.
Ключевые возможности: целостное управление гуманоидом (ходьба, приседания, наклоны), ловкость с кистью на 22 степени свободы (завязывание узлов, закрытие зип пакетов), многороботная коллаборация.
Безопасность: новый бенчмарк ASIMOV-Agentic (о как!) для контроля опасных действий и запроса помощи у человека.
ER-модель доступна в Google AI Studio и приватном превью на Gemini Enterprise Agent, VLA и On-Device — для партнёров раннего доступа.
Ссылка на Gemeni Robotics 2
Видео также с сайта по ссылке выше.
Forwarded from Machinelearning
В мире существуют лишь единицы систем, способных синтезировать физически точные данные для ИИ. Сбер выложил под открытой лицензией MIT семейство моделей Kandinsky WM 1.0, сделав технологию бесплатно доступной для всех разработчиков.
Системы генерируют физически достоверные видео и решают ключевую проблему — невозможность безопасно и дёшево снять вживую редкие или опасные сценарии вроде ДТП, экстремальной погоды или отказов оборудования.
Что внутри:
• Обучение на реальности: Kandinsky 5.0 Video Lite дообучили на нескольких миллионах видеозаписей реальных дорожных процессов и заводских линий;
• Контроль физики: Специальные алгоритмы через RL оценивают сохранение геометрии и естественность кинематики, избавляя ролики от деформации объектов;
• Модульные сценарии: Генерация 5-секундных блоков видео, из которых складывается обучение автономных систем и систем компьютерного зрения.
Модели становятся фундаментом для создания «моделей мира» — систем, способных предсказывать развитие событий в реальности. Решение уже применяют Центр робототехники Сбера и институт AIRI в своём дорожном симуляторе, а полный технический разбор опубликован в статье на Habr.
@ai_machinelearning_big_data
#ai #opensource #sber
Please open Telegram to view this post
VIEW IN TELEGRAM