Crypto Currency Tracker logo Crypto Currency Tracker logo
Forklog 2026-09-07 10:12:23

Что такое пространственный ИИ и чем модели мира отличаются от языковых?

Что такое пространственный ИИ? Пространственный ИИ — системы, которые восстанавливают объемную картину окружения, дополняют ее недостающими фрагментами и удерживают результат неизменным. Например, модель получает одну фотографию комнаты и достраивает то, чего на снимке нет: стену за спиной снимавшего, обратную сторону кресла, пол под столом. Координаты дорисованного фиксируются — при возврате к исходному ракурсу кресло останется на прежнем месте и не изменит форму. Оригинальное название — spatial intelligence, пространственный интеллект. У большинства подобных систем порядок работы схожий: на вход поступает фотография, короткий ролик, текстовое описание или черновая расстановка объемов; каждый кадр привязывается к точке и углу съемки, из полученных связок складывается единая геометрия; участки, не попавшие ни в один кадр, дорисовываются по накопленным сведениям об особенностях комнат, улиц и предметов; итог сохраняется, поэтому повторный проход по уже знакомому маршруту дает тот же вид. Класс таких систем называют моделями мира (world models). Фэй-Фэй Ли, профессор Стэнфордского университета и создательница ImageNet, свела требования к ним к трем пунктам: сгенерированное пространство не конфликтует с геометрией и физикой; входные данные принимаются в любой форме, вплоть до минимального жеста; на каждое действие модель возвращает следующее состояние мира. Как модель мира собирает объемное окружение и в каком виде его отдает. Источник: ForkLog по данным World Labs. Один из первых коммерческих продуктов такого рода появился в ноябре 2025 года, вскоре после публикации Ли. World Labs открыла для всех Marble, где готовый мир выгружается «гауссовыми сплатами» или полигональной сеткой. Универсального способа обучать пространственный ИИ пока не найдено. Если языковую модель тренируют на одной задаче — предсказать следующий токен, то для трехмерных данных столь же простого подхода нет. Следующую разработку World Labs — Atlas — показали 1 сентября 2026 года. Доступ открыт по заявкам ограниченному кругу партнеров. https://forklog.com/cryptorium/ai/chto-takoe-nejronnaya-set Чем модель мира отличается от языковой? Языковая и пространственная модели работают с данными разной природы. Так, текст разворачивается в одну линию: каждое следующее слово опирается на предыдущие. Пространство устроено иначе — кресло стоит на месте независимо от того, попало оно в кадр или нет. Отсюда неодинаковые требования к согласованности: языковой модели достаточно не противоречить сказанному ранее; пространственной нужно совпадение геометрии: камера обошла комнату и вернулась в исходную точку — картинка должна повторить первый кадр, иначе окно переедет на другую стену. Концептуально устройство языковой и пространственной модели при этом довольно схоже: Atlas объединяет входные данные в общую картину и достраивает продолжение. Отличие в привязке: каждое изображение соотнесено с конкретной точкой и углом съемки, поэтому все накопленное выстраивается объемно, а не линейно. В World Labs это называют пространственным контекстом. Как объясняет Ли, язык представляет собой последовательность символов, тогда как описание мира требует учитывать множество взаимосвязей: гравитация определяет движение, взаимодействие света с веществом — цвет и яркость объектов. Модель мира должна согласованно воспроизводить геометрию, физику и изменения среды во времени. Поэтому для ее создания нужны новые подходы к представлению данных и обучению. Проверять результат тоже непросто — унифицированного теста для моделей мира нет. Представляя Atlas, World Labs отчиталась по двум задачам: генерация вида по заданной траектории камеры и восстановление сцены по нескольким снимкам. Оба критерия ничего не говорят о том, справляется ли модель с физикой предметов и с длинными сценариями. Языковой модели нужна связность строки, пространственной — совпадение геометрии при возврате к исходной точке. Источник: ForkLog. Почему языковые модели путаются в пространстве? Маршрут по городу трансформер прокладывает уверенно, хотя связной карты населенного пункта внутри у него нет. В ходе эксперимента исследователи MIT, Гарварда и Корнелла обучили систему на записях поездок такси по Манхэттену. Модель не просто прокладывала существующий маршрут между незнакомыми точками, но и находила кратчайший. За этим успехом скрывается пробел: сама задача не требует от системы связной карты города. На каждом шаге достаточно назвать один допустимый поворот в текущей точке, а у соседних перекрестков такие наборы часто совпадают. Поэтому модель отвечает верно, даже не отличая одну развилку от другой. Пока поездка шла по привычной схеме, пробел не проявлялся. Однако после закрытия 1% улиц точность падала с ~100% до 67%. После этого исследователи собрали карту заново: не по настоящим улицам Манхэттена, а по маршрутам, которые строила сама модель. В ней нашлись проезды, которых на самом деле нет, и эстакады, перекинутые поверх других проездов под произвольными углами. Побочное наблюдение оказалось неожиданным. Системы, обученные на случайных поездках, выстраивали более точную картину в сравнении с теми, что видели только оптимальные маршруты: непредсказуемые траектории включали больше поворотов. Разрыв между человеком и машиной сохраняется и в свежих тестах. На наборе MMSI-Bench люди набирают 97%, сильнейшая закрытая модель — около 40%, лучшая открытая — примерно 30%. Распространять этот вывод на все нейросети не следует. В манхэттенском эксперименте проверяли специально обученный трансформер, а не универсальные чат-боты. Устройство пространственной модели внутри таких систем разработчики не раскрывают. Карта Манхэттена, восстановленная по маршрутам трансформера: красным показаны улицы, которых нет. Источник: исследователи MIT, Гарварда и Корнелла.  Кто придумал обучать ИИ на воображаемой среде? Идея пришла из психологии. Британский исследователь Кеннет Крейк в 1943 году предположил, что мозг удерживает уменьшенную копию реальности и на ее основе представляет исходы разных действий, прежде чем действовать осмысленно. В машинном обучении подход оформился в 2018 году. Дэвид Ха и Юрген Шмидхубер собрали систему из трех частей и обучили ее на аркадных играх: первая сжимает картинку с экрана до небольшого набора чисел; вторая по этому набору предсказывает, что произойдет дальше; управляющая выбирает действие. Последняя получилась крошечной — 867 параметров. Затем исследователи приостановили ход игры. Агент продолжил тренироваться на картинках, которые придумывала предсказывающая часть, — внутри воображения самой системы, а не в реальной игре. Выученную так стратегию поведения перенесли обратно в настоящий движок. В шутере, где нужно уклоняться от огненных шаров, автономный помощник продержался около 1100 шагов при пороге прохождения 750. В гонке по случайно сгенерированным трассам агент набрал 906 очков при 900 требуемых. Тогда же вскрылась и уязвимость подхода. Обучаясь в воображаемой среде, система нашла способ двигаться так, что монстры переставали атаковать вовсе, хотя в исходной аркаде огонь не прекращался. Из этого сформировалось инженерное правило: чем точнее модель воспроизводит среду, тем легче обучаемый в ней автономный помощник находит лазейки, которых в реальности нет. Ха и Шмидхубер боролись с этим артефактом, добавляя в симуляцию шум, но эффективного универсального решения до сих пор не найдено. Как идея внутренней копии среды дошла до коммерческих продуктов. Источник: ForkLog. Как из фотографий получается трехмерная сцена? Обычный генератор изображений подбирает следующий кадр так, чтобы он выглядел правдоподобно рядом с предыдущим. Atlas действует иначе: у каждого поданного снимка он помечает, откуда велась съемка и куда был направлен объектив. Дальше система работает не с набором картинок, а с точками, расставленными в пространстве. Отсюда вытекает главное отличие от предшественников. Marble принимал на вход одно изображение и остальное додумывал. Atlas берет более 100 снимков — и доля выдуманного резко падает. Разница между моделями видна на конкретном примере. По одной фотографии загородного дома с садом модель выдумывает и планировку двора, и то, что за оградой. Стоит добавить второй и третий кадры — и эти фрагменты совпадают с реальностью. Чем больше снимков задействовано, тем меньше модель выдумывает. Источник: World Labs.  Результат выдается в трех формах: новые ракурсы, карты глубины и облака точек. Из последних собираются «гауссовы сплаты», которые подгружаются в игровой движок или в очки смешанной реальности. World Labs измерила точность реконструкции по нескольким снимкам: средняя ошибка Atlas — 25,3 против 28,7–47,7 у пяти специализированных моделей. Независимых оценок пока нет. Второй проверяемый навык — управление камерой. Модель должна перемещаться туда, куда ей указали: команда «восемь метров вперед, поворот направо» обязана дать тот же кадр, что получился бы при реальной съемке с этой точки. Какие компании разрабатывают пространственный ИИ? В сегменте выделяются три основные команды: World Labs. В январе 2026 года компания Фэй-Фэй Ли запустила публичный интерфейс для разработчиков. В феврале того же года проект привлек $1 млрд при участии AMD, Autodesk, Emerson Collective, Fidelity, Nvidia и Sea. В июле World Labs поглотила SceniX — команду, занимавшуюся симуляцией для робототехники. Google DeepMind. Представленная летом 2025 года модель Genie 3 генерирует интерактивное окружение в реальном времени: 24 кадра в секунду при разрешении 720p, несколько минут непрерывного взаимодействия. Визуальная память ограничена примерно 60 секундами: сцена, надолго оставленная за кадром, при возврате выглядит иначе.  Модель выпустили ограниченным исследовательским превью, позже доступ открыли через Google Labs. Интерфейса для разработчиков у Genie 3 нет. AMI Labs. Ян Лекун ушел из Meta в ноябре 2025 года и вместе с Александром Лебреном основал в Париже собственный стартап. Компания вышла из тени 10 марта 2026 года с посевным раундом на $1,03 млрд. Заявленная цель — архитектура, которая учится на видео и предсказывает состояние среды, а не следующее слово. О расстановке сил в сегменте говорить пока рано: коммерческих внедрений мало, а публичной статистики использования не раскрывает ни один из трех разработчиков. Где модели мира уже приносят пользу? Первое реальное применение — беспилотный транспорт. 6 февраля 2026 года Waymo представила собственную модель мира, построенную на основе Genie 3. Симулятор выдает не только картинку с камер, но и данные лидара — полный набор сигналов, который автомобиль получает на дороге. Ключевая возможность — контрфактические сценарии. Инженеры берут запись поездки и меняют в ней звено: как развивались бы события, откажись машина уступить дорогу. Дальше вся сцена разворачивается по-новому, включая поведение остальных участников движения. Аналогично обрабатывается и постороннее видео. Запись с регистратора или телефона превращается в среду, внутри которой автомобиль проезжает маршрут заново. Реконструкция на «гауссовых сплатах» (прежний метод Waymo) этого не позволяла: она рассыпается, стоит смоделированному маршруту уйти в сторону от исходной съемки. Ради устойчивости к таким отклонениям компания перешла к генеративной модели. Вторая область — робототехника. В World Labs сняли два больших помещения на обычный телефон, взяв из каждой записи по 24 кадра. Этого хватило, чтобы система рисовала все, что увидят камеры робота на любом маршруте внутри такого помещения.  В июле 2026 года компания показала и следующий шаг. Политики обучили полностью в симуляции, без единого реального примера, а затем перенесли на физических роботов. Несколько задач — упаковка коробки двумя руками, работа с кабелями, извлечение тонких предметов из завала — отработали автономно по часу без вмешательства человека. Одна реальная задача превращается в тысячи вариантов для тренировки робота. Источник: World Labs. Оценить пользу от обучения в симуляции пока нельзя. Waymo не раскрывает, как оно сказывается на реальных показателях безопасности, а World Labs не сравнивает такие политики с теми, что обучены традиционным способом. Почему реалистичный ролик расходится с физикой? Исследователи Google DeepMind и болгарского института INSAIT сняли на три камеры 66 бытовых сцен: как льется жидкость, сминается ткань, сталкиваются предметы. Каждую запись обрывали после третьей секунды и просили модель дорисовать следующие пять секунд ролика, а результат сверяли с настоящим продолжением того же эпизода. Этот набор сценариев назвали Physics-IQ. Лучшая из восьми проверенных систем набрала 29,5 балла из 100. В выборку входили модели, доступные к началу 2025 года: участвовали Sora, Runway Gen 3, Pika 1.0, Lumiere, Stable Video Diffusion и VideoPoet. Важнее оказалось другое наблюдение: статистически значимой связи между убедительностью картинки и соответствием физике не обнаружено. Ролик, который мультимодальная модель принимает за настоящую съемку, нарушает законы механики так же часто, как видео с очевидными огрехами. Причина кроется в самой задаче, поставленной перед генератором видео. Его настраивают так, чтобы выданная последовательность кадров статистически напоминала примеры из тренировочной выборки. Такому требованию все равно, сохраняет ли жидкость объем и летит ли брошенный предмет по дуге. Ограничения признают и сами разработчики. Atlas проверяли двумя способами: построить вид по заданной траектории камеры и восстановить сцену по снимкам. Физику предметов при этом не оценивали. Разрыв с человеком на пространственных задачах и разница с реальной съемкой на физических. Источник: ForkLog по данным Physics-IQ и MMSI-Bench. Зачем пространственный ИИ автономным агентам? ИИ-помощник, который работает с текстом и интерфейсами, обходится без геометрии. Заказ билета или сверка таблиц не требуют знания о том, что находится за дверью. Положение меняется, как только задача выходит в физическое пространство. Роботу мало описания комнаты. Ему нужен ответ на вопрос, что произойдет после действия: выдержит ли полка вес коробки, куда откатится задетый предмет. Именно такие ответы и выдает модель мира. Меняется и экономика обучения. Съемка помещения на телефон обходится дешевле ручного построения трехмерной сцены, а из одной записи получаются тысячи разных вариантов для тренировки: освещение, расположение предметов и фон задаются произвольно. Что добавляет автономному помощнику пространственная модель. Источник: ForkLog. Открытым остается вопрос точности. В World Labs заявляют, что генеративная система сама воспроизводит динамику контакта между манипулятором и предметом, и ссылаются на удачный перенос политик захвата с симуляции на реальных роботов. Независимой проверки этих результатов пока нет. С блокчейн-инфраструктурой направление не пересекается. Планов связать модели мира с ончейн-расчетами ни один из разработчиков публично не объявлял, хотя платежные протоколы для автономных ассистентов развиваются параллельно. https://forklog.com/cryptorium/chto-takoe-platezhi-ii-agentov-agentic-payments

Прочтите Отказ от ответственности : Весь контент, представленный на нашем сайте, гиперссылки, связанные приложения, форумы, блоги, учетные записи социальных сетей и другие платформы («Сайт») предназначен только для вашей общей информации, приобретенной у сторонних источников. Мы не предоставляем никаких гарантий в отношении нашего контента, включая, но не ограничиваясь, точность и обновление. Никакая часть содержания, которое мы предоставляем, представляет собой финансовый совет, юридическую консультацию или любую другую форму совета, предназначенную для вашей конкретной опоры для любых целей. Любое использование или доверие к нашему контенту осуществляется исключительно на свой страх и риск. Вы должны провести собственное исследование, просмотреть, проанализировать и проверить наш контент, прежде чем полагаться на них. Торговля - очень рискованная деятельность, которая может привести к серьезным потерям, поэтому проконсультируйтесь с вашим финансовым консультантом, прежде чем принимать какие-либо решения. Никакое содержание на нашем Сайте не предназначено для запроса или предложения