реклама
Теги → панорама

Intel Labs представила нейросеть для генерации панорамных изображений с 360-градусным обзором

Intel Labs в сотрудничестве с Blockade Labs представили латентную диффузионную ИИ-модель для создания панорамных трёхмерных изображений (LDM3D) с 360-градусным обзором, которая первой в отрасли обеспечивает отображение глубины сцены. LDM3D может произвести революцию в создании реалистичного визуального 3D-контента, приложениях метавселенной и цифровом опыте, найти применение в широком спектре отраслей — от развлечений и игр до архитектуры и дизайна.

 Источник изображения: Intel Labs

Источник изображения: Intel Labs

LDM3D была обучена на наборе данных, созданном из подмножества 10 000 образцов базы данных LAION-400M, которая содержит более 400 миллионов пар изображений и подписей к ним. Для отображения точной относительной глубины каждого пикселя была использована разработанная Intel Labs модель Dense Prediction Transformer (DPT). Набор данных LAION-400M создан, чтобы обеспечить возможность широкомасштабного тестирования модели для широкого круга исследователей и других заинтересованных сообществ.

Модель LDM3D обучалась на суперкомпьютере Intel AI на базе процессоров Intel Xeon и ускорителей Intel Habana Gaudi AI. Полученная модель и конвейер объединяют сгенерированное изображение и карту глубины для создания 360-градусных панорамных представлений.

Чтобы продемонстрировать потенциал LDM3D, исследователи разработали приложение DepthFusion, которое использует стандартные 2D-фотографии RGB и карты глубины для создания интерактивной 360-градусной панорамы. Для превращения текстовых подсказок в 3D-панорамы применяется язык визуального программирования TouchDesigner на основе узлов для интерактивного мультимедийного контента в реальном времени. Модель LDM3D объединяет изображение RGB и его карту глубины, что приводит к экономии памяти и ускорению работы.

Примеры панорамных изображений с 360-градусным обзором

«Технология генеративного ИИ направлена на расширение человеческого творчества и экономию времени. Однако большинство сегодняшних моделей ИИ ограничены созданием 2D-изображений. В отличие от них LDM3D позволяет пользователям генерировать изображение и карту глубины из заданной текстовой подсказки. Это обеспечивает более точную относительную глубину для каждого пикселя по сравнению со стандартными методами постобработки и экономит разработчикам значительное время при разработке сцен», — пояснил Васудев Лал (Vasudev Lal), научный сотрудник Intel Labs.

Это исследование может революционизировать взаимодействие с цифровым контентом, позволяя пользователям отображать текстовые подсказки ранее немыслимыми способами. Изображения и карты глубины, сгенерированные LDM3D, позволяют пользователям превратить текстовое описание безмятежного тропического пляжа, современного небоскрёба или научно-фантастической вселенной в детализированную панораму. Способность создавать карту глубины изображения может мгновенно повысить общий реализм и погружение, позволяя создавать инновационные приложения для различных отраслей, от развлечений и игр до дизайна интерьеров и каталогов недвижимости, а также виртуальных музеев и иммерсивной виртуальной реальности.

Внедрение LDM3D и DepthFusion прокладывает путь к дальнейшему развитию генеративного ИИ и компьютерного зрения. Intel продолжит исследования генеративного ИИ для расширения человеческих возможностей и создания экосистемы разработок в области ИИ с открытым исходным кодом, которая демократизирует доступ к этой технологии. LDM3D предоставляется с открытым исходным кодом через сообщество HuggingFace.

window-new
Soft
Hard
Тренды 🔥
У TikTok появились шансы остаться в США — теперь в этом замешан Илон Маск 14 мин.
Microsoft тестирует новый браузер для геймеров, который выводится поверх игры 35 мин.
Квартальная выручка на рынке облачных инфраструктур подскочила на 21 %, превысив $80 млрд 3 ч.
Новая статья: Little Big Adventure – Twinsen's Quest — криво, но всё ещё мило. Рецензия 4 ч.
Microsoft сломала игры Ubisoft последним крупным обновлением Windows 11 4 ч.
«Сердечное спасибо всем»: аудитория олдскульной ролевой игры Sea of Stars превысила 6 млн игроков 4 ч.
World of Warcraft исполнилось 20 лет — это до сих пор самая популярная ролевая игра в мире 23 ч.
Microsoft хочет, чтобы у каждого человека был ИИ-помощник, а у каждого бизнеса — ИИ-агент 23-11 12:20
«Атака на ближайшего соседа» сработала — хакеры удалённо взломали компьютер через Wi-Fi поблизости 23-11 11:08
Илон Маск отделался выплатой $2923 за неявку для дачи показаний по делу о покупке Twitter 23-11 06:25
Справится даже ребёнок: роботы на базе ИИ оказались совершенно неустойчивы ко взлому 2 ч.
LG поможет Samsung с нуля создать «настоящий ИИ-смартфон» — он выйдет в 2025 году и вы не сможете его купить 3 ч.
AIC и ScaleFlux представили JBOF-массив на основе NVIDIA BlueField-3 4 ч.
Nvidia нарастила выручку в Китае на 34 % даже в условиях санкций 7 ч.
Nvidia заинтересована в получении HBM3E от Samsung и верит в сохранение международного сотрудничества при Трампе 8 ч.
xMEMS представила бескатушечные МЭМС-динамики для открытых наушников, ноутбуков и носимой электроники 16 ч.
Microsoft и Meta представили дизайн ИИ-стойки с раздельными шкафами для питания и IT-оборудования 22 ч.
Eviden создаст для Финляндии ИИ-суперкомпьютер Roihu производительностью 49 Пфлопс 23 ч.
iFixit не нашли улучшений ремонтопригодности у нового Apple MacBook Pro на чипе M4 Pro 23-11 13:42
Вселенское ДТП на скорости 3,2 млн км/ч — «Джемс Уэбб» пролил свет на столкновение галактик 23-11 13:40