реклама
Новости Software

Microsoft выпустила пару открытых эффективных ИИ-моделей Phi-4 — одну дообучили по новой методике

Microsoft расширила линейку собственных больших языковых моделей искусственного интеллекта Phi-4 двумя новыми проектами с относительно скромными системными требованиями. Одна из них является мультимодальной, то есть работает с несколькими форматами данных.

 Источник изображений: microsoft.com

Источник изображений: microsoft.com

Модель Microsoft Phi-4-mini является исключительно текстовой, а Phi-4-multimodal — её улучшенная версия, способная обрабатывать также запросы в визуальном и звуковом форматах. Обе модели, утверждает разработчик, в значительной мере превосходят альтернативы сопоставимых размеров при выполнении определённых задач.

Microsoft Phi-4-mini имеет 3,8 млрд параметров, то есть она достаточно компактна для запуска на мобильных устройствах. В основу модели легла особая версия архитектуры «Трансформер» (Transformer). В стандартном варианте модели-трансформеры, чтобы понять значение каждого слова, анализируют текст до и после него; при разработке Phi-4-mini в Microsoft использовали версию Decoder-Only Transformer, которая предполагает анализ только предшествующего слову текста, что снижает нагрузку на вычислительные ресурсы и повышает скорость обработки данных.

Для дополнительной оптимизации использована технология Grouped Query Attention — этот механизм помогает модели определять, какие фрагменты данных наиболее релевантны при обработке текущей задачи. Phi-4-mini может генерировать текст, переводить документы и управлять внешними приложениями; модель, по словам разработчиков, преуспела в решении математических задач и написании компьютерного кода, даже когда требуются «сложные рассуждения». Точность ответов Phi-4-mini, по оценкам самой Microsoft, «значительно» превосходит результаты, которые дают несколько других моделей аналогичного размера.

Phi-4-multimodal — это расширенная версия Phi-4-mini с 5,6 млрд параметров; в качестве запросов она воспринимает не только текст, но также изображения, аудио и видео. Для дообучения модели в Microsoft использовали новый метод Mixture of LoRAs. Обычно адаптация ИИ к новой задаче требует изменения его весов — параметров конфигурации, которые определяют, как он обрабатывает данные. Чтобы облегчить эту задачу, используется метод LoRA (Low-Rank Adaptation) — для выполнения незнакомой задачи модели добавляется небольшое количество новых весов, оптимизированных для этой задачи. Метод Mixture of LoRAs адаптирует этот механизм к мультимодальной обработке данных: при разработке Phi-4-multimodal исходную Phi-4-mini дополнили весами, оптимизированными для работы с аудио и видео. В результате, рассказали в Microsoft, удалось смягчить некоторые компромиссы, связанные в прочими подходами к построению мультимодальных моделей.

В тестах, связанных с обработкой визуальных данных, Phi-4-multimodal набрала 72 балла, незначительно уступив ведущим моделям от OpenAI и Google. В одновременной обработке видео и звука она «с большим отрывом» обошла Google Gemini-2.0 Flash, а также открытую InternOmni. Phi-4-mini и Phi-4-multimodal доступны на платформе Hugging Face по лицензии MIT, которая допускает их коммерческое использование.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме
window-new
Soft
Hard
Тренды 🔥
Хакеры нашли и эксплуатировали брешь в «Великом китайском файрволе» — её не удалось залатать с первой попытки 16 мин.
Массовое внедрение цифрового рубля отложено на неопределённый срок 2 ч.
Instagram внезапно стал массово показывать неподобающие Reels — в Meta извинились и уже всё починили 2 ч.
Jade Empire могла встать в один ряд с Mass Effect и Dragon Age, если бы не «абсолютно идиотский совет» Microsoft 4 ч.
Microsoft выпустила пару открытых эффективных ИИ-моделей Phi-4 — одну дообучили по новой методике 4 ч.
Выросший из мода для Doom 2 хоррор Total Chaos от автора Turbo Overkill выйдет вместе с VR-режимом для самых смелых — объявлена дата релиза 5 ч.
Надёжный инсайдер: Hogwarts Legacy 2 и новый «Бэтмен» от Rocksteady не будут играми-сервисами 6 ч.
Сюрреалистический хоррор Post Trauma отправит немолодого кондуктора в мир кошмарных монстров, причём уже скоро — новый трейлер раскрыл дату выхода 17 ч.
Ветераны Piranha Bytes анонсировали Cralon — олдскульный dungeon crawler в духе Ultima Underworld и Arx Fatalis 21 ч.
Глава Xbox Game Studios считает выпуск эксклюзивов Xbox на PS5 «беспроигрышным вариантом» как для игроков, так и для разработчиков 22 ч.
NVIDIA увеличила выручку, но снизила валовую прибыль — продукты стали сложнее и дороже, а спрос на Blackwell потрясающий 10 мин.
Samsung представила бюджетные смартфоны Galaxy M06 5G и M16 5G на чипах Dimensity 6300 — от $110 10 мин.
Китай рассекретил единственный в мире геостационарный спутник дальнего зондирования Земли 25 мин.
Blackstone и Panchshil Realty намерены построить за $2,3 млрд «крупнейший в Индии» кампус ИИ ЦОД мощностью 500 МВт 2 ч.
Дженсен Хуанг пообещал «большой шаг вперёд» — Nvidia в марте расскажет про будущие ИИ-чипы Rubin и не только 2 ч.
«Яндекс» выделила роботов-курьеров и весь беспилотный транспорт в отдельное бизнес-направление 3 ч.
В марте Луна подвергнется нашествию научных зондов с Земли — SpaceX запустила ещё два аппарата 3 ч.
Nvidia признала в Huawei сильного конкурента и похвалилась ростом продаж ИИ-чипов в Китае, несмотря на санкции 4 ч.
Представлен Armv9-процессор Cortex-A320 для IoT-устройств с ИИ-функциями 4 ч.
М.2 SSD вместимостью до 15,36 Тбайт: Exascend представила накопители серии PE4 4 ч.