NEXUS-O – 多模态AI模型，实现对语言、音频和视觉全方位感知与交互

NEXUS-O 是HiThink 研究院、英国帝国理工学院、浙江大学、复旦大学、微软、Meta AI等机构推出的多模态AI模型，能实现对语言、音频和视觉信息的全方位感知与交互。NEXUS-O能处理音频、图像、视频和文本的任意组合输入，用音频或文本形式输出结果。

新闻资讯 2026-06-07 PPISO

2 0

文章摘要

NEXUS-O是什么

NEXUS-O 是HiThink 研究院、英国帝国理工学院、浙江大学、复旦大学、微软、Meta AI等机构推出的多模态AI模型，能实现对语言、音频和视觉信息的全方位感知与交互。NEXUS-O能处理音频、图像、视频和文本的任意组合输入，用音频或文本形式输出结果。NEXUS-O 基于视觉语言模型预训练，用高质量合成音频数据提升三模态对齐能力。NEXUS-O引入新的音频测试平台 Nexus-O-audio，涵盖多种真实场景（如会议、直播等），用在评估模型在实际应用中的鲁棒性。NEXUS-O 在视觉理解、音频问答、语音识别和语音翻译等任务上表现出色，基于三模态对齐分析展示了高效性和有效性。

NEXUS-O的主要功能

语音处理能力：支持自动语音识别（ASR）、语音到文本翻译（S2TT）、语音合成及语音指令交互等任务，适用于多种语音应用场景。
视觉理解与交互：处理图像和视频输入，完成视觉问答（VQA）、图像描述生成、视频分析等任务，具备强大的视觉理解能力。
语言交互与推理：理解自然语言指令，进行对话交互、文本生成、多模态推理等任务，支持复杂的语言交互场景。
跨模态对齐与理解：基于多模态对齐技术，实现音频、视觉和语言模态之间的协同理解，提升模型在复杂场景下的综合性能。

NEXUS-O的技术原理

多模态架构：
- 视觉编码器：基于改进的 Vision Transformer（ViT）架构，支持高分辨率图像输入，用窗口注意力机制提升计算效率。
- 音频编码器与解码器：音频编码器基于预训练的 Whisper-large-v3 模型，将语音特征映射到语义空间；音频解码器用自回归生成离散语音码，将预训练的生成器合成最终的语音波形。
语言模型： Qwen2.5-VL-7B 为基础，包含 28 层因果 Transformer，负责处理语言模态的任务。
多模态对齐与预训练：基于预训练阶段，将音频、视觉和语言模态的特征对齐到一个统一的语义空间中，使模型理解和生成跨模态的信息。基于分阶段预训练方法，包括音频对齐、音频指令跟随（SFT）和音频输出调优，逐步提升模型的多模态交互能力。
数据合成与增强：用文本到语音（TTS）技术，将文本数据转换为自然语音，增强数据多样性。对合成数据进行长度过滤、非文本元素过滤和模式匹配过滤，确保数据质量。
多模态任务的联合训练：Nexus-O 在预训练阶段支持多种多模态任务，如自动语音识别、语音到文本翻译、语音指令交互、视觉问答等，联合训练提升模型的泛化能力。
表示空间对齐分析：用核对齐（kernel alignment）等方法，评估不同模态在模型内部的表示空间对齐程度，优化多模态特征融合效果。