精选文献

精选 CVPR、NeurIPS、ICLR 等顶会及 arXiv 科研文献。

涵盖多模态表征、模态对齐、视觉语言推理及指令微调等核心领域。

领域
来源
488
Seed1.8 Model Card: Towards Generalized Real-World Agency

Intro

Seed1.8 是字节跳动发布的面向通用现实世界代理(Generalized Real-World Agency)的多模态模型。该模型将感知、推理和行动集成在单一模型中,支持搜索、代码执行和 GUI 交互等复杂的多步任务。在视觉理解、长视频推理及 Agent 任务上,其性能显著优于 Seed1.5-VL,并能与 Gemini 3 Pro 等前沿模型媲美。

OPENAI
OpenAI
2025
Introducing GPT-5.2

Intro

GPT-5.2 是 OpenAI 迄今为止最强大的模型系列,专为专业知识型工作打造。它在电子表格制作、演示文稿设计、代码编写、视觉识别、长上下文理解及复杂多步代理任务上均有显著提升。该系列包含 Instant、Thinking 和 Pro 三个版本,其中 GPT-5.2 Thinking 是首个在 GDPval 评测中达到人类专家水平的模型,并在 SWE-Bench Pro(软件工程)等基准测试中树立了新标杆。

BLOG
Mistral AI
2025
Introducing Mistral 3

Intro

Mistral 3 是 Mistral AI 推出的下一代开放多模态和多语言模型系列。该系列包含三个最先进的小型密集模型(Ministral 3B、8B 和 14B)以及 Mistral Large 3(41B 激活参数/675B 总参数的稀疏 MoE 模型)。所有模型均采用 Apache 2.0 许可发布,支持图像理解,并在多语言对话、长上下文处理及边缘计算效率上表现优异,其中 Mistral Large 3 在非推理类开源模型中表现顶尖。

ARXIV
Qwen Team
2025
Qwen3-VL Technical Report

Intro

Qwen3-VL 是 Qwen 系列中迄今为止最强大的视觉语言模型,在广泛的多模态基准测试中实现了卓越的性能。它原生支持高达 256K token 的交错上下文,能够无缝集成文本、图像和视频,并提供了密集型(Dense)和混合专家(MoE)等多种变体。

Emu3.5: Native Multimodal Models are World Learners

Intro

Emu3.5 是由智源研究院(BAAI)发布的原生多模态世界模型,在超过 10 万亿个多模态 token 上进行了端到端预训练。作为 Emu3 的升级版,它统一了语言、图像和视频的理解与生成,仅通过预测下一个 token 即可完成多模态任务,无需依赖 CLIP 或扩散模型。Emu3.5 引入了离散扩散适应(DiDA)机制,在保持高性能的同时将图像生成推理速度提升了约 20 倍。

ARXIV
Xiaoyu Liu, Chaoyou Fu, Chi Yan, Chu Wu, Haihan Gao, et al.
2025
VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting

Intro

VITA-E 是由南京大学、腾讯优图实验室、中科院自动化所及傅利叶智能联合推出的具身交互框架,旨在解决传统 VLA 模型交互僵化的问题。它采用“双模型架构”(Dual-Model Architecture),包含并行的“主动模型”和“待机模型”,赋予了机器人同时进行“看、听、说、动”的能力。这种设计让机器人能够在执行物理动作时处理语音中断或插入新指令,实现了接近实时的自然人机交互体验。

ARXIV
Haoran Wei, Yaofeng Sun, Yukun Li
2025
DeepSeek-OCR: Contexts Optical Compression

Intro

DeepSeek-OCR 是由 DeepSeek 发布的创新性模型,旨在探索通过光学 2D 映射(Optical 2D Mapping)压缩长上下文的可行性。该模型由专门设计的视觉编码器 DeepEncoder 和 DeepSeek3B-MoE 解码器组成,能够在处理高分辨率文档输入时保持极低的激活度并实现高压缩比。实验显示,在压缩比小于 10 倍(文本 token 数/视觉 token 数 < 10)的情况下,其 OCR 解码精度高达 97%,为大模型的长上下文压缩和视觉文档理解提供了新的高效路径。

ARXIV
Hanrong Ye, Chao-Han Huck Yang, Arushi Goel, Wei Huang, Ligeng Zhu, et al.
2025
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

Intro

OmniVinci 是由 NVIDIA 推出的开源全模态大语言模型,旨在像人类一样通过多种感官感知世界。该模型在架构上引入了 OmniAlignNet、时间嵌入分组 (Temporal Embedding Grouping) 等创新机制,强化了视觉、音频与语言在统一潜在空间中的对齐与交互。此外,团队还构建了包含 2400 万条数据的高质量全模态对话数据集。OmniVinci 在多项基准测试中展现了优异的性能,特别是在需要视听协同理解的复杂场景中表现突出。

ARXIV
Run Luo, Xiaobo Xia, Lu Wang, Longze Chen, Renke Shan, et al.
2025
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

Intro

NExT-OMNI 是首个完全基于离散流匹配 (Discrete Flow Matching) 的开源全模态基础模型。该模型在统一架构下实现了文本、图像、视频和音频的“任意对任意”(Any-to-Any) 理解与生成,无需依赖扩散解码器。通过双向特征融合和动态长度生成优化,NExT-OMNI 在多模态生成、多轮交互及跨模态检索任务中展现了卓越性能与高效推理能力。

ARXIV
Wenwen Tong, Hewei Guo, Dongchuan Ran, Jiangnan Chen, Jiefan Lu, et al.
2025
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue

Intro

InteractiveOmni 是由商汤科技 (SenseTime Research) 推出的统一全模态大模型,专为视听多轮交互设计。该模型(4B-8B 参数)采用单一架构处理图像、视频、音频和文本,实现了端到端的全模态感知与语音生成。通过全模态预训练和后续的语音对话微调,InteractiveOmni 在多轮对话和长时记忆能力上表现出色,性能超越了同量级的开源模型,甚至媲美 Qwen2 等更大规模模型。

ARXIV
Shaoqi Dong, Chaoyou Fu, Haihan Guo, Yi-Fan Zhang, Chi Yan, et al.
2025
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation

Intro

VITA-VLA 是由南京大学、腾讯优图实验室及中科院自动化所联合提出的高效 VLA 训练框架,旨在解决传统视觉语言动作模型训练成本高昂的问题。该方法采用“动作专家蒸馏”策略,通过引入动作 Token 和状态编码器,将轻量级动作专家的知识迁移到大型 VLM 中。这种双阶段训练方式避免了昂贵的从头训练,在保留 VLM 强大感知能力的同时,使模型在 LIBERO 基准测试中达到了 97.3% 的平均成功率,在真实机器人操作任务中也表现优异。

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

Intro

LLaVA-OneVision-1.5 是一个完全开源的大型多模态模型 (LMM) 系列,旨在以极低的成本实现 SOTA 性能。该项目开源了包括 85M 预训练数据、26M 指令微调数据在内的所有资产,并提供了一套仅需 1.6 万美元即可复现的高效训练框架。在多个基准测试中,其 8B 和 4B 模型表现优异,超越了 Qwen2.5-VL 等同类模型。

...