书生·万象(InternVL)大模型 —— 上海人工智能实验室(Shanghai AI Lab)研发的开源多模态大语言模型(MLLM)系列

4.17 书生万象InternVL大模型是由上海人工智能实验室ShanghaiAILab研发的开源多模态大语言模型MLLM系列,旨在实现跨模态文本图像视频语音3D点云等的理解与生成能力,并在多个领域达到或超越国际顶尖商业模型水平

20250417174059


书生·万象(InternVL)大模型是由上海人工智能实验室(Shanghai AI Lab)研发的开源多模态大语言模型(MLLM)系列,旨在实现跨模态(文本、图像、视频、语音、3D点云等)的理解与生成能力,并在多个领域达到或超越国际顶尖商业模型水平。以下是其主要特点和发展历程:

 

1. 核心特点

多模态融合:支持图像、视频、文本、语音、3D点云等多种模态数据的处理与联合推理。

高效训练策略:

渐进式对齐训练:先在小模型上预训练,再迁移到大模型,相比传统方法节省80%算力。

动态高分辨率训练:适应不同分辨率输入,优化视觉数据处理。

强大性能:

InternVL 3.0在MMMU(多模态理解基准)上得分达72.2,超越ChatGPT-4o、Claude-3.5-Sonnet等商业模型。基于司南OpenCompass开源评测框架的全面评估显示,书生·万象3.0在多学科推理、文档理解、多图像/视频理解、现实世界理解、多模态幻觉检测、视觉定位、多语言能力等多个维度上均表现出色,创造了开源多模态大模型的性能新标杆。

在文档理解(DocVQA)、图表分析(ChartQA)、OCR(OCRBench)等任务上媲美闭源模型。

开源生态:代码、模型权重、技术报告全部开源,支持HuggingFace和GitHub部署。


2. 关键技术

ViT-MLP-LLM架构:结合视觉Transformer(ViT)与大语言模型(LLM),提升跨模态表征能力。

链式思考(CoT)推理:增强复杂问题的逻辑推理能力。

像素逆置操作:减少视觉Token数量,提高计算效率。

合成数据+模型飞轮:通过高质量合成数据持续优化模型性能。

 

3. 应用场景

视觉问答(VQA):如分析新闻图片(如嫦娥六号返回舱)并回答专业问题。

文档理解:法律、医疗等领域的结构化信息提取。

多语言翻译**:支持跨语言文本与视觉内容的理解。

智能设计辅助:如建筑图纸解析、工业设计优化。

 

4. 发展历程

2021年:推出书生1.0(Intern),专注视觉任务。

2022年:升级至书生2.0(InternImage),支持视频理解与翻译。

2023年:发布InternVL,降低80%训练成本。

2024年7月:开源InternVL 2.0,采用渐进式训练策略。

2024年12月:推出InternVL 2.5,成为首个MMMU超70分的开源模型。

2025年4月:推出InternVL 3.0开源模型,MMMU达72.2分。

 

5. 行业影响

降低AI门槛:开源策略推动学术与产业界应用。

挑战商业闭源模型:在多项基准测试中媲美或超越GPT-4o、Claude等。

赋能垂直领域:如气象预报(书生·风乌)、航空设计(书生·翼飞)。

 

书生·万象的持续演进体现了上海AI实验室在通专融合大模型方向的战略布局,为AGI(通用人工智能)发展提供了重要技术路径。

 

试用:https://chat.intern-ai.org.cn/