
书生·万象(InternVL)大模型是由上海人工智能实验室(Shanghai AI Lab)研发的开源多模态大语言模型(MLLM)系列,旨在实现跨模态(文本、图像、视频、语音、3D点云等)的理解与生成能力,并在多个领域达到或超越国际顶尖商业模型水平。以下是其主要特点和发展历程:
1. 核心特点
多模态融合:支持图像、视频、文本、语音、3D点云等多种模态数据的处理与联合推理。
高效训练策略:
渐进式对齐训练:先在小模型上预训练,再迁移到大模型,相比传统方法节省80%算力。
动态高分辨率训练:适应不同分辨率输入,优化视觉数据处理。
强大性能:
InternVL 3.0在MMMU(多模态理解基准)上得分达72.2,超越ChatGPT-4o、Claude-3.5-Sonnet等商业模型。基于司南OpenCompass开源评测框架的全面评估显示,书生·万象3.0在多学科推理、文档理解、多图像/视频理解、现实世界理解、多模态幻觉检测、视觉定位、多语言能力等多个维度上均表现出色,创造了开源多模态大模型的性能新标杆。
在文档理解(DocVQA)、图表分析(ChartQA)、OCR(OCRBench)等任务上媲美闭源模型。
开源生态:代码、模型权重、技术报告全部开源,支持HuggingFace和GitHub部署。
2. 关键技术
ViT-MLP-LLM架构:结合视觉Transformer(ViT)与大语言模型(LLM),提升跨模态表征能力。
链式思考(CoT)推理:增强复杂问题的逻辑推理能力。
像素逆置操作:减少视觉Token数量,提高计算效率。
合成数据+模型飞轮:通过高质量合成数据持续优化模型性能。
3. 应用场景
视觉问答(VQA):如分析新闻图片(如嫦娥六号返回舱)并回答专业问题。
文档理解:法律、医疗等领域的结构化信息提取。
多语言翻译**:支持跨语言文本与视觉内容的理解。
智能设计辅助:如建筑图纸解析、工业设计优化。
4. 发展历程
2021年:推出书生1.0(Intern),专注视觉任务。
2022年:升级至书生2.0(InternImage),支持视频理解与翻译。
2023年:发布InternVL,降低80%训练成本。
2024年7月:开源InternVL 2.0,采用渐进式训练策略。
2024年12月:推出InternVL 2.5,成为首个MMMU超70分的开源模型。
2025年4月:推出InternVL 3.0开源模型,MMMU达72.2分。
5. 行业影响
降低AI门槛:开源策略推动学术与产业界应用。
挑战商业闭源模型:在多项基准测试中媲美或超越GPT-4o、Claude等。
赋能垂直领域:如气象预报(书生·风乌)、航空设计(书生·翼飞)。
书生·万象的持续演进体现了上海AI实验室在通专融合大模型方向的战略布局,为AGI(通用人工智能)发展提供了重要技术路径。