
2月11日,多个用户反馈DeepSeek开始灰度测试最高100万Token(1M)的上下文长度,知识库同步更新至2025年5月。这是继1月20日R1模型引爆全球后,DeepSeek在"长文本"赛道的又一次突袭,直接对标月之暗面Kimi的200万汉字(约100万Token)护城河,标志着国产大模型"长文本战争"进入百万Token级白热化阶段。
技术细节:从128K到1M的跨越
上下文长度暴增8倍
去年8月发布的DeepSeek V3.1上下文长度仅128K,此次灰度测试直接跃升至1M,增幅达8倍。用户实测显示,可一次性输入300页PDF文档或10万行代码库,模型能准确回答文档深处的细节问题,"大海捞针"准确率超92%。
知识库时效性突破
非联网状态下,DeepSeek可准确输出2025年4月的新闻,知识截止日从传统的"2023年底"大幅推进至"2025年5月"。这意味着模型训练数据的新鲜度领先行业平均水平18个月,对于金融、法律、医学等时效敏感领域具有决定性优势。
架构创新:稀疏注意力+分层记忆
据技术社区推测,DeepSeek采用"稀疏注意力机制+分层外部记忆"的混合架构,仅对关键Token计算全注意力,其余Token采用压缩表示,将1M上下文的推理成本控制在可接受范围。这与Kimi的"无损长上下文"路线形成差异化竞争。
市场影响:Kimi护城河受挑战
月之暗面的防御性回应
就在DeepSeek灰度测试曝光同日,Kimi紧急宣布"200万汉字上下文全量开放",并推出"长文本专属API定价",试图以"长度优势"维持差异化。但市场分析认为,DeepSeek的"免费+开源"策略更具杀伤力,企业客户可能转向成本更低的DeepSeek方案。
资本市场重新定价
DeepSeek概念股东方财富、每日互动2月11日分别上涨8.3%和12.7%,市场对"长文本普惠化"趋势押注。分析指出,百万Token上下文将成为2026年大模型标配,"长文本"从稀缺卖点变为基础能力,行业竞争焦点将转向"多模态Agent"与"具身智能"。