DeepSeek下一代“MODEL1”核心代码意外曝光,V4模型架构或将彻底重构

1.22 此次代码泄露事件引发全球开发者社区轰动,HuggingFace技术专家指出,若MODEL1确为V4,其架构创新可能引领下一代大模型设计潮流

1月21日,中国AI创业公司DeepSeek在GitHub更新FlashMLA代码库时,意外泄露其下一代大模型"MODEL1"的核心架构信息。


据开发者发现,在114个代码文件中有28处提及"MODEL1",该标识与已知的V3.2系列并列但架构完全不同,显示这是全新技术路线。代码显示MODEL1采用动态Top-K稀疏推理、增强KV缓存布局和FP8解码等创新技术,推理效率较V3.2提升40%以上。


社区普遍推测MODEL1可能是传闻中将于2月中旬发布的V4模型代号,或主打编程与Agent能力。


值得关注的是,新架构回归512维标准配置,疑似为适配英伟达Blackwell架构优化。DeepSeek自2025年1月发布R1模型以来,凭借开源策略和极致性价比快速崛起,目前GitHub星标已超8万。


此次代码泄露事件引发全球开发者社区轰动,Hugging Face技术专家指出,若MODEL1确为V4,其架构创新可能引领下一代大模型设计潮流。DeepSeek官方尚未回应,但分析人士认为这预示着中国AI企业在底层架构创新上正从跟随者变为定义者。