Google于4月初正式发布Gemini 3.1 Flash-Lite预览版,以每百万输入Tokens仅$0.25的定价——约为Gemini 3.1 Pro成本的八分之一——向市场投下一枚重磅炸弹 。该模型不仅在价格上极具侵略性,性能指标同样亮眼:GPQA Diamond得分86.9%,MMMU Pro得分76.8%,首Token时间提升2.5倍,输出生成速度提升45% 。这一发布标志着AI推理成本曲线出现历史性拐点,企业级AI应用的边际成本正趋近于零。

Flash-Lite的发布策略精准切中了当前AI市场的核心矛盾:企业渴望部署AI,但推理成本仍是规模化应用的最大障碍。Google通过模型分层(Pro/Flash/Flash-Lite)实现了对不同价值场景的精准覆盖——Pro层处理高价值复杂任务,Flash层平衡性能与成本,Flash-Lite则专攻高频、标准化的大规模工作负载。这种"金字塔式"产品架构使Google能够在不牺牲高端市场的情况下,通过低价策略锁定价格敏感型用户,形成对OpenAI和Anthropic的夹击态势。
更深层的行业影响在于,Flash-Lite的定价可能触发AI API市场的"价格战"。当前DeepSeek V3.2以$0.27/百万Tokens已被称为"颠覆性"定价 ,而Google以$0.25的价格切入,且背靠其自研TPU基础设施的成本优势,其他厂商将面临严峻的利润压力。对于开发者和企业而言,这意味着2026年可能是"AI应用爆发元年"——当推理成本不再是瓶颈,真正的创新将发生在应用层而非模型层。Google此举不仅是在销售模型,更是在投资整个生态的扩张,以换取未来应用层的话语权。