Gemini
谷歌Gemini 3.8 Live虚拟人上线:实时唇形同步+自然表情,无缝切换97种语言
9月24日,谷歌正式宣布推出带有Live Avatar功能的Gemini 3.8 Live,为原生实时对话模型带来接近实时的视觉呈现效果。该功能将低延迟视频生成与语音相结合,打造能倾听、观察并以动态视觉形象交流的企业级交互体验,目前已在Gemini Enterprise上线。
AIYXL MODELS
追踪基础模型、多模态系统、新版本发布、能力演进,以及推动 AI 前沿发展的公司。
精选模型情报
Gemini
9月24日,谷歌正式宣布推出带有Live Avatar功能的Gemini 3.8 Live,为原生实时对话模型带来接近实时的视觉呈现效果。该功能将低延迟视频生成与语音相结合,打造能倾听、观察并以动态视觉形象交流的企业级交互体验,目前已在Gemini Enterprise上线。
模型家族
模型家族标签是 AIYXL 基于历史报道构建的编辑情报层。单篇文章可能涉及多个模型家族。
最新
模型动态
ABot-Earth0.7开创性地采用3D原生技术路径,使用涵盖空间时间等信息的时空数据训练模型,使其建立对三维空间的原生理解,从而端到端一次性生成3DGS三维高斯泼溅格式的城市场景
DeepSeek
9.10 DeepSeek正式发布V4.1 Flash模型,这是其全新模型结构系列中尺寸最小的模型,却实现了对上一代旗舰V4 Pro的全面超越。伴随新模型上线,DeepSeek同步宣布将有序下线V4 Pro,9月14日12:00后所有V4 Pro请求将路由至V4.1 Flash并按新单价计费。
GPT
9.4 当地时间9月3日,OpenAI正式发布新一代旗舰模型GPT-6 Astra,这是该公司迄今为止最强大、对齐程度最高的模型。OpenAI总裁格雷格·布罗克曼在发布会最后留下一句话:“欢迎来到AGI时代。”
GPT
9.3 当地时间9月2日,Meta推出迄今为止最强大的AI模型Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计。Meta首席AI官Alexandr Wang表示,新模型在编码能力上超越OpenAI的GPT-5.6 Sol,与Anthropic的Claude Fable 5.1表现持平。
Claude
9.2 两款模型采用完全相同的基础模型,区别仅在于安全防护等级Fable5.1面向所有用户开放,Mythos5.1仅通过可信访问计划向经过审核的网络安全和生命科学领域机构提供
模型动态
9.2 WorldLabs称,Atlas是一个多模态自回归扩散Transformer,从零开始预训练,原生处理文本图像视频相机位姿与3D深度信息,并在同一模型中完成世界生成重建和时空模拟
模型动态
9.1 8月31日由中国科学院大连化学物理研究所(以下简称“大连化物所”)联合科大讯飞、阿里云等共同研发的智能化工大模型3.0 Pro正式发布。作为我国化工行业首个大模型的最新迭代版本,3.0 Pro实现了从“专业知识问答模型”向“化工任务智能执行系统”的重要跨越,推动化工AI从辅助知识获取的“专业助手”升级为具备与专业人员协同完成复杂任务能力的“智能工程伙伴”。
模型动态
8.31 目前,这一高速公路已初见雏形重庆大学附属三峡医院普洱市人民医院瑞安市人民医院石家庄市人民医院等全国超过90家医院已正式应用RuiPath病理大模型,并入驻华为云行业AI梦工厂智慧医疗专区
GLM
8.27 GLM-5.3-Flash采用稀疏注意力与线性注意力混合架构,是首个采用此架构的开源前沿模型
Gemini
8.26 该产品提供法律简报起草引文验证合同全生命周期管理监管前瞻扫描数据主体访问请求处理等专用技能,并支持与法律软件和数据平台的安全连接
Wan
8.24 从8月6日开启公测至今仅18天,模型在指令遵循跨镜头一致性音频质感及视频编辑能力上持续进化,被企业用户评价为稳定真实有质感,已被短剧广告文旅音乐MV等多个行业接入生产流程
MiniMax
8.20 MiniMax正式发布多模态创作Agent工作台MiniMax Design,标志着AI视频创作从“操作像素”正式迈入“操作语义”的新阶段。该产品基于一个月前开源的旗舰视频模型H3构建,旨在将模型能力转化为可落地的商业生产力。
探索模型
追踪新一代模型、产品发布与版本更新。
关注推理、多模态、智能体与前沿能力演进。
观察性能信号、评测结果与模型对比。
关注成本、效率、开源生态与真实世界采用情况。