Evaluation Knowledge Intelligence
AI knowledge intelligence from AIYXL.
Related Companies
Related Models
Related Applications
Related Articles
2.26 报告提到,美国AI扩散规则进一步限制第三国向中国转售芯片,迫使中国加速构建自主产业链
12.19 传统视觉AI系统通常将图像识别文本生成图像text-to-image以及图像编辑如局部替换风格迁移视为独立任务,需调用不同模型训练不同参数,不仅资源消耗大,而且任务间的语义断层限制了整体表现
7.30 马斯克旗下SpaceXAI 7月29日发布新一代语音到语音模型GrokVoiceThinkFast2.0,以0.7秒的首响应时间和智能体性能登顶的成绩,重新定义了实时语音交互的标准
8.20 阿里巴巴正式推出Qwen-UI-Agent——一个以真实世界为中心的GUI智能体基座模型,全面覆盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。该模型在多项核心基准测试中全面对标乃至超越GPT-5.6 Sol、Claude Opus 4.8等业界旗舰模型,让AI真正成为能看懂屏幕、会操作软件的“数字执行器”。
5.29 MistralAI, the European leader in open source models, officially released its new product Vibe on May 28, and simultaneously announced its comprehensive entry into industrial-grade AI applications and self-built data center strategies.
3.4 来源httpscpb.com
1.20 根据官方和第三方评测数据,该模型在SWE-benchVerified和-Bench等主流编程与通用能力测试中,综合表现超越了阿里云的Qwen3-30B-A3B-Thinking-2507以及OpenAI开源的GPT-OSS-20B,在相同或近似规模的开源模型中取得当前最佳SOTA成绩
6.1 这款模型被官方定位为首个同时具备“前沿编程与智能体能力百万级上下文原生多模态”三大核心能力的国产开源旗舰,直接对标GPT-5.5ClaudeOpus4.7和Gemini3.1Pro等海外闭源顶级模型
5.20 谷歌同时发布了GeminiOmni多模态模型,能够基于任意输入文本图像音频视频生成并输出内容,率先推出视频输出能力,未来逐步扩展至图片和文本
8.8 链接httpswww.superclueai.com
12.20 基于模型通用能力专业领域能力厂商执行能力解决方案丰富度战略与创新市场影响力等多个维度,Omdia对最领先的前12家中国模型厂商进行综合评估,按照得分划分为领导者挑战者潜力者三大象限
3.16 来源httpswww.aicpb.comzh
1.28 今日凌晨,DeepSeek继续放大招,推出开源全新的视觉多模态模型Janus-Pro-7B,该多模态模型在GenEval和DPG-Bench基准测试中击败了StableDiffusion和OpenAI的DALL-E3
9.26 官方评估数据显示,这一模型在逻辑数学代码智能体等多个领域的推理任务中,达到了全球开源模型的最先进水平SOTA,部分任务性能接近闭源模型GPT-5-Thinking
5.31 链接httpswww.superclueai.comgeneralpage
1.9 随着AI应用从单模态问答迈向多模态智能体,阿里通义正通过持续开源与技术创新,加速推动AI能力从实验室走向千行百业的真实场景
1.9 中文大模型测评基准SuperCLUE持续对国内外大模型的发展趋势和综合效果进行了实时跟踪,已正式发布中文大模型基准测评2024年度报告,现在此发布部分主要内容,详细内容可到SuperCLUE浏览下载
3.29 2025中文大模型阶段性进展3月评估
6.1 Mistral的AgentsAPI通过为开发人员提供工具来创建能够执行现实世界任务管理对话之间的交互并在需要时动态协调多个代理的AI代理,从而解决了这些限制
8.5 博物馆主动提醒用户交代看到错金银铜虎噬鹿屏座就提醒我,模型便在镜头不断移动的过程中留意画面,扫过那件展品时主动出声提醒,随后结合画面细节讲解相关文物