B+Artificial Analysis(在新窗口打开)运营方:Artificial Analysis多维度数据/持续更新入口801大模型综合榜(在新窗口打开)02评测明细(在新窗口打开)03Agent 对比(在新窗口打开)04API 供应商(在新窗口打开)05图像生成(在新窗口打开)06视频生成(在新窗口打开)07语音识别(在新窗口打开)08语音合成(在新窗口打开)
B+OpenRouter Rankings(在新窗口打开)运营方:OpenRouter多维度数据/实时数据入口1301热门模型(在新窗口打开)02完整排行榜(在新窗口打开)03市场份额(在新窗口打开)04Benchmarks(在新窗口打开)05任务类型(在新窗口打开)06最快模型(在新窗口打开)07会话成本(在新窗口打开)08自然语言(在新窗口打开)09编程语言(在新窗口打开)10上下文长度(在新窗口打开)11工具调用(在新窗口打开)12图像(在新窗口打开)13热门应用(在新窗口打开)
B+大模型竞技场(Arena.ai)(在新窗口打开)运营方:Arena Intelligence多模态竞技场/滚动榜入口1101文本竞技场(在新窗口打开)02视觉理解(在新窗口打开)03文档理解(在新窗口打开)04搜索(在新窗口打开)05Agent(在新窗口打开)06网页开发(在新窗口打开)07文生图(在新窗口打开)08图像编辑(在新窗口打开)09文生视频(在新窗口打开)10图生视频(在新窗口打开)11视频编辑(在新窗口打开)
B+Epoch AI 能力与 Benchmarks(在新窗口打开)运营方:Epoch AI研究数据平台/持续更新入口701能力与评测总览(在新窗口打开)02Benchmarks 检索(在新窗口打开)03Epoch Capabilities Index(在新窗口打开)04MirrorCode(在新窗口打开)05FrontierMath Tiers 1–4(在新窗口打开)06FrontierMath Open Problems(在新窗口打开)07使用与下载数据(在新窗口打开)
B-Scale Labs / SEAL(在新窗口打开)运营方:Scale AI专家评测平台/持续更新入口801Humanity’s Last Exam(在新窗口打开)02Coding(在新窗口打开)03Math(在新窗口打开)04指令遵循(在新窗口打开)05工具使用(在新窗口打开)06SWE-bench Pro(在新窗口打开)07视觉语言理解(在新窗口打开)08对抗鲁棒性(在新窗口打开)
A-Stanford HELM(在新窗口打开)运营方:Stanford CRFM多场景评测套件/持续更新入口701HELM Capabilities(在新窗口打开)02HELM Lite(在新窗口打开)03HELM Classic(在新窗口打开)04HELM Safety(在新窗口打开)05AIR-Bench(在新窗口打开)06MedHELM(在新窗口打开)07HEIM(在新窗口打开)