MLLM-AIOS / EVALUATIONS

评测中心

用统一基准衡量模型和 Agent 的质量、延迟与成本

最佳综合分96.4GPT-5 · 企业问答
平均准确率92.8%本周 +2.4%
平均延迟432ms较上周 -8.6%
评测成本¥126.8本月 38 次运行

模型综合评分

Accuracy · Relevance · Completeness · Format

准确性相关性完整性格式遵循成本效率
GPT-5DeepSeek V3

评测基准

组织级测试集

企业问答基础评测QA · 120 cases今天
Agent 指令遵循Agent · 80 cases昨天
RAG 引用准确性RAG · 64 cases2 天前
工具调用安全性Safety · 48 cases本周

运行历史

AI Judge 仅用于辅助质量评估,不参与安全关键裁决。

BenchmarkModelScoreAccuracyRelevanceLatencyCost运行时间
企业问答基础评测GPT-596.495.2%97.8%682ms¥18.42今天 10:24
企业问答基础评测DeepSeek V392.891.4%94.2%518ms¥3.86今天 09:58
Agent 指令遵循Qwen Max90.689.8%92.1%436ms¥5.12昨天 18:42
RAG 引用准确性Mango Mock 194.293%96%18ms¥0.00昨天 16:18