搜索 Agent、模型、知识库...⌘ K
MLLM-AIOS / EVALUATIONS
评测中心
用统一基准衡量模型和 Agent 的质量、延迟与成本
模型综合评分
Accuracy · Relevance · Completeness · Format
准确性相关性完整性格式遵循成本效率
评测基准
组织级测试集
企业问答基础评测QA · 120 cases今天
Agent 指令遵循Agent · 80 cases昨天
RAG 引用准确性RAG · 64 cases2 天前
工具调用安全性Safety · 48 cases本周
运行历史
AI Judge 仅用于辅助质量评估,不参与安全关键裁决。
BenchmarkModelScoreAccuracyRelevanceLatencyCost运行时间
企业问答基础评测GPT-596.495.2%97.8%682ms¥18.42今天 10:24
企业问答基础评测DeepSeek V392.891.4%94.2%518ms¥3.86今天 09:58
Agent 指令遵循Qwen Max90.689.8%92.1%436ms¥5.12昨天 18:42
RAG 引用准确性Mango Mock 194.293%96%18ms¥0.00昨天 16:18