Chinese Evaluations

中文测评

聚合更依赖中文语境、文化知识和中文产品表达的模型评测。公开来源分数保持原样;专题内 AI 复评分独立披露协议,不合成为全站总分。

数据快照:2026-07-22查看首项原始评测 ↗
01 / 中文产品任务

命理年度详解

让不同模型解读同一份匿名年度命理样本,比较中文表达、命理依据、现实信号、行动建议与结构化输出稳定性。

11 个有效输出 · AI 四维盲评 · 1 个匿名固定样本查看完整排名 →

SCOPE

怎样理解中文测评

语境独立

命理、古诗词、成语、中文写作等任务各自衡量不同能力,不把它们平均成模糊的“中文总分”。

分数独立

公开来源分数保持原样;本站 AI 复评分只在单个专题内使用,不参与全站总分。

协议透明

披露样本数、评分维度、Judge、轮次、分歧处理、原始输出和已知局限。