Chinese Evaluation / Fortune Telling

命理年度详解模型横评

同一份匿名 2026 年固定样本下,对 11 个有效模型输出进行四维 AI 盲评,比较命理依据、现实洞察、行动建议与中文表达。

数据快照:2026-07-22查看 Kline-star 原始输出 ↗
有效输出11
固定样本1
AI Judgehy3-preview
匿名评分2+ 轮

AI CONTENT SCORE

11 个有效输出完整排名

四项内容维度各 25 分,总分 100。切换维度后,榜单按对应分数重新排序;展开模型可查看原文证据和两轮分差。

11 / 11 个有效输出

综合得分四项内容维度之和 · 数值越高越好
满分 100
  1. 01
    DeepSeek-V4-FlashTencentMaaS
    结构通过
    95/100

    命理逻辑连贯,现实信号具体,建议明确可执行,中文表达自然有节奏,仅少量冗余。

    查看四维得分与原文依据
    命理依据24/25
    现实洞察24/25
    行动建议24/25
    中文表达23/25
    岁运并临,火势极旺,偏财星强力显现,意味着在事业和财富上

    两轮分差 1

    查看该次完整输出 ↗
  2. 02
    GLM-5V-TurboTencentMaaS
    结构通过
    94/100

    命理逻辑连贯,现实信号具体,建议可执行,表达流畅有节奏,仅结尾稍显截断。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察24/25
    行动建议23/25
    中文表达24/25
    丙午大运遇上丙午流年,这在八字中叫'岁运并临'

    两轮分差 4

    查看该次完整输出 ↗
  3. 03
    DeepSeek-V4-ProTencentMaaS
    结构通过
    94/100

    命理逻辑连贯,现实信号具体,建议可执行,表达流畅有节奏,仅部分表述稍显重复。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察24/25
    行动建议24/25
    中文表达23/25
    岁运并临,物极必反,这股强大的火气也在剧烈消耗你的根基。

    两轮分差 4

    查看该次完整输出 ↗
  4. 04
    MiniMax-M2.7TencentMaaS
    需工程修复
    93/100

    命理逻辑清晰,现实信号具体可识别,建议克制可执行,表达自然流畅。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察24/25
    行动建议23/25
    中文表达23/25
    丙午大运遇上丙午流年,岁运并临,能量叠加极为强烈

    两轮分差 4

    查看该次完整输出 ↗
  5. 05
    DeepSeek-V3.2TencentMaaS
    结构通过
    91/100

    命理逻辑清晰,现实映射具体,建议较实用,表达稍冗长,部分内容重复。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察23/25
    行动建议23/25
    中文表达22/25
    烈火烹油,事业财富冲高之年,亦是身心消耗、关系紧绷的转折关口

    两轮分差 5

    查看该次完整输出 ↗
  6. 06
    Hy3 PreviewTencentMaaS
    结构通过
    90/100

    命理逻辑通顺,现实信号清晰,建议具体可行,表达自然,仅细节稍显泛泛。

    查看四维得分与原文依据
    命理依据22/25
    现实洞察23/25
    行动建议23/25
    中文表达22/25
    事业和资源层面有明显冲高空间,但身体和情绪消耗也同步放大。

    两轮分差 0

    查看该次完整输出 ↗
  7. 07
    MiniMax-M2.5TencentMaaS
    结构通过
    89/100

    命理逻辑连贯,现实信号具体,建议可执行,中文表达自然有节奏,仅个别表述稍显夸张。

    查看四维得分与原文依据
    命理依据23/25
    现实洞察22/25
    行动建议22/25
    中文表达22/25
    岁运并临之年,烈火烹油,财富事业冲顶之机稍纵即逝

    两轮分差 5

    查看该次完整输出 ↗
  8. 08
    Xiaomi MiMo V2.5 ProXiaomi MiMo Token Plan
    结构通过
    88/100

    命理推导合理,现实对应较具体,建议较明确,表达稍模板化,部分内容偏泛。

    查看四维得分与原文依据
    命理依据22/25
    现实洞察23/25
    行动建议22/25
    中文表达21/25
    岁运并临如日中天,财势冲高暗藏透支,需防盛极而衰

    两轮分差 3

    查看该次完整输出 ↗
  9. 09
    DeepSeek-V3.0324TencentMaaS
    需工程修复
    87/100

    命理逻辑连贯,现实信号具体,建议较明确但含保健品断言,表达自然流畅。

    查看四维得分与原文依据
    命理依据22/25
    现实洞察23/25
    行动建议20/25
    中文表达22/25
    配备护肝保健品,9月前完成重大事项保险配置

    两轮分差 18 · 已触发第三轮复评

    查看该次完整输出 ↗
  10. 10
    GLM-5TencentMaaS
    需工程修复
    84/100

    岁运并临解释清晰,现实场景具体,建议有止盈但缺细节,表达有节奏感。

    查看四维得分与原文依据
    命理依据21/25
    现实洞察22/25
    行动建议19/25
    中文表达22/25
    宜设定明确的止盈线,落袋为安或购置保值资产

    两轮分差 14 · 已触发第三轮复评

    查看该次完整输出 ↗
  11. 11
    GLM-5.1TencentMaaS
    需工程修复
    47/100

    命理逻辑有偏差,现实信号不完整,建议零散,内容截断,表达不连贯。

    查看四维得分与原文依据
    命理依据12/25
    现实洞察13/25
    行动建议10/25
    中文表达12/25
    恋爱婚姻

    两轮分差 4

    查看该次完整输出 ↗

ENGINEERING STATUS

内容得分之外的工程状态

格式问题不会改写 AI 内容分。4 个输出需要 JSON 修复或补齐字段;小米追加批次的延迟不参与同批次比较。

11 个有效输出的工程状态
排名模型内容分JSON字段延迟输出原文
01DeepSeek-V4-FlashTencentMaaS95通过完整21.5 秒1,564 Token查看 ↗
02GLM-5V-TurboTencentMaaS94通过完整88.4 秒2,400 Token查看 ↗
03DeepSeek-V4-ProTencentMaaS94通过完整43.7 秒1,616 Token查看 ↗
04MiniMax-M2.7TencentMaaS93需修复不完整85.8 秒1,872 Token查看 ↗
05DeepSeek-V3.2TencentMaaS91通过完整39.2 秒1,309 Token查看 ↗
06Hy3 PreviewTencentMaaS90通过完整43.7 秒977 Token查看 ↗
07MiniMax-M2.5TencentMaaS89通过完整27.2 秒2,045 Token查看 ↗
08Xiaomi MiMo V2.5 ProXiaomi MiMo Token Plan88通过完整61.8 秒*1,258 Token查看 ↗
09DeepSeek-V3.0324TencentMaaS87需修复不完整27.0 秒794 Token查看 ↗
10GLM-5TencentMaaS84需修复不完整42.5 秒2,400 Token查看 ↗
11GLM-5.1TencentMaaS47通过不完整52.1 秒2,400 Token查看 ↗

* Xiaomi MiMo V2.5 Pro 来自后续独立批次,最大输出长度不同,延迟只作记录。

JUDGING PROTOCOL

AI 盲评怎样产生

同一份匿名固定样本:事业与财富得分较高、健康得分较低,用于检验模型能否解释高机会与高风险并存的年度状态。

  1. 01

    命理依据是否解释大运、流年、藏干、十神与岁运并临,而不是只堆术语

  2. 02

    是否把事业、财富、关系与健康的强弱翻译成具体体感和现实信号

  3. 03

    行动建议是否明确、克制、可执行,能够回应高机会与高风险并存的状态

  4. 04

    中文是否自然、清晰、有节奏,适合面向用户的产品阅读

JudgeTencent MaaS · hy3-preview

temperature 0.2

盲评方式隐藏模型名并重排顺序

至少 2 轮独立评分

分歧处理分差超过 10 分

触发第三轮,按各维中位数聚合

评分版本fortune-content-v1

2026-07-22

工程记录另算

API 调用状态 · JSON 可解析性 · 字段完整性 · 输出截断 · 延迟与输出 Token

查看主批次运行记录 ↗

LIMITATIONS

这份排名不能说明什么

它是固定样本上的内容质量复评,不是命理有效性证明,也不是通用中文能力排名。

单一样本

这是单一匿名固定样本,不代表模型在所有命理任务上的平均水平。

专题内分数

内容得分由 AI Judge 在匿名、乱序条件下按专题 rubric 生成,只适用于本次固定样本,不是全站综合评分。

批次不同

小米模型来自后续独立批次,最大输出长度不同,因此延迟不宜与主批次直接排名。

非科学验证

本专题评估中文产品输出质量与结构稳定性,不验证命理预测是否具有科学有效性;Judge 也可能存在模型偏好。

PROVENANCE

来源与机器数据

结构化镜像同时保留 11 个有效输出、AI Judge 逐轮分数和原始运行记录。