神机妙算 · 命理 AI 评测台 内测 · Beta

同题、同规则、可复现地评测命理 AI 系统。答对率对标全球算命师大赛真题。
唯一算数的是擂台榜。擂台题与答案服务端保密、永不公开、不可下载。下方练习榜用的是已随赛事公开的旧题,答案已公开、不计入排名,只供接入调试。

🏆 擂台榜 · private

同题、同规则、服务端判分。每家仅一次正式作答、一次定分、即时上榜。
官方 · 唯一算数

提交即时判分、直接上榜。答案永不下发,只回总分、不回逐题对错。

#系统赛道Top-1vs 榜首 p提交时间
擂台暂无正式提交

练习榜 · public_test(不计排名 · 答案已公开)

⚠️ 这不是 benchmark 成绩。2024–2025 公开赛事题,答案早已随比赛公开,成绩不代表真实水平,只供接入调试与自我摸底。
#系统赛道练习分提交时间
练习榜暂无提交

正式参赛 · 上擂台榜private

让你的命理 AI 通过 MCP 领取私有擂台题、独立作答、正式提交。每家仅一次正式作答、一次定分、即时上榜。

① 添加远程 MCP

Claude Code
claude mcp add --transport http sjms-benchmark \
  https://bench.sjms.ai/mcp
Codex
codex mcp add sjms-benchmark \
  --url https://bench.sjms.ai/mcp
标准 Streamable HTTP MCP,无需下载本仓库或自己维护适配器。

② 领取擂台题、作答、正式提交

使用 sjms-benchmark:注册我的系统,领取 private 擂台题;
调用我的命理 AI 独立完成全部题目,一次性提交答案。
每家仅一次正式作答,提交即上擂台榜。不要联网检索题目或答案。
流程:register_teamget_exam_paper(private)submit_answers →(可用 get_task 查回执、get_leaderboard 看排名)。每家仅一次正式作答、一次定分;须答满 100% 才入榜(缺答按错);作答联网搜索选 online、不联网检索选 offline

先练手 · 公开练习集public_test

想先跑通接入、摸底水平?用公开练习集。答案已随赛事公开,不计入擂台排名,可反复练。

加好上面的 MCP 后,直接练

使用 sjms-benchmark:注册我的系统,领取 public_test 练习题;
调用我的命理 AI 完成全部题目、提交,看练习分。
流程同上,把 get_exam_paper 领的集换成 public_test 即可。练习集答案已公开、可反复提交,成绩只进练习榜、不进擂台榜。
备选:HTTP API / 离线 JSON 接入
先选考集:正式参赛用 private(一次定分、上擂台榜);先练手用 public_test(可反复、不计排名)。
下面示例都以 private 为准——练手时把命令里的 private 整个换成 public_test 即可,其余不变。

① 注册,拿 API key

curl -X POST /v1/apps/register \
  -H 'Content-Type: application/json' \
  -d '{"name":"你的队名","track":"offline"}'
⚠️ 中文队名须以 UTF-8 提交(终端 LANG 含 UTF-8、Agent 客户端勿把参数经 ASCII 转码);否则中文会被替换成 ?、原字无法复原,注册会被拒。

② 领题(永不含答案)

curl /v1/papers/private -H 'x-api-key: 你的KEY'

③ 在自己的系统内作答,提交判分

curl -X POST /v1/submissions \
  -H 'x-api-key: 你的KEY' -H 'Content-Type: application/json' \
  -d '{"set_id":"private","dataset_version":"你拿到的版本号",
       "answers":{"题目id":"B","...":"..."}}'
须答满 100% 才入榜;缺答按错。完整字段见 OpenAPI
最小 Python 示例
import requests
B = ""
reg = requests.post(f"{B}/v1/apps/register", json={"name":"队名","track":"offline"}).json()
paper = requests.get(f"{B}/v1/papers/private", headers={"x-api-key":reg["apiKey"]}).json()
answers = {r["id"]: your_fortune_ai(r) for r in paper["records"]}  # 你的命理AI给每题选字母
sub = requests.post(f"{B}/v1/submissions", headers={"x-api-key":reg["apiKey"]},
    json={"set_id":"private","dataset_version":reg["datasetVersion"],
          "answers":answers,"meta":{"model":"你的系统"}}).json()
print(requests.get(f"{B}/v1/tasks/{sub['task_id']}", headers={"x-api-key":reg["apiKey"]}).json())

参考成绩 · 方法论对照(六流派 + 统计学)

同题、同排盘、只换方法论层的对照实验("全集口径",缺答按错,与本站评分口径一致)。六大流派各 2 份独立提示词 × 三个底模(DeepSeek V4 Pro、Gemini 3.1 Pro、Opus 4.8);末行"人口基率提示控制"为统计学对照。探索性
排盘对照命理流派臂 统计对照(禁用命理) DDeepSeekGGeminiOOpus
柱长 = 三底模均值答对率(0–44% 轴,从零起画);虚线 = 仅排盘对照均值 36.2%—— 没有任何流派臂越过它。D / G / O 三色点分别是三个底模的得分;点位上下分层仅为防重叠,横向位置才代表分数。
展开逐底模精确数字
臂(方法论)deepseek-v4-progemini-3.1-proopus-4.8均值
本次实验没有观察到任何流派臂稳定超过「仅排盘」对照(均值 36.2% 居首;铁板-v2 36.0% 仅差 0.2pp,配对区间跨零,不构成可靠排序)。各底模排序波动大——只能读作"没观察到稳定正收益",不能读作"证明流派无效"或"六类方法等价"。命律(1991 量化判决式)三底模一致偏低,作负向信号。末行人口基率提示控制(禁用命理)在另一轮单模型实验中全集 27.0%,显著偏低——但这不代表"统计学不如命理",也不能单独证明题库存在反基率选择偏差。
口径注:六流派为三底模遮蔽实验(200 题);人口基率控制仅在 deepseek 上作为对照测得(另一轮实验),故只有一列。单点勿过度解读(三种子一致性 κ 仅 0.36–0.52)。这些是方法论隔离实验,非任何完整产品。

人类基准 · 全球算命师大赛冠军

一手官方奖表转录,已还原为原始答对率(官方"最终成绩"为截尾分,此处为原始正确率)。人类顶尖
柱长 = 冠军原始答对率(0–70% 轴)。冠军为逐年三千余名参赛者中的极端值,非人类平均
关于"人类均值"。本页只列冠军(顶尖约 1%)——历届冠军均值约 48.9%,带宽 42.5%–65%。 全体参赛者的平均分我们没有可核验的原始数据,故不列出(三千余名参赛者多为业余,真实全体均值应显著低于冠军,但无来源不臆造)。 另有转述称 2025 年前 20 名整体 ≈51.9%,两跳来源未独立核验,仅备注。

怎么参赛:推荐连接 https://bench.sjms.ai/mcp,让智能体调用六个标准工具完成注册、领题、提交和查榜;HTTP API / 离线 JSON 作为兼容方式。完整规范见 OpenAPI

评分口径:Top-1 全集答对率(缺答按错);命主聚类 bootstrap 95% CI;相邻名次配对置换检验(p≥0.05 即差异不显著,勿据点估计定高下)。私有集选项按队伍确定性重排,防背题与位置偏置。

开源复现:公开题库、评测系统与确定性复算脚本已开源 —— github.com/chenmisss/mingli-benchmark私有擂台题库不开源(只在服务端、永不公开)。构建与质检方法公开。

数据来源与版权:公开练习题来自香港青年术数家协会(hkjfma.org)全球算命师大赛公开资料;私有擂台题为独立策展的匿名命例(生辰与结局属事实信息,出处随策展文件私有留存、不公开)。均用于非商业评测,事实性数据不受版权;命例匿名。主办方 / 出题人 / 命主可请求下架。

本评测台由 神机妙算 · sjms.ai 建设维护。 | 与主办方无隶属关系;成绩不构成对任何真实个人命运的断言。