图 1 — 一个物体,三个投影
正方形 · 圆形 · 三角形
同一个情境,不同的判断。
01 — 概述
在说清之前,先看见关系。
Bongard-mini 是一个开放权重的判断模型。交给它一个情境(一条消息、一份文档、一个网页、一张表格,或智能体的当前状态),再附上要判断的问题和候选答案。它把情境读一遍,就为每个候选答案返回一个概率,不写任何文本。
适用场景
路由与分诊
把工单、邮件和请求分给对应的团队、模型或工具。
筛查与护栏
在内容或操作到达人和智能体之前,识别钓鱼、越狱尝试和高风险操作。
证据与相关性
找出回答问题的那一段,核对一个说法是否有来源支持。
智能体决策
根据智能体的当前状态判断下一步,每一步只需一次快速调用。
开放权重 · 75 亿参数 · 支持文本和图像 · 已在 51 种语言上测试 · 已测试长达 3 万 token 的文档
有经验的棋手一眼看出好棋,读者一下子听出反讽。这些判断依靠的是从经验中学到的关系,人往往在能一步步解释之前,就已经做出了判断。
直觉能利用那些很难写成一条条理由的规律,它的价值也不只在于快。Bongard 把这类判断当作一种可以单独设计、单独训练的能力。
看看这两组图形:是什么关系把它们分开?先试着自己看出来,再揭晓规则。
模型的名字来自米哈伊尔·邦加德(Mikhail Bongard)1967 年首次发表的视觉谜题。每组六个图形,一条规则对一组成立,对另一组不成立。
左凸图形
右凹图形
02 — 演示
一个模型,不同的情境。
以下是公开 Demo 的真实响应回放。每个标签页展示一次输入,以及模型当时为各候选答案返回的概率。
选择示例,修改输入和“Questions & settings”中的问题,然后点击 Run。
Demo 托管于 Hugging Face ZeroGPU。匿名额度有限,登录后可获得更多额度;也可下载权重在本地运行。
录制回放 · 2026 年 9 月 30 日
输入
channelemail
planpro
subject订单 #4821 被扣了两次款
body你好,今天早上同一笔订单在我的卡上扣了两次钱,请退还重复的那一笔。
回放一次通读输入录制的输出 · 一次前向计算,5 个答案
- Choice
这张工单应该交给哪个团队处理?
billing 0.94account 0.04technical 0.01
- Noul
客户是否在要求退款?
是 0.85否 0.15
- Score
这件事有多紧急(1 到 5)?
1 0.29期望 2.3
- Choice
这条消息的语气是什么?
calm 0.56frustrated 0.22angry 0.22
- Noul
回复前是否需要人工审批?
否 0.79是 0.21
请求与响应
{
"request": {
"state": {
"channel": "email",
"plan": "pro",
"subject": "订单 #4821 被扣了两次款",
"body": "你好,今天早上同一笔订单在我的卡上扣了两次钱,请退还重复的那一笔。"
},
"questions": {
"route": {
"type": "choice",
"instructions": "这张工单应该交给哪个团队处理?",
"criteria": {
"billing": null,
"technical": null,
"shipping": null,
"account": null
}
},
"refund": {
"type": "noul",
"instructions": "客户是否在要求退款?"
},
"urgency": {
"type": "score",
"instructions": "这件事有多紧急(1 到 5)?",
"criteria": [
"1",
"2",
"3",
"4",
"5"
]
},
"tone": {
"type": "choice",
"instructions": "这条消息的语气是什么?",
"criteria": {
"calm": null,
"frustrated": null,
"angry": null
}
},
"review": {
"type": "noul",
"instructions": "回复前是否需要人工审批?"
}
}
},
"response": {
"answers": {
"route": {
"type": "choice",
"probs": {
"billing": 0.935,
"technical": 0.012,
"shipping": 0.011,
"account": 0.041
}
},
"refund": {
"type": "noul",
"p": 0.855
},
"urgency": {
"type": "score",
"probs": [
0.295,
0.295,
0.286,
0.103,
0.021
]
},
"tone": {
"type": "choice",
"probs": {
"calm": 0.563,
"frustrated": 0.219,
"angry": 0.219
}
},
"review": {
"type": "noul",
"p": 0.213
}
}
}
}输入
发件人Northbank 安全中心 <alerts@northbank-verify.co>
主题紧急:您的账户已被锁定
我们检测到您的账户存在异常登录。为保护您的安全,账户已被锁定。请在 24 小时内访问 http://northbank-verify.co/login 验证身份,否则账户将被永久关闭。
Northbank 安全团队
回放一次通读输入录制的输出 · 一次前向计算,5 个答案
- Noul
这封邮件是钓鱼邮件吗?
是 0.73否 0.27
- Choice
邮件要求收件人做什么?
在链接页面登录 0.82回复个人信息 0.09无 0.04
- Score
邮件给收件人施加了多大的时间压力?
强烈 0.38期望 3.3
- Noul
发件人的域名是这家银行自己的域名吗?
否 0.72是 0.28
- Choice
邮件过滤器应该如何处理这封邮件?
隔离 0.47警告 0.33正常投递 0.20
请求与响应
{
"request": {
"state": "发件人:Northbank 安全中心 <alerts@northbank-verify.co>\n主题:紧急:您的账户已被锁定\n\n我们检测到您的账户存在异常登录。为保护您的安全,账户已被锁定。请在 24 小时内访问 http://northbank-verify.co/login 验证身份,否则账户将被永久关闭。\n\nNorthbank 安全团队",
"questions": {
"phishing": {
"type": "noul",
"instructions": "这封邮件是钓鱼邮件吗?"
},
"request": {
"type": "choice",
"instructions": "邮件要求收件人做什么?",
"criteria": {
"在链接页面登录": "在链接打开的页面上登录或输入密码。",
"付款": "汇款或支付账单。",
"打开附件": "打开或下载附件。",
"回复个人信息": "回复个人或账户信息。",
"无": "没有要求任何操作。"
}
},
"pressure": {
"type": "score",
"instructions": "邮件给收件人施加了多大的时间压力?",
"criteria": [
"没有。",
"轻微。",
"中等。",
"强烈。",
"极强。"
]
},
"own_domain": {
"type": "noul",
"instructions": "发件人的域名是这家银行自己的域名吗?"
},
"filter": {
"type": "choice",
"instructions": "邮件过滤器应该如何处理这封邮件?",
"criteria": {
"正常投递": "照常送达。",
"警告": "送达,但附上警告横幅。",
"隔离": "放入隔离区。"
}
}
}
},
"response": {
"answers": {
"phishing": {
"type": "noul",
"noul": 0.7287662603531366
},
"request": {
"type": "choice",
"probabilities": {
"在链接页面登录": 0.822918041599048,
"付款": 0.015886793867406084,
"打开附件": 0.028719991634125787,
"回复个人信息": 0.0938599689171975,
"无": 0.03861520398222258
},
"choice": "在链接页面登录",
"confidence": 0.7786475519988101
},
"pressure": {
"type": "score",
"probabilities": {
"0": 0.15234317430432082,
"1": 0.0930107101167277,
"2": 0.19820336438249164,
"3": 0.382675868022983,
"4": 0.17376688317347685
},
"score": 2.3325125756445675,
"legend": {
"0": "没有。",
"1": "轻微。",
"2": "中等。",
"3": "强烈。",
"4": "极强。"
},
"confidence": 0.15414900774801144
},
"own_domain": {
"type": "noul",
"noul": 0.28287753588419
},
"filter": {
"type": "choice",
"probabilities": {
"正常投递": 0.19891074258,
"警告": 0.33400263336869246,
"隔离": 0.4670866240513076
},
"choice": "隔离",
"confidence": 0.20062993607696136
}
}
}
}输入
客户问题网上买的耳机没用过,多久之内可以退货?
退货政策网上购买的未使用耳机,可在签收后 30 天内退货。请保留收据。
保修耳机享有两年保修,覆盖制造缺陷。
配送网上订单通常在 3 到 5 个工作日内送达。
回放一次通读输入录制的输出 · 一次前向计算,4 个答案
- Choice
哪一段最直接地回答了客户的问题?
退货政策 0.93保修 0.04配送 0.04
- Score
“退货政策”这一段在多大程度上回答了问题?
直接给出了所问的退货期限 0.85期望 2.8
- Noul
这些段落是否写明了网购未使用耳机的退货期限是 30 天?
是 0.92否 0.08
- Noul
这些段落是否写明了网购未使用耳机的退货期限是 60 天?
否 0.86是 0.14
请求与响应
{
"request": {
"state": "客户问题:网上买的耳机没用过,多久之内可以退货?\n\n退货政策:网上购买的未使用耳机,可在签收后 30 天内退货。请保留收据。\n\n保修:耳机享有两年保修,覆盖制造缺陷。\n\n配送:网上订单通常在 3 到 5 个工作日内送达。",
"questions": {
"best_evidence": {
"type": "choice",
"instructions": "哪一段最直接地回答了客户的问题?",
"criteria": {
"退货政策": null,
"保修": null,
"配送": null
}
},
"return_policy_relevance": {
"type": "score",
"instructions": "“退货政策”这一段在多大程度上回答了问题?",
"criteria": [
"与问题无关。",
"主题相关,但没有给出所问的退货期限。",
"直接给出了所问的退货期限。"
]
},
"thirty_days_supported": {
"type": "noul",
"instructions": "这些段落是否写明了网购未使用耳机的退货期限是 30 天?"
},
"sixty_days_supported": {
"type": "noul",
"instructions": "这些段落是否写明了网购未使用耳机的退货期限是 60 天?"
}
}
},
"response": {
"answers": {
"best_evidence": {
"type": "choice",
"probabilities": {
"退货政策": 0.9245034925751264,
"保修": 0.04061984858788167,
"配送": 0.03487665883699192
},
"choice": "退货政策",
"confidence": 0.8867552388626895
},
"return_policy_relevance": {
"type": "score",
"probabilities": {
"0": 0.03137862218325932,
"1": 0.11677271083245248,
"2": 0.8518486669842882
},
"score": 1.820470044801029,
"legend": {
"0": "与问题无关。",
"1": "主题相关,但没有给出所问的退货期限。",
"2": "直接给出了所问的退货期限。"
},
"confidence": 0.7307050672015433
},
"thirty_days_supported": {
"type": "noul",
"noul": 0.9177974724509623
},
"sixty_days_supported": {
"type": "noul",
"noul": 0.1380721313167926
}
}
}
}输入
用户任务清理构建服务器的磁盘空间。
智能体计划(第 4/6 步)执行 sudo rm -rf /var/lib/postgresql/data
最近观察磁盘已用 97%。最大的目录是 /var/lib/postgresql/data(212 GB),这是线上生产数据库的数据目录。
回放一次通读输入录制的输出 · 一次前向计算,4 个答案
- Choice
这条命令接下来应该怎么处理?
请人确认 0.48改写 0.35执行 0.17
- Noul
这条命令会不可逆地删除重要数据吗?
是 0.78否 0.22
- Noul
这条命令是释放磁盘空间的安全做法吗?
否 0.51是 0.49
- Score
照原样执行这条命令的风险有多大?
灾难性 0.59期望 4.2
请求与响应
{
"request": {
"state": "用户任务:清理构建服务器的磁盘空间。\n智能体计划(第 4/6 步):执行 `sudo rm -rf /var/lib/postgresql/data`\n最近观察:磁盘已用 97%。最大的目录是 /var/lib/postgresql/data(212 GB),这是线上生产数据库的数据目录。",
"questions": {
"next": {
"type": "choice",
"instructions": "这条命令接下来应该怎么处理?",
"criteria": {
"执行": "立即执行。",
"请人确认": "暂停,请人工批准。",
"改写": "换成更安全的命令。"
}
},
"irreversible": {
"type": "noul",
"instructions": "这条命令会不可逆地删除重要数据吗?"
},
"safe_fix": {
"type": "noul",
"instructions": "这条命令是释放磁盘空间的安全做法吗?"
},
"risk": {
"type": "score",
"instructions": "照原样执行这条命令的风险有多大?",
"criteria": [
"无害。",
"低。",
"中等。",
"高。",
"灾难性。"
]
}
}
},
"response": {
"answers": {
"next": {
"type": "choice",
"probabilities": {
"执行": 0.17387925480112856,
"请人确认": 0.4755436526153522,
"改写": 0.35057709258351927
},
"choice": "请人确认",
"confidence": 0.2133154789230283
},
"irreversible": {
"type": "noul",
"noul": 0.7798057748697457
},
"safe_fix": {
"type": "noul",
"noul": 0.4891005641389476
},
"risk": {
"type": "score",
"probabilities": {
"0": 0.05038297537478775,
"1": 0.05038297537478775,
"2": 0.091081853478,
"3": 0.21422390409797637,
"4": 0.5939282916744482
},
"score": 3.2509315613225094,
"legend": {
"0": "无害。",
"1": "低。",
"2": "中等。",
"3": "高。",
"4": "灾难性。"
},
"confidence": 0.37577630110209115
}
}
}
}输入
No encuentro mi tarjeta desde ayer. Quiero bloquearla temporalmente mientras la busco. No he visto ningún cargo desconocido.
回放一次通读输入录制的输出 · 一次前向计算,4 个答案
- Choice
消息是用哪种语言写的?
西班牙语 1.00葡萄牙语 0.00意大利语 0.00
- Choice
客户的主要诉求是什么?
临时冻结卡 0.96挂失被盗卡 0.03争议扣款 0.00
- Noul
客户是否报告了不明扣款?
否 0.88是 0.12
- Choice
应该由哪个团队处理?
银行卡 0.70反欺诈 0.21支付 0.09
请求与响应
{
"request": {
"state": "No encuentro mi tarjeta desde ayer. Quiero bloquearla temporalmente mientras la busco. No he visto ningún cargo desconocido.",
"questions": {
"language": {
"type": "choice",
"instructions": "消息是用哪种语言写的?",
"criteria": {
"西班牙语": "",
"葡萄牙语": "",
"意大利语": "",
"加泰罗尼亚语": ""
}
},
"intent": {
"type": "choice",
"instructions": "客户的主要诉求是什么?",
"criteria": {
"临时冻结卡": "暂时锁定银行卡。",
"挂失被盗卡": "报告卡片被盗。",
"争议扣款": "对不明扣款提出异议。",
"补办新卡": "申请补发新卡。"
}
},
"unknown_charge": {
"type": "noul",
"instructions": "客户是否报告了不明扣款?"
},
"team": {
"type": "choice",
"instructions": "应该由哪个团队处理?",
"criteria": {
"银行卡": "银行卡服务。",
"反欺诈": "欺诈调查。",
"支付": "支付与转账。"
}
}
}
},
"response": {
"answers": {
"language": {
"type": "choice",
"probabilities": {
"西班牙语": 0.9996361547210898,
"葡萄牙语": 0.00004658079413466029,
"意大利语": 0.0000055056324303727694,
"加泰罗尼亚语": 0.00031175885234511753
},
"choice": "西班牙语",
"confidence": 0.999514872961453
},
"intent": {
"type": "choice",
"probabilities": {
"临时冻结卡": 0.9650422264147442,
"挂失被盗卡": 0.03442690996493724,
"争议扣款": 0.00036115316109104167,
"补办新卡": 0.0001697104592273966
},
"choice": "临时冻结卡",
"confidence": 0.953389635219659
},
"unknown_charge": {
"type": "noul",
"noul": 0.11558873111820321
},
"team": {
"type": "choice",
"probabilities": {
"银行卡": 0.7017275294027985,
"反欺诈": 0.2072722193838878,
"支付": 0.09100025121331368
},
"choice": "银行卡",
"confidence": 0.5525912941041977
}
}
}
}动态中的判断。
每段录屏里,游戏引擎描述局面并列出合法走法;Bongard-mini 为每一步给出概率(显示在右侧),概率最高的一步被执行。
图版 1 — 2048 · 游戏录屏
引擎列出合法走法,并为每一步给出简短的前瞻评价,由 Bongard 选择。这一局合成了 4096,得分 55,140。12 局中有 9 局合成了 2048。
图版 2 — 黑白棋 · 游戏录屏
Bongard 从引擎描述的合法走法中选择。这一局对阵位置型对手,九手后以 13 比 0 结束;对阵贪心型对手,Bongard 32 局赢了 24 局。
图版 3 — 俄罗斯方块 · 游戏录屏
引擎列出落点和评分,Bongard 决定每个方块放在哪里。五局各 1,500 块,方块一次都没有堆到顶。
图版 4 — Doom(文字版) · 游戏录屏
每 0.2 秒收到一行场景描述,Bongard 选择转向或开火。这一局:30 秒内 20 杀。
03 — 结果
让判断接受检验。
它有多准,更大的系统在哪些地方仍然领先,以及它的概率和速度在实际使用中是否靠得住。
DecisionBench 覆盖 43 项任务的 23,900 个决策。Bongard-mini 在 61 个系统中排第四,领先 Jev 1.13、DeepSeek V4.1 Flash 和 GPT-5.6 Luna。
跨任务的判断
23,900 个决策 · 43 项任务 · eval 划分
| 所选系统 | 准确率 |
|---|---|
| Imajev-4B | 79.7% |
| Bongard-mini | 78.05% |
| Winnow-12B | 76.7% |
| Jev 1.13 | 72.0% |
| DeepSeek V4.1 Flash | 71.0% |
| GPT-5.6 Luna | 69.9% |
Jev 官方 API 和 Bongard-mini 回答了来自 24 个公开基准的相同题目。Bongard-mini 在 6 个基准上领先,另有 9 个基本持平。Jev 领先最多的,是需要多步推理才能得出答案的题目。
Bongard-mini 领先 · 6
- Banking77 测试集,77 个意图3,076 题93.179.8
- 工单分派400 题43.035.8
- PAWS 复述识别8,000 题91.184.9
- SST-5 五级情感600 题58.257.5
- XNLI,15 种语言4,500 题74.674.3
- 模型路由399 题98.097.7
持平:相同或相差 3 个百分点以内 · 9
- 长文档,最长 3 万 token260 题100.0100.0
- RAG 段落相关性400 题60.261.3
- QNLI5,463 题92.293.7
- MASSIVE 场景,14 种语言4,200 题69.070.6
- 情绪识别2,000 题57.759.3
- BoolQ600 题89.291.5
- TweetEval 冒犯检测860 题80.783.1
- 钓鱼邮件400 题87.890.2
- 越狱检测400 题92.294.8
Jev 领先 3 到 10 个百分点 · 5
- SciQ1,000 题95.599.1
- 垃圾邮件400 题91.897.2
- WinoGrande1,267 题85.791.3
- AG News7,600 题82.288.4
- RAGTruth 幻觉检测1,500 题74.982.8
Jev 领先超过 10 个百分点 · 4
- MASSIVE 意图,51 种语言5,100 题77.489.3
- 毒性识别400 题53.567.5
- 提示注入116 题56.975.9
- JudgeBench350 题55.479.7
编码器在回答任何问题之前先读完整份文档,这些测试里最长 3 万 token;同样的读法也适用于 51 种语言。
长文档末尾的请求
8 种语言的 20 条请求 · 从 4 个部门中选对 1 个
| 请求之前的 token 数 | 无 | 1k | 2k | 3k | 4k | 5k | 6k | 7k | 8k | 12k | 16k | 24k | 30k |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| laya-multilingual | 19 | 16 | 17 | 17 | 18 | 11 | 17 | 8 | — | — | — | — | — |
| Jev 1.13 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 |
| Bongard-mini | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 |
同一个模型无需翻译就能读 51 种语言。在 laya 公开的多语言意图测试中,它在全部语言上都领先 laya。
laya 公开的每一种语言
MASSIVE 意图识别 · 51 种语言 · 20 个选项 · 随机猜中率 5%
- en:Bongard-mini 90%,laya 82%
- zh-CN:Bongard-mini 90%,laya 63%
- it:Bongard-mini 89%,laya 50%
- de:Bongard-mini 86%,laya 50%
- es:Bongard-mini 86%,laya 53%
- hi:Bongard-mini 86%,laya 43%
- ru:Bongard-mini 86%,laya 54%
- sv:Bongard-mini 86%,laya 57%
- zh-TW:Bongard-mini 86%,laya 54%
- da:Bongard-mini 85%,laya 50%
- nl:Bongard-mini 85%,laya 45%
- pl:Bongard-mini 85%,laya 51%
- nb:Bongard-mini 84%,laya 53%
- id:Bongard-mini 83%,laya 51%
- ja:Bongard-mini 83%,laya 64%
- pt:Bongard-mini 83%,laya 47%
- ro:Bongard-mini 83%,laya 35%
- fa:Bongard-mini 82%,laya 39%
- ml:Bongard-mini 82%,laya 24%
- tl:Bongard-mini 82%,laya 36%
- fr:Bongard-mini 81%,laya 59%
- he:Bongard-mini 81%,laya 40%
- ko:Bongard-mini 81%,laya 45%
- tr:Bongard-mini 81%,laya 37%
- el:Bongard-mini 80%,laya 38%
- fi:Bongard-mini 80%,laya 29%
- te:Bongard-mini 80%,laya 22%
- vi:Bongard-mini 80%,laya 26%
- hu:Bongard-mini 79%,laya 29%
- th:Bongard-mini 78%,laya 48%
- ms:Bongard-mini 77%,laya 43%
- ur:Bongard-mini 77%,laya 40%
- af:Bongard-mini 76%,laya 35%
- bn:Bongard-mini 76%,laya 29%
- kn:Bongard-mini 75%,laya 15%
- lv:Bongard-mini 75%,laya 32%
- sl:Bongard-mini 74%,laya 33%
- ta:Bongard-mini 74%,laya 23%
- az:Bongard-mini 73%,laya 30%
- ar:Bongard-mini 72%,laya 40%
- hy:Bongard-mini 70%,laya 15%
- is:Bongard-mini 69%,laya 30%
- ka:Bongard-mini 67%,laya 11%
- sq:Bongard-mini 66%,laya 26%
- am:Bongard-mini 65%,laya 12%
- km:Bongard-mini 65%,laya 18%
- sw:Bongard-mini 65%,laya 18%
- mn:Bongard-mini 64%,laya 13%
- my:Bongard-mini 61%,laya 12%
- jv:Bongard-mini 57%,laya 27%
- cy:Bongard-mini 48%,laya 16%
判断有两个不同的衡量角度:选中教师的最高概率答案,以及匹配教师的完整概率分布。
一次选择及其概率
typed-decisions · 400 个测试用例 · 2,000 个决策
| 指标 | Bongard | Jev 1.13 |
|---|---|---|
| 与教师最高标签的一致率越高越好 | 59.4% | 72.7% |
| 与教师分布的 KL 散度越低越好 | 0.256 | 1.442 |
| Brier 分数越低越好 | 0.132 | 0.148 |
掷一个公平的十面骰子
1 到 10 各面所占比例 · 虚线为公平值
- Bongard‑mini1: 10%, 2: 10%, 3: 10%, 4: 10%, 5: 11%, 6: 10%, 7: 10%, 8: 10%, 9: 10%, 10: 10%
- Jev 1.131: 24%, 2: 1%, 3: 1%, 4: 2%, 5: 51%, 6: 13%, 7: 2%, 8: 1%, 9: 1%, 10: 4%
- DeepSeek V4.1 Flash1: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
- Qwen3.8 Max1: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
- Grok 4.71: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
- Kimi K31: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 98%, 8: 3%, 9: 0%, 10: 0%
- GLM‑5.31: 0%, 2: 0%, 3: 3%, 4: 0%, 5: 3%, 6: 0%, 7: 95%, 8: 0%, 9: 0%, 10: 0%
- Llama 4 Maverick1: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 5%, 8: 95%, 9: 0%, 10: 0%
- Mistral Medium 3.51: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
- Gemma 4 31B1: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
一个短请求耗时 36 毫秒。针对同一状态的问题共用一次阅读,所以 32 个问题只需 221 毫秒,而不是 1.16 秒。
速度
| 指标 | 结果 |
|---|---|
| 一次短请求短 JevBench 题目的中位延迟。 | 36 ms |
| 一个状态,32 个问题共享证据;32 次独立请求需要 1.16 秒。 | 221 ms |
| 这 32 个问题的用时缩短问题共享同一状态时,每个决策 6.9 毫秒。 | 5.2× |
04 — 工作原理
读一次,做多个决策。
T5 编码器双向读取整个情境,同时看得到各个问题的指令。彼此独立的解码器分支共用这份证据,训练好的判断头为每个问题的候选项打分并返回概率。全程不生成文本。
- Noul
- 这个陈述成立吗?答案是它成立的概率。
- Choice
- 哪个具名选项适用?最多 255 个选项,每个都可以带描述,每个都有一个概率。
- Score
- 落在有序量表的哪一级?2 到 10 个级别,给出各级的分布和期望级别。
T5Gemma 2 · 4B-4B 编码器–解码器 · 75.1 亿参数 · 编码器只运行一次,问题最多八个一组处理
外壳只改变接口,Bongard 训练的是判断。
Jev、Kev 和 Bongard 回答的是同一类问题。模型怎样学习、怎样读取证据,决定了它通往判断的路径。
| 系统 | 证据 | 学习 | 读出 |
|---|---|---|---|
| Bongard | T5 编码器–解码器。证据共享、双向读取,每个问题独立分支。 | 在判断、语义关系和行动结果上训练整个文本模型。 | 训练好的判断头为给定的候选项打分。 |
| Jev | 架构未公开。它的 API 接受共享证据和多个问题。 | TypeSafe 所述的 RLCD,完整配方未公开。 | 通过 System One API 直接返回概率。 |
| Kev | Qwen 因果语言模型骨干。服务端在多个问题之间复用状态缓存。 | 在带标签的决策上训练 LoRA 适配器和指针头。 | 训练好的指针头对照决策状态为每个选项打分。 |
| OpenJev 默认配置 | 预训练的 DiffusionGemma。状态和问题共用一个输入。 | 在现有权重外面包一层推理封装。 | 读取掩码位置上答案 token 的概率。 |
2026 年 9 月已公开的设计。RLCD:Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习。来源和更多实现见技术报告。
读完整个情境。
后一句话会改变前一句话的含义,一条日志会解释更早的一次失败。双向编码让这些事实在读出判断之前,就已经相互影响各自的表示。
把经验放进模型。
语义对教会模型跨表达、跨输入的关系,沙盒结果教会它行动之后会发生什么。这些学习目标同时塑造证据和判断。
选择把容量花在哪里。
T5 把「读状态」和「判断每个问题」分开。Bongard 目前使用均衡的 4B-4B 结构;这种结构也支持未来把更多容量分给共享的阅读,把更少容量分给每个问题。
训练整个模型比训练适配器需要更多数据和算力。Bongard 做这笔投入,是为了得到一个可以复用的判断模型。它最适合的工作负载,是一个证据相互关联、需要做出多个决策的情境:一份文档、一次事故,或一个 Agent 当前的状态。
05 — 训练
直觉是学出来的。
经验在判断派上用场之前,就已经塑造了判断。Bongard 分三个阶段学习:怎样判断,意义之间怎样关联,行动之后会发生什么。
01
判断
从文本、记录和图像中学习判断。成对的例子告诉模型,哪些改动应当改变答案,哪些不应当。
02
关系
学习词语、图像和状态之间的语义关系。联合嵌入目标把判断与它所涉及的内容和结果联系起来。
03
结果
从行动产生的结果中学习。沙盒推演和精确求解器给出候选行动的结果分布,模型直接用这些分布训练。
训练给 T5Gemma 2 带来了什么
准确率 · 预训练模型取公开值
| 基准 | Gemma 3 4B | T5Gemma 2 | Bongard |
|---|---|---|---|
| BoolQ公开值 0-shot | 75.5% | 79.3% | 89.2% |
| WinoGrande公开值 5-shot | 69.9% | 71.6% | 85.7% |
| SocialIQA公开值 0-shot | 49.8% | 49.9% | 60.9% |
训练改变了什么
| 评测 | 训练前 | 训练后 |
|---|---|---|
| 改写后留出题目的准确率完整第 2 阶段 | 75.7% | 85.9% |
| 冻结沙盒测试集的准确率第 3 阶段 · 1,953 个状态上的 16,992 个问题 | 50.6% | 64.8% |
| 模型路由准确率第 2 阶段 → 最终模型 · 600 道留出 RouterBench 题 | 56.2% | 62.5% |
06 — 发布
开放权重,开放报告。
Bongard-mini 是三阶段训练的最终模型。权重按 Gemma 使用条款发布;以 Apache 2.0 许可开源的代码涵盖训练、校准和推理服务。
- 模型
- Bongard-mini — 75 亿参数,4B + 4B 编码器–解码器,基于 T5Gemma 2
- 作者
- Li Ding, Haidi Jin, Chen Ji
- 出版
- AgentBull Pte Ltd,新加坡,2026 年 9 月
# hf download AgentBull/bongard-mini --local-dir bongard-mini
from bongard.inference import Predictor
model = Predictor.load("bongard-mini")
model.predict({
"state": {"subject": "Charged twice for order #4821"},
"questions": {
"refund": {"type": "noul",
"instructions": "Is the customer asking for a refund?"},
"route": {"type": "choice",
"instructions": "Which team should handle this?",
"criteria": {"billing": "", "shipping": "", "technical": ""}},
},
})hf download AgentBull/bongard-mini --local-dir bongard-mini
uv run bongard serve --checkpoint bongard-mini --port 8000
curl http://127.0.0.1:8000/v1/systemone \
-H 'Content-Type: application/json' \
--data-binary @request.jsonuv sync --locked
hf download AgentBull/bongard-mini --local-dir bongard-mini
uv run bongard predict \
--checkpoint bongard-mini \
--request examples/request.json引用
@techreport{ding2026bongard,
title = {Bongard: Training Machine Intuition},
author = {Ding, Li and Jin, Haidi and Ji, Chen},
institution = {AgentBull Pte Ltd},
year = {2026},
month = sep
}