Bongard-mini机器直觉。

基于 T5Gemma 2 的开放权重 Jev 类决策模型。输入情境和候选答案,直接得到概率。

读一次,并行判断。

图 1 — 一个物体,三个投影

正方形 · 圆形 · 三角形

同一个情境,不同的判断。

01 — 概述

在说清之前,先看见关系。

Bongard-mini 是一个开放权重的判断模型。交给它一个情境(一条消息、一份文档、一个网页、一张表格,或智能体的当前状态),再附上要判断的问题和候选答案。它把情境读一遍,就为每个候选答案返回一个概率,不写任何文本。

适用场景

  • 路由与分诊

    把工单、邮件和请求分给对应的团队、模型或工具。

  • 筛查与护栏

    在内容或操作到达人和智能体之前,识别钓鱼、越狱尝试和高风险操作。

  • 证据与相关性

    找出回答问题的那一段,核对一个说法是否有来源支持。

  • 智能体决策

    根据智能体的当前状态判断下一步,每一步只需一次快速调用。

开放权重 · 75 亿参数 · 支持文本和图像 · 已在 51 种语言上测试 · 已测试长达 3 万 token 的文档

有经验的棋手一眼看出好棋,读者一下子听出反讽。这些判断依靠的是从经验中学到的关系,人往往在能一步步解释之前,就已经做出了判断。

直觉能利用那些很难写成一条条理由的规律,它的价值也不只在于快。Bongard 把这类判断当作一种可以单独设计、单独训练的能力。

看看这两组图形:是什么关系把它们分开?先试着自己看出来,再揭晓规则。

模型的名字来自米哈伊尔·邦加德(Mikhail Bongard)1967 年首次发表的视觉谜题。每组六个图形,一条规则对一组成立,对另一组不成立。

左凸图形

右凹图形

图 2 — 第 4 题,仿邦加德(1967)。

02 — 演示

一个模型,不同的情境。

以下是公开 Demo 的真实响应回放。每个标签页展示一次输入,以及模型当时为各候选答案返回的概率。

修改输入,实时试用

选择示例,修改输入和“Questions & settings”中的问题,然后点击 Run。

Demo 托管于 Hugging Face ZeroGPU。匿名额度有限,登录后可获得更多额度;也可下载权重在本地运行。

录制回放 · 2026 年 9 月 30 日

输入

channelemail

planpro

subject订单 #4821 被扣了两次款

body你好,今天早上同一笔订单在我的卡上扣了两次钱,请退还重复的那一笔。

回放一次通读输入录制的输出 · 一次前向计算,5 个答案

  1. Choice

    这张工单应该交给哪个团队处理?

    billing 0.94account 0.04technical 0.01

  2. Noul

    客户是否在要求退款?

    是 0.85否 0.15

  3. Score

    这件事有多紧急(1 到 5)?

    1 0.29期望 2.3

  4. Choice

    这条消息的语气是什么?

    calm 0.56frustrated 0.22angry 0.22

  5. Noul

    回复前是否需要人工审批?

    否 0.79是 0.21

请求与响应
{
  "request": {
    "state": {
      "channel": "email",
      "plan": "pro",
      "subject": "订单 #4821 被扣了两次款",
      "body": "你好,今天早上同一笔订单在我的卡上扣了两次钱,请退还重复的那一笔。"
    },
    "questions": {
      "route": {
        "type": "choice",
        "instructions": "这张工单应该交给哪个团队处理?",
        "criteria": {
          "billing": null,
          "technical": null,
          "shipping": null,
          "account": null
        }
      },
      "refund": {
        "type": "noul",
        "instructions": "客户是否在要求退款?"
      },
      "urgency": {
        "type": "score",
        "instructions": "这件事有多紧急(1 到 5)?",
        "criteria": [
          "1",
          "2",
          "3",
          "4",
          "5"
        ]
      },
      "tone": {
        "type": "choice",
        "instructions": "这条消息的语气是什么?",
        "criteria": {
          "calm": null,
          "frustrated": null,
          "angry": null
        }
      },
      "review": {
        "type": "noul",
        "instructions": "回复前是否需要人工审批?"
      }
    }
  },
  "response": {
    "answers": {
      "route": {
        "type": "choice",
        "probs": {
          "billing": 0.935,
          "technical": 0.012,
          "shipping": 0.011,
          "account": 0.041
        }
      },
      "refund": {
        "type": "noul",
        "p": 0.855
      },
      "urgency": {
        "type": "score",
        "probs": [
          0.295,
          0.295,
          0.286,
          0.103,
          0.021
        ]
      },
      "tone": {
        "type": "choice",
        "probs": {
          "calm": 0.563,
          "frustrated": 0.219,
          "angry": 0.219
        }
      },
      "review": {
        "type": "noul",
        "p": 0.213
      }
    }
  }
}

输入

发件人Northbank 安全中心 <alerts@northbank-verify.co>

主题紧急:您的账户已被锁定

我们检测到您的账户存在异常登录。为保护您的安全,账户已被锁定。请在 24 小时内访问 http://northbank-verify.co/login 验证身份,否则账户将被永久关闭。

Northbank 安全团队

回放一次通读输入录制的输出 · 一次前向计算,5 个答案

  1. Noul

    这封邮件是钓鱼邮件吗?

    是 0.73否 0.27

  2. Choice

    邮件要求收件人做什么?

    在链接页面登录 0.82回复个人信息 0.09无 0.04

  3. Score

    邮件给收件人施加了多大的时间压力?

    强烈 0.38期望 3.3

  4. Noul

    发件人的域名是这家银行自己的域名吗?

    否 0.72是 0.28

  5. Choice

    邮件过滤器应该如何处理这封邮件?

    隔离 0.47警告 0.33正常投递 0.20

请求与响应
{
  "request": {
    "state": "发件人:Northbank 安全中心 <alerts@northbank-verify.co>\n主题:紧急:您的账户已被锁定\n\n我们检测到您的账户存在异常登录。为保护您的安全,账户已被锁定。请在 24 小时内访问 http://northbank-verify.co/login 验证身份,否则账户将被永久关闭。\n\nNorthbank 安全团队",
    "questions": {
      "phishing": {
        "type": "noul",
        "instructions": "这封邮件是钓鱼邮件吗?"
      },
      "request": {
        "type": "choice",
        "instructions": "邮件要求收件人做什么?",
        "criteria": {
          "在链接页面登录": "在链接打开的页面上登录或输入密码。",
          "付款": "汇款或支付账单。",
          "打开附件": "打开或下载附件。",
          "回复个人信息": "回复个人或账户信息。",
          "无": "没有要求任何操作。"
        }
      },
      "pressure": {
        "type": "score",
        "instructions": "邮件给收件人施加了多大的时间压力?",
        "criteria": [
          "没有。",
          "轻微。",
          "中等。",
          "强烈。",
          "极强。"
        ]
      },
      "own_domain": {
        "type": "noul",
        "instructions": "发件人的域名是这家银行自己的域名吗?"
      },
      "filter": {
        "type": "choice",
        "instructions": "邮件过滤器应该如何处理这封邮件?",
        "criteria": {
          "正常投递": "照常送达。",
          "警告": "送达,但附上警告横幅。",
          "隔离": "放入隔离区。"
        }
      }
    }
  },
  "response": {
    "answers": {
      "phishing": {
        "type": "noul",
        "noul": 0.7287662603531366
      },
      "request": {
        "type": "choice",
        "probabilities": {
          "在链接页面登录": 0.822918041599048,
          "付款": 0.015886793867406084,
          "打开附件": 0.028719991634125787,
          "回复个人信息": 0.0938599689171975,
          "无": 0.03861520398222258
        },
        "choice": "在链接页面登录",
        "confidence": 0.7786475519988101
      },
      "pressure": {
        "type": "score",
        "probabilities": {
          "0": 0.15234317430432082,
          "1": 0.0930107101167277,
          "2": 0.19820336438249164,
          "3": 0.382675868022983,
          "4": 0.17376688317347685
        },
        "score": 2.3325125756445675,
        "legend": {
          "0": "没有。",
          "1": "轻微。",
          "2": "中等。",
          "3": "强烈。",
          "4": "极强。"
        },
        "confidence": 0.15414900774801144
      },
      "own_domain": {
        "type": "noul",
        "noul": 0.28287753588419
      },
      "filter": {
        "type": "choice",
        "probabilities": {
          "正常投递": 0.19891074258,
          "警告": 0.33400263336869246,
          "隔离": 0.4670866240513076
        },
        "choice": "隔离",
        "confidence": 0.20062993607696136
      }
    }
  }
}

输入

客户问题网上买的耳机没用过,多久之内可以退货?

退货政策网上购买的未使用耳机,可在签收后 30 天内退货。请保留收据。

保修耳机享有两年保修,覆盖制造缺陷。

配送网上订单通常在 3 到 5 个工作日内送达。

回放一次通读输入录制的输出 · 一次前向计算,4 个答案

  1. Choice

    哪一段最直接地回答了客户的问题?

    退货政策 0.93保修 0.04配送 0.04

  2. Score

    “退货政策”这一段在多大程度上回答了问题?

    直接给出了所问的退货期限 0.85期望 2.8

  3. Noul

    这些段落是否写明了网购未使用耳机的退货期限是 30 天?

    是 0.92否 0.08

  4. Noul

    这些段落是否写明了网购未使用耳机的退货期限是 60 天?

    否 0.86是 0.14

请求与响应
{
  "request": {
    "state": "客户问题:网上买的耳机没用过,多久之内可以退货?\n\n退货政策:网上购买的未使用耳机,可在签收后 30 天内退货。请保留收据。\n\n保修:耳机享有两年保修,覆盖制造缺陷。\n\n配送:网上订单通常在 3 到 5 个工作日内送达。",
    "questions": {
      "best_evidence": {
        "type": "choice",
        "instructions": "哪一段最直接地回答了客户的问题?",
        "criteria": {
          "退货政策": null,
          "保修": null,
          "配送": null
        }
      },
      "return_policy_relevance": {
        "type": "score",
        "instructions": "“退货政策”这一段在多大程度上回答了问题?",
        "criteria": [
          "与问题无关。",
          "主题相关,但没有给出所问的退货期限。",
          "直接给出了所问的退货期限。"
        ]
      },
      "thirty_days_supported": {
        "type": "noul",
        "instructions": "这些段落是否写明了网购未使用耳机的退货期限是 30 天?"
      },
      "sixty_days_supported": {
        "type": "noul",
        "instructions": "这些段落是否写明了网购未使用耳机的退货期限是 60 天?"
      }
    }
  },
  "response": {
    "answers": {
      "best_evidence": {
        "type": "choice",
        "probabilities": {
          "退货政策": 0.9245034925751264,
          "保修": 0.04061984858788167,
          "配送": 0.03487665883699192
        },
        "choice": "退货政策",
        "confidence": 0.8867552388626895
      },
      "return_policy_relevance": {
        "type": "score",
        "probabilities": {
          "0": 0.03137862218325932,
          "1": 0.11677271083245248,
          "2": 0.8518486669842882
        },
        "score": 1.820470044801029,
        "legend": {
          "0": "与问题无关。",
          "1": "主题相关,但没有给出所问的退货期限。",
          "2": "直接给出了所问的退货期限。"
        },
        "confidence": 0.7307050672015433
      },
      "thirty_days_supported": {
        "type": "noul",
        "noul": 0.9177974724509623
      },
      "sixty_days_supported": {
        "type": "noul",
        "noul": 0.1380721313167926
      }
    }
  }
}

输入

用户任务清理构建服务器的磁盘空间。

智能体计划(第 4/6 步)执行 sudo rm -rf /var/lib/postgresql/data

最近观察磁盘已用 97%。最大的目录是 /var/lib/postgresql/data(212 GB),这是线上生产数据库的数据目录。

回放一次通读输入录制的输出 · 一次前向计算,4 个答案

  1. Choice

    这条命令接下来应该怎么处理?

    请人确认 0.48改写 0.35执行 0.17

  2. Noul

    这条命令会不可逆地删除重要数据吗?

    是 0.78否 0.22

  3. Noul

    这条命令是释放磁盘空间的安全做法吗?

    否 0.51是 0.49

  4. Score

    照原样执行这条命令的风险有多大?

    灾难性 0.59期望 4.2

请求与响应
{
  "request": {
    "state": "用户任务:清理构建服务器的磁盘空间。\n智能体计划(第 4/6 步):执行 `sudo rm -rf /var/lib/postgresql/data`\n最近观察:磁盘已用 97%。最大的目录是 /var/lib/postgresql/data(212 GB),这是线上生产数据库的数据目录。",
    "questions": {
      "next": {
        "type": "choice",
        "instructions": "这条命令接下来应该怎么处理?",
        "criteria": {
          "执行": "立即执行。",
          "请人确认": "暂停,请人工批准。",
          "改写": "换成更安全的命令。"
        }
      },
      "irreversible": {
        "type": "noul",
        "instructions": "这条命令会不可逆地删除重要数据吗?"
      },
      "safe_fix": {
        "type": "noul",
        "instructions": "这条命令是释放磁盘空间的安全做法吗?"
      },
      "risk": {
        "type": "score",
        "instructions": "照原样执行这条命令的风险有多大?",
        "criteria": [
          "无害。",
          "低。",
          "中等。",
          "高。",
          "灾难性。"
        ]
      }
    }
  },
  "response": {
    "answers": {
      "next": {
        "type": "choice",
        "probabilities": {
          "执行": 0.17387925480112856,
          "请人确认": 0.4755436526153522,
          "改写": 0.35057709258351927
        },
        "choice": "请人确认",
        "confidence": 0.2133154789230283
      },
      "irreversible": {
        "type": "noul",
        "noul": 0.7798057748697457
      },
      "safe_fix": {
        "type": "noul",
        "noul": 0.4891005641389476
      },
      "risk": {
        "type": "score",
        "probabilities": {
          "0": 0.05038297537478775,
          "1": 0.05038297537478775,
          "2": 0.091081853478,
          "3": 0.21422390409797637,
          "4": 0.5939282916744482
        },
        "score": 3.2509315613225094,
        "legend": {
          "0": "无害。",
          "1": "低。",
          "2": "中等。",
          "3": "高。",
          "4": "灾难性。"
        },
        "confidence": 0.37577630110209115
      }
    }
  }
}

输入

No encuentro mi tarjeta desde ayer. Quiero bloquearla temporalmente mientras la busco. No he visto ningún cargo desconocido.

回放一次通读输入录制的输出 · 一次前向计算,4 个答案

  1. Choice

    消息是用哪种语言写的?

    西班牙语 1.00葡萄牙语 0.00意大利语 0.00

  2. Choice

    客户的主要诉求是什么?

    临时冻结卡 0.96挂失被盗卡 0.03争议扣款 0.00

  3. Noul

    客户是否报告了不明扣款?

    否 0.88是 0.12

  4. Choice

    应该由哪个团队处理?

    银行卡 0.70反欺诈 0.21支付 0.09

请求与响应
{
  "request": {
    "state": "No encuentro mi tarjeta desde ayer. Quiero bloquearla temporalmente mientras la busco. No he visto ningún cargo desconocido.",
    "questions": {
      "language": {
        "type": "choice",
        "instructions": "消息是用哪种语言写的?",
        "criteria": {
          "西班牙语": "",
          "葡萄牙语": "",
          "意大利语": "",
          "加泰罗尼亚语": ""
        }
      },
      "intent": {
        "type": "choice",
        "instructions": "客户的主要诉求是什么?",
        "criteria": {
          "临时冻结卡": "暂时锁定银行卡。",
          "挂失被盗卡": "报告卡片被盗。",
          "争议扣款": "对不明扣款提出异议。",
          "补办新卡": "申请补发新卡。"
        }
      },
      "unknown_charge": {
        "type": "noul",
        "instructions": "客户是否报告了不明扣款?"
      },
      "team": {
        "type": "choice",
        "instructions": "应该由哪个团队处理?",
        "criteria": {
          "银行卡": "银行卡服务。",
          "反欺诈": "欺诈调查。",
          "支付": "支付与转账。"
        }
      }
    }
  },
  "response": {
    "answers": {
      "language": {
        "type": "choice",
        "probabilities": {
          "西班牙语": 0.9996361547210898,
          "葡萄牙语": 0.00004658079413466029,
          "意大利语": 0.0000055056324303727694,
          "加泰罗尼亚语": 0.00031175885234511753
        },
        "choice": "西班牙语",
        "confidence": 0.999514872961453
      },
      "intent": {
        "type": "choice",
        "probabilities": {
          "临时冻结卡": 0.9650422264147442,
          "挂失被盗卡": 0.03442690996493724,
          "争议扣款": 0.00036115316109104167,
          "补办新卡": 0.0001697104592273966
        },
        "choice": "临时冻结卡",
        "confidence": 0.953389635219659
      },
      "unknown_charge": {
        "type": "noul",
        "noul": 0.11558873111820321
      },
      "team": {
        "type": "choice",
        "probabilities": {
          "银行卡": 0.7017275294027985,
          "反欺诈": 0.2072722193838878,
          "支付": 0.09100025121331368
        },
        "choice": "银行卡",
        "confidence": 0.5525912941041977
      }
    }
  }
}
图 3 — 每个标签页是一次请求:左边是输入,右边是类型化问题。每一根条都是 Bongard-mini 于 2026 年 9 月 30 日通过公开 Demo 返回的概率,这里只做回放。

动态中的判断。

每段录屏里,游戏引擎描述局面并列出合法走法;Bongard-mini 为每一步给出概率(显示在右侧),概率最高的一步被执行。

图版 1 — 2048 · 游戏录屏

引擎列出合法走法,并为每一步给出简短的前瞻评价,由 Bongard 选择。这一局合成了 4096,得分 55,140。12 局中有 9 局合成了 2048。

03 — 结果

让判断接受检验。

它有多准,更大的系统在哪些地方仍然领先,以及它的概率和速度在实际使用中是否靠得住。

DecisionBench 覆盖 43 项任务的 23,900 个决策。Bongard-mini 在 61 个系统中排第四,领先 Jev 1.13、DeepSeek V4.1 Flash 和 GPT-5.6 Luna。

跨任务的判断

23,900 个决策 · 43 项任务 · eval 划分

所选系统准确率
Imajev-4B79.7%
Bongard-mini78.05%
Winnow-12B76.7%
Jev 1.1372.0%
DeepSeek V4.1 Flash71.0%
GPT-5.6 Luna69.9%
表 1 — Bongard 于 2026 年 9 月 30 日使用官方 runner 测得 78.05%;全部 23,900 行均返回答案,无错误或截断。其中 20,959 行未检测到与训练数据的源文本重叠,准确率为 77.73%。服务上限:每请求 262,144 tokens,每序列 131,072 tokens,最多 255 个候选项。运行记录与协议。参考分数:DecisionBench,2026 年 9 月 29 日。

04 — 工作原理

读一次,做多个决策。

T5 编码器双向读取整个情境,同时看得到各个问题的指令。彼此独立的解码器分支共用这份证据,训练好的判断头为每个问题的候选项打分并返回概率。全程不生成文本。

Noul
这个陈述成立吗?答案是它成立的概率。
Choice
哪个具名选项适用?最多 255 个选项,每个都可以带描述,每个都有一个概率。
Score
落在有序量表的哪一级?2 到 10 个级别,给出各级的分布和期望级别。

T5Gemma 2 · 4B-4B 编码器–解码器 · 75.1 亿参数 · 编码器只运行一次,问题最多八个一组处理

外壳只改变接口,Bongard 训练的是判断。

Jev、Kev 和 Bongard 回答的是同一类问题。模型怎样学习、怎样读取证据,决定了它通往判断的路径。

系统证据学习读出
BongardT5 编码器–解码器。证据共享、双向读取,每个问题独立分支。在判断、语义关系和行动结果上训练整个文本模型。训练好的判断头为给定的候选项打分。
Jev架构未公开。它的 API 接受共享证据和多个问题。TypeSafe 所述的 RLCD,完整配方未公开。通过 System One API 直接返回概率。
KevQwen 因果语言模型骨干。服务端在多个问题之间复用状态缓存。在带标签的决策上训练 LoRA 适配器和指针头。训练好的指针头对照决策状态为每个选项打分。
OpenJev 默认配置预训练的 DiffusionGemma。状态和问题共用一个输入。在现有权重外面包一层推理封装。读取掩码位置上答案 token 的概率。

2026 年 9 月已公开的设计。RLCD:Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习。来源和更多实现见技术报告。

读完整个情境。

后一句话会改变前一句话的含义,一条日志会解释更早的一次失败。双向编码让这些事实在读出判断之前,就已经相互影响各自的表示。

把经验放进模型。

语义对教会模型跨表达、跨输入的关系,沙盒结果教会它行动之后会发生什么。这些学习目标同时塑造证据和判断。

选择把容量花在哪里。

T5 把「读状态」和「判断每个问题」分开。Bongard 目前使用均衡的 4B-4B 结构;这种结构也支持未来把更多容量分给共享的阅读,把更少容量分给每个问题。

训练整个模型比训练适配器需要更多数据和算力。Bongard 做这笔投入,是为了得到一个可以复用的判断模型。它最适合的工作负载,是一个证据相互关联、需要做出多个决策的情境:一份文档、一次事故,或一个 Agent 当前的状态。

05 — 训练

直觉是学出来的。

经验在判断派上用场之前,就已经塑造了判断。Bongard 分三个阶段学习:怎样判断,意义之间怎样关联,行动之后会发生什么。

  1. 01

    判断

    从文本、记录和图像中学习判断。成对的例子告诉模型,哪些改动应当改变答案,哪些不应当。

  2. 02

    关系

    学习词语、图像和状态之间的语义关系。联合嵌入目标把判断与它所涉及的内容和结果联系起来。

  3. 03

    结果

    从行动产生的结果中学习。沙盒推演和精确求解器给出候选行动的结果分布,模型直接用这些分布训练。

训练给 T5Gemma 2 带来了什么

准确率 · 预训练模型取公开值

基准Gemma 3 4BT5Gemma 2Bongard
BoolQ公开值 0-shot75.5%79.3%89.2%
WinoGrande公开值 5-shot69.9%71.6%85.7%
SocialIQA公开值 0-shot49.8%49.9%60.9%
表 4 — Bongard-mini 零样本作答,只做一次前向计算。T5Gemma 2 4B-4B 与 Gemma 3 4B 的数值取自 T5Gemma 2 技术报告表 4。

训练改变了什么

评测训练前训练后
改写后留出题目的准确率完整第 2 阶段75.7%85.9%
冻结沙盒测试集的准确率第 3 阶段 · 1,953 个状态上的 16,992 个问题50.6%64.8%
模型路由准确率第 2 阶段 → 最终模型 · 600 道留出 RouterBench 题56.2%62.5%
表 5 — 每一行比较同一评测上的不同检查点。训练条件、对照实验和完整结果见技术报告。

06 — 发布

开放权重,开放报告。

Bongard-mini 是三阶段训练的最终模型。权重按 Gemma 使用条款发布;以 Apache 2.0 许可开源的代码涵盖训练、校准和推理服务。

模型
Bongard-mini — 75 亿参数,4B + 4B 编码器–解码器,基于 T5Gemma 2
在线试用
Hugging Face Space
权重
Hugging Face 上的 AgentBull/bongard-mini
报告
Bongard: Training Machine Intuition(PDF)
代码
GitHub 上的 AgentBull/bongard
许可
Gemma 使用条款
作者
Li Ding, Haidi Jin, Chen Ji
出版
AgentBull Pte Ltd,新加坡,2026 年 9 月

# hf download AgentBull/bongard-mini --local-dir bongard-mini
from bongard.inference import Predictor

model = Predictor.load("bongard-mini")

model.predict({
    "state": {"subject": "Charged twice for order #4821"},
    "questions": {
        "refund": {"type": "noul",
                   "instructions": "Is the customer asking for a refund?"},
        "route": {"type": "choice",
                  "instructions": "Which team should handle this?",
                  "criteria": {"billing": "", "shipping": "", "technical": ""}},
    },
})

引用

@techreport{ding2026bongard,
  title  = {Bongard: Training Machine Intuition},
  author = {Ding, Li and Jin, Haidi and Ji, Chen},
  institution = {AgentBull Pte Ltd},
  year   = {2026},
  month  = sep
}