Bongard-mini機械の直観。
T5Gemma 2を基にしたオープンウェイトのJev系判断モデル。状況と候補回答を入力すると、確率を返します。
一度読み、並列に判断する。
図1 — ひとつの物体、三つの影
正方形 · 円 · 三角形
ひとつの状況、異なる判断。
01 — 概要
説明できる前に、関係を見る。
Bongard-miniは、重みを公開した判断モデルです。状況(メッセージ、文書、ウェブページ、表、エージェントの現在の状態など)に、判断したい問いと答えの候補を添えて渡すと、状況を一度読み、すべての候補に確率を返します。テキストは書きません。
用途
ルーティングと振り分け
チケット、メール、リクエストを、適切なチーム・モデル・ツールへ送ります。
検査とガードレール
フィッシング、ジェイルブレイクの試み、危険な操作を、人やエージェントに届く前に見つけます。
根拠と関連性
質問に答えている文章を選び、主張が出典に裏づけられているかを確かめます。
エージェントの判断
エージェントの現在の状態から次の一手を判断します。一手ごとに速い呼び出しが一回だけです。
重みを公開 · 75億パラメータ · テキストと画像に対応 · 51言語でテスト済み · 3万トークンまでの文書でテスト済み
経験を積んだ棋士は有望な一手を見抜き、読み手は皮肉に気づきます。こうした判断は経験から学んだ関係にもとづいていて、多くの場合、一つひとつの手順を説明できるより先に下されます。
直観は、理由の一覧としては書き表しにくいパターンも使えます。その価値は速さだけではありません。Bongardは、この種の判断を、独立して設計し学習させる能力として扱います。
二つのグループを見てください。何が両者を分けているでしょうか。ルールを表示する前に、見抜いてみてください。
モデルの名前は、ミハイル・ボンガルド(Mikhail Bongard)が1967年に初めて発表した視覚パズルに由来します。各グループには六つの図形があり、あるルールが一方では成り立ち、もう一方では成り立ちません。
左凸図形
右凹図形
02 — デモ
ひとつのモデル、さまざまな状況。
公開デモの実際の応答を再生しています。各タブは一つの入力と、モデルが各候補回答に返した確率を示します。
例を選び、入力と「Questions & settings」の問いを編集して、Runを押します。
Hugging Face ZeroGPU上で動作します。匿名利用の枠は限られ、ログインすると枠が増えます。重みを入手してローカルで実行することもできます。
録画の再生 · 2026年9月30日
入力
channelemail
planpro
subject注文 #4821 が二重に請求されました
body今朝、同じ注文でカードに2回請求されています。重複分を返金してください。
入力を一度読む過程を再生録画した出力 · 一回の順伝播で5つの答え
- Choice
この問い合わせはどのチームが担当すべきですか?
billing 0.95account 0.03technical 0.01
- Noul
顧客は返金を求めていますか?
はい 0.72いいえ 0.28
- Score
緊急度は1から5でどのくらいですか?
3 0.33期待値 2.5
- Choice
メッセージの口調はどれですか?
calm 0.40frustrated 0.31angry 0.29
- Noul
返信の前に人の承認が必要ですか?
いいえ 0.78はい 0.22
リクエストとレスポンス
{
"request": {
"state": {
"channel": "email",
"plan": "pro",
"subject": "注文 #4821 が二重に請求されました",
"body": "今朝、同じ注文でカードに2回請求されています。重複分を返金してください。"
},
"questions": {
"route": {
"type": "choice",
"instructions": "この問い合わせはどのチームが担当すべきですか?",
"criteria": {
"billing": null,
"technical": null,
"shipping": null,
"account": null
}
},
"refund": {
"type": "noul",
"instructions": "顧客は返金を求めていますか?"
},
"urgency": {
"type": "score",
"instructions": "緊急度は1から5でどのくらいですか?",
"criteria": [
"1",
"2",
"3",
"4",
"5"
]
},
"tone": {
"type": "choice",
"instructions": "メッセージの口調はどれですか?",
"criteria": {
"calm": null,
"frustrated": null,
"angry": null
}
},
"review": {
"type": "noul",
"instructions": "返信の前に人の承認が必要ですか?"
}
}
},
"response": {
"answers": {
"route": {
"type": "choice",
"probs": {
"billing": 0.952,
"technical": 0.008,
"shipping": 0.006,
"account": 0.034
}
},
"refund": {
"type": "noul",
"p": 0.717
},
"urgency": {
"type": "score",
"probs": [
0.193,
0.305,
0.326,
0.148,
0.029
]
},
"tone": {
"type": "choice",
"probs": {
"calm": 0.404,
"frustrated": 0.307,
"angry": 0.289
}
},
"review": {
"type": "noul",
"p": 0.223
}
}
}
}入力
差出人Northbankセキュリティ <alerts@northbank-verify.co>
件名【緊急】お客様のアカウントはロックされました
お客様のアカウントで不審なサインインを検知しました。安全のため、アカウントをロックしています。24時間以内に http://northbank-verify.co/login で本人確認を行ってください。確認がない場合、アカウントは永久に閉鎖されます。
Northbankセキュリティチーム
入力を一度読む過程を再生録画した出力 · 一回の順伝播で5つの答え
- Noul
このメールはフィッシングですか?
はい 0.73いいえ 0.27
- Choice
メールは受信者に何をするよう求めていますか?
リンク先でサインイン 0.71個人情報を返信 0.20なし 0.05
- Score
メールは受信者にどの程度の時間的なプレッシャーをかけていますか?
中程度 0.29期待値 3.0
- Noul
送信元のドメインは、その銀行自身のドメインですか?
はい 0.52いいえ 0.48
- Choice
メールフィルターはこのメールをどう扱うべきですか?
警告付き配信 0.47隔離 0.27通常配信 0.26
リクエストとレスポンス
{
"request": {
"state": "差出人:Northbankセキュリティ <alerts@northbank-verify.co>\n件名:【緊急】お客様のアカウントはロックされました\n\nお客様のアカウントで不審なサインインを検知しました。安全のため、アカウントをロックしています。24時間以内に http://northbank-verify.co/login で本人確認を行ってください。確認がない場合、アカウントは永久に閉鎖されます。\n\nNorthbankセキュリティチーム",
"questions": {
"phishing": {
"type": "noul",
"instructions": "このメールはフィッシングですか?"
},
"request": {
"type": "choice",
"instructions": "メールは受信者に何をするよう求めていますか?",
"criteria": {
"リンク先でサインイン": "リンク先のページでサインインまたはパスワードを入力する。",
"支払い": "送金または請求書の支払いをする。",
"添付を開く": "添付ファイルを開く、またはダウンロードする。",
"個人情報を返信": "個人情報や口座情報を返信する。",
"なし": "何も求めていない。"
}
},
"pressure": {
"type": "score",
"instructions": "メールは受信者にどの程度の時間的なプレッシャーをかけていますか?",
"criteria": [
"なし。",
"弱い。",
"中程度。",
"強い。",
"非常に強い。"
]
},
"own_domain": {
"type": "noul",
"instructions": "送信元のドメインは、その銀行自身のドメインですか?"
},
"filter": {
"type": "choice",
"instructions": "メールフィルターはこのメールをどう扱うべきですか?",
"criteria": {
"通常配信": "通常どおり配信する。",
"警告付き配信": "警告バナーを付けて配信する。",
"隔離": "隔離フォルダーに保留する。"
}
}
}
},
"response": {
"answers": {
"phishing": {
"type": "noul",
"noul": 0.7287662603531366
},
"request": {
"type": "choice",
"probabilities": {
"リンク先でサインイン": 0.710653799228591,
"支払い": 0.01441341073905349,
"添付を開く": 0.029235856451598635,
"個人情報を返信": 0.197017124914606,
"なし": 0.048679808666151
},
"choice": "リンク先でサインイン",
"confidence": 0.6383172490357386
},
"pressure": {
"type": "score",
"probabilities": {
"0": 0.1577901770707465,
"1": 0.1799798867929783,
"2": 0.2947908604349367,
"3": 0.25008290253427823,
"4": 0.1173561731670602
},
"score": 1.9892350079339272,
"legend": {
"0": "なし。",
"1": "弱い。",
"2": "中程度。",
"3": "強い。",
"4": "非常に強い。"
},
"confidence": 0.18303709183094174
},
"own_domain": {
"type": "noul",
"noul": 0.5145307908632168
},
"filter": {
"type": "choice",
"probabilities": {
"通常配信": 0.25622265163324853,
"警告付き配信": 0.4714452124838278,
"隔離": 0.27233213588292354
},
"choice": "警告付き配信",
"confidence": 0.20716781872574172
}
}
}
}入力
顧客の質問オンラインで買った未使用のヘッドホンは、いつまで返品できますか?
返品ポリシーオンラインで購入した未使用のヘッドホンは、お届けから30日以内であれば返品できます。レシートは保管してください。
保証ヘッドホンには、製造上の欠陥を対象とする2年間の保証があります。
配送オンライン注文は通常3〜5営業日でお届けします。
入力を一度読む過程を再生録画した出力 · 一回の順伝播で4つの答え
- Choice
顧客の質問に最も直接答えているのはどの文章ですか?
返品ポリシー 0.88配送 0.07保証 0.05
- Score
「返品ポリシー」の文章は、質問にどの程度答えていますか?
求められた返品期限を直接示している 0.74期待値 2.7
- Noul
これらの文章は、オンラインで購入した未使用のヘッドホンの返品期限を30日と述べていますか?
はい 0.85いいえ 0.15
- Noul
これらの文章は、オンラインで購入した未使用のヘッドホンの返品期限を60日と述べていますか?
いいえ 0.78はい 0.22
リクエストとレスポンス
{
"request": {
"state": "顧客の質問:オンラインで買った未使用のヘッドホンは、いつまで返品できますか?\n\n返品ポリシー:オンラインで購入した未使用のヘッドホンは、お届けから30日以内であれば返品できます。レシートは保管してください。\n\n保証:ヘッドホンには、製造上の欠陥を対象とする2年間の保証があります。\n\n配送:オンライン注文は通常3〜5営業日でお届けします。",
"questions": {
"best_evidence": {
"type": "choice",
"instructions": "顧客の質問に最も直接答えているのはどの文章ですか?",
"criteria": {
"返品ポリシー": null,
"保証": null,
"配送": null
}
},
"return_policy_relevance": {
"type": "score",
"instructions": "「返品ポリシー」の文章は、質問にどの程度答えていますか?",
"criteria": [
"質問とは無関係。",
"関連する話題だが、求められた返品期限は示していない。",
"求められた返品期限を直接示している。"
]
},
"thirty_days_supported": {
"type": "noul",
"instructions": "これらの文章は、オンラインで購入した未使用のヘッドホンの返品期限を30日と述べていますか?"
},
"sixty_days_supported": {
"type": "noul",
"instructions": "これらの文章は、オンラインで購入した未使用のヘッドホンの返品期限を60日と述べていますか?"
}
}
},
"response": {
"answers": {
"best_evidence": {
"type": "choice",
"probabilities": {
"返品ポリシー": 0.8751975710548461,
"保証": 0.052961837529477224,
"配送": 0.07184059141567661
},
"choice": "返品ポリシー",
"confidence": 0.8127963565822691
},
"return_policy_relevance": {
"type": "score",
"probabilities": {
"0": 0.0689394029657926,
"1": 0.19226390365865606,
"2": 0.7387966933755513
},
"score": 1.6698572904097586,
"legend": {
"0": "質問とは無関係。",
"1": "関連する話題だが、求められた返品期限は示していない。",
"2": "求められた返品期限を直接示している。"
},
"confidence": 0.504785935614638
},
"thirty_days_supported": {
"type": "noul",
"noul": 0.8512179909918229
},
"sixty_days_supported": {
"type": "noul",
"noul": 0.22270013882530884
}
}
}
}入力
ユーザーのタスクビルドサーバーのディスク容量を空ける。
エージェントの計画(6ステップ中4)sudo rm -rf /var/lib/postgresql/data を実行する
直近の観察ディスク使用率97%。最大のディレクトリは /var/lib/postgresql/data(212 GB)で、本番データベースのデータディレクトリです。
入力を一度読む過程を再生録画した出力 · 一回の順伝播で4つの答え
- Choice
提案されたコマンドをどう扱うべきですか?
人に確認 0.41書き換え 0.40実行 0.19
- Noul
このコマンドは重要なデータを取り返しのつかない形で削除しますか?
はい 0.67いいえ 0.33
- Noul
このコマンドは、ディスク容量を空ける安全な方法ですか?
いいえ 0.67はい 0.33
- Score
このコマンドをそのまま実行するリスクはどの程度ですか?
壊滅的 0.52期待値 4.1
リクエストとレスポンス
{
"request": {
"state": "ユーザーのタスク:ビルドサーバーのディスク容量を空ける。\nエージェントの計画(6ステップ中4):`sudo rm -rf /var/lib/postgresql/data` を実行する\n直近の観察:ディスク使用率97%。最大のディレクトリは /var/lib/postgresql/data(212 GB)で、本番データベースのデータディレクトリです。",
"questions": {
"next": {
"type": "choice",
"instructions": "提案されたコマンドをどう扱うべきですか?",
"criteria": {
"実行": "今すぐ実行する。",
"人に確認": "一時停止し、人の承認を求める。",
"書き換え": "より安全なコマンドに置き換える。"
}
},
"irreversible": {
"type": "noul",
"instructions": "このコマンドは重要なデータを取り返しのつかない形で削除しますか?"
},
"safe_fix": {
"type": "noul",
"instructions": "このコマンドは、ディスク容量を空ける安全な方法ですか?"
},
"risk": {
"type": "score",
"instructions": "このコマンドをそのまま実行するリスクはどの程度ですか?",
"criteria": [
"無害。",
"低い。",
"中程度。",
"高い。",
"壊滅的。"
]
}
}
},
"response": {
"answers": {
"next": {
"type": "choice",
"probabilities": {
"実行": 0.18683587781590016,
"人に確認": 0.4127794783273953,
"書き換え": 0.4003846438567046
},
"choice": "人に確認",
"confidence": 0.11916921749109298
},
"irreversible": {
"type": "noul",
"noul": 0.6740904003948566
},
"safe_fix": {
"type": "noul",
"noul": 0.3323280406847268
},
"risk": {
"type": "score",
"probabilities": {
"0": 0.05870746057831171,
"1": 0.05146942119527477,
"2": 0.11713841727533503,
"3": 0.2579665623910972,
"4": 0.5147181385599814
},
"score": 3.118518497159162,
"legend": {
"0": "無害。",
"1": "低い。",
"2": "中程度。",
"3": "高い。",
"4": "壊滅的。"
},
"confidence": 0.26543208096596793
}
}
}
}入力
No encuentro mi tarjeta desde ayer. Quiero bloquearla temporalmente mientras la busco. No he visto ningún cargo desconocido.
入力を一度読む過程を再生録画した出力 · 一回の順伝播で4つの答え
- Choice
メッセージは何語で書かれていますか?
スペイン語 1.00ポルトガル語 0.00イタリア語 0.00
- Choice
顧客の主な要望は何ですか?
カードの一時停止 0.88盗難届 0.12カードの再発行 0.00
- Noul
顧客は身に覚えのない請求を報告していますか?
いいえ 0.77はい 0.23
- Choice
どのチームが担当すべきですか?
カード 0.92不正対策 0.06決済 0.03
リクエストとレスポンス
{
"request": {
"state": "No encuentro mi tarjeta desde ayer. Quiero bloquearla temporalmente mientras la busco. No he visto ningún cargo desconocido.",
"questions": {
"language": {
"type": "choice",
"instructions": "メッセージは何語で書かれていますか?",
"criteria": {
"スペイン語": "",
"ポルトガル語": "",
"イタリア語": "",
"カタルーニャ語": ""
}
},
"intent": {
"type": "choice",
"instructions": "顧客の主な要望は何ですか?",
"criteria": {
"カードの一時停止": "カードを一時的に利用停止する。",
"盗難届": "カードの盗難を届け出る。",
"請求への異議": "身に覚えのない請求に異議を申し立てる。",
"カードの再発行": "代わりのカードを発行する。"
}
},
"unknown_charge": {
"type": "noul",
"instructions": "顧客は身に覚えのない請求を報告していますか?"
},
"team": {
"type": "choice",
"instructions": "どのチームが担当すべきですか?",
"criteria": {
"カード": "カードサービス。",
"不正対策": "不正調査。",
"決済": "決済と送金。"
}
}
}
},
"response": {
"answers": {
"language": {
"type": "choice",
"probabilities": {
"スペイン語": 0.9996228084430285,
"ポルトガル語": 0.00011000765584036696,
"イタリア語": 0.000014058937228882925,
"カタルーニャ語": 0.00025312496390231986
},
"choice": "スペイン語",
"confidence": 0.9994970779240381
},
"intent": {
"type": "choice",
"probabilities": {
"カードの一時停止": 0.8788795857180048,
"盗難届": 0.11528391342217174,
"請求への異議": 0.0019325806450490436,
"カードの再発行": 0.003903920214774159
},
"choice": "カードの一時停止",
"confidence": 0.8385061142906731
},
"unknown_charge": {
"type": "noul",
"noul": 0.2277727883538097
},
"team": {
"type": "choice",
"probabilities": {
"カード": 0.9195484939450904,
"不正対策": 0.05564569595194109,
"決済": 0.024805810102968538
},
"choice": "カード",
"confidence": 0.8793227409176356
}
}
}
}動きの中の判断。
各録画では、ゲームエンジンが局面を説明し、合法手を示します。Bongard-miniはすべての手に確率を返し(右側に表示)、最も確率の高い手が指されます。
図版1 — 2048 · ゲーム録画
エンジンが合法手と、それぞれの短い先読み評価を示し、Bongardが一つを選びます。この対局は4096のタイルに到達し、スコアは55,140。12局中9局で2048に到達しました。
図版2 — オセロ · ゲーム録画
Bongardは、エンジンが示す合法手から選びます。この対局は位置重視の相手に9手で13対0。貪欲な相手には32局中24勝です。
図版3 — テトリス · ゲーム録画
エンジンが置き場所とその評価を示し、Bongardが各ピースの置き場所を決めます。1,500ピースの5局で、一度も上まで積み上がりませんでした。
図版4 — Doom(テキスト版) · ゲーム録画
0.2秒ごとに場面の説明が1行届き、Bongardが旋回か射撃を選びます。この回は30秒で20キル。
03 — 結果
判断を試す。
どれだけ正しく答えるか、より大きなシステムがどこでまだ上回るか、そして確率と速度が実際の利用に耐えるか。
DecisionBenchは43タスク・23,900件の判断を評価します。Bongard-miniは61システム中4位で、Jev 1.13、DeepSeek V4.1 Flash、GPT-5.6 Lunaを上回ります。
タスク横断の判断
23,900件の判断 · 43タスク · eval分割
| 選んだシステム | 正解率 |
|---|---|
| Imajev-4B | 79.7% |
| Bongard-mini | 78.05% |
| Winnow-12B | 76.7% |
| Jev 1.13 | 72.0% |
| DeepSeek V4.1 Flash | 71.0% |
| GPT-5.6 Luna | 69.9% |
Jevの公式APIとBongard-miniが、24の公開ベンチマークから同じ問題に答えました。Bongard-miniは6のベンチマークで上回り、さらに9でほぼ互角です。Jevが最も大きく上回るのは、多段階の推論が答えを決める問題です。
Bongard-miniが上回る · 6
- Banking77テスト、77意図3,076問93.179.8
- サポートチケットの振り分け400問43.035.8
- PAWS 言い換え判定8,000問91.184.9
- SST-5 感情(5段階)600問58.257.5
- XNLI、15言語4,500問74.674.3
- モデルのルーティング399問98.097.7
互角:同点、または差が3ポイント以内 · 9
- 長い文書(最大3万トークン)260問100.0100.0
- RAG パッセージの関連性400問60.261.3
- QNLI5,463問92.293.7
- MASSIVE シナリオ、14言語4,200問69.070.6
- 感情認識2,000問57.759.3
- BoolQ600問89.291.5
- TweetEval 攻撃的投稿860問80.783.1
- フィッシングメール400問87.890.2
- ジェイルブレイク検出400問92.294.8
Jevが3〜10ポイント上回る · 5
- SciQ1,000問95.599.1
- スパムメール400問91.897.2
- WinoGrande1,267問85.791.3
- AG News7,600問82.288.4
- RAGTruth ハルシネーション1,500問74.982.8
Jevが10ポイントを超えて上回る · 4
- MASSIVE 意図、51言語5,100問77.489.3
- 有害性400問53.567.5
- プロンプトインジェクション116問56.975.9
- JudgeBench350問55.479.7
エンコーダは、どの問いに答えるよりも先に文書全体を読みます。今回のテストでは最大3万トークン。同じ読み方が51の言語で通用します。
長い文書の末尾にある依頼
8言語・20件の依頼 · 4部門から正しい1つを選ぶ
| 依頼の前にあるトークン数 | なし | 1k | 2k | 3k | 4k | 5k | 6k | 7k | 8k | 12k | 16k | 24k | 30k |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| laya-multilingual | 19 | 16 | 17 | 17 | 18 | 11 | 17 | 8 | — | — | — | — | — |
| Jev 1.13 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 |
| Bongard-mini | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 | 20 |
同じモデルが、翻訳なしで51言語を読みます。layaが公開した多言語の意図判定テストでは、すべての言語でlayaを上回ります。
layaが公開したすべての言語
MASSIVE 意図 · 51言語 · 選択肢20 · 偶然の正解率5%
- en:Bongard-mini 90%、laya 82%
- zh-CN:Bongard-mini 90%、laya 63%
- it:Bongard-mini 89%、laya 50%
- de:Bongard-mini 86%、laya 50%
- es:Bongard-mini 86%、laya 53%
- hi:Bongard-mini 86%、laya 43%
- ru:Bongard-mini 86%、laya 54%
- sv:Bongard-mini 86%、laya 57%
- zh-TW:Bongard-mini 86%、laya 54%
- da:Bongard-mini 85%、laya 50%
- nl:Bongard-mini 85%、laya 45%
- pl:Bongard-mini 85%、laya 51%
- nb:Bongard-mini 84%、laya 53%
- id:Bongard-mini 83%、laya 51%
- ja:Bongard-mini 83%、laya 64%
- pt:Bongard-mini 83%、laya 47%
- ro:Bongard-mini 83%、laya 35%
- fa:Bongard-mini 82%、laya 39%
- ml:Bongard-mini 82%、laya 24%
- tl:Bongard-mini 82%、laya 36%
- fr:Bongard-mini 81%、laya 59%
- he:Bongard-mini 81%、laya 40%
- ko:Bongard-mini 81%、laya 45%
- tr:Bongard-mini 81%、laya 37%
- el:Bongard-mini 80%、laya 38%
- fi:Bongard-mini 80%、laya 29%
- te:Bongard-mini 80%、laya 22%
- vi:Bongard-mini 80%、laya 26%
- hu:Bongard-mini 79%、laya 29%
- th:Bongard-mini 78%、laya 48%
- ms:Bongard-mini 77%、laya 43%
- ur:Bongard-mini 77%、laya 40%
- af:Bongard-mini 76%、laya 35%
- bn:Bongard-mini 76%、laya 29%
- kn:Bongard-mini 75%、laya 15%
- lv:Bongard-mini 75%、laya 32%
- sl:Bongard-mini 74%、laya 33%
- ta:Bongard-mini 74%、laya 23%
- az:Bongard-mini 73%、laya 30%
- ar:Bongard-mini 72%、laya 40%
- hy:Bongard-mini 70%、laya 15%
- is:Bongard-mini 69%、laya 30%
- ka:Bongard-mini 67%、laya 11%
- sq:Bongard-mini 66%、laya 26%
- am:Bongard-mini 65%、laya 12%
- km:Bongard-mini 65%、laya 18%
- sw:Bongard-mini 65%、laya 18%
- mn:Bongard-mini 64%、laya 13%
- my:Bongard-mini 61%、laya 12%
- jv:Bongard-mini 57%、laya 27%
- cy:Bongard-mini 48%、laya 16%
判断を測る二つの観点:教師の最上位回答を選ぶことと、教師の確率分布全体に近づくこと。
ひとつの選択とその確率
typed-decisions · テスト400件 · 判断2,000件
| 指標 | Bongard | Jev 1.13 |
|---|---|---|
| 教師の最上位ラベルとの一致率高いほど良い | 59.4% | 72.7% |
| 教師の分布とのKLダイバージェンス低いほど良い | 0.256 | 1.442 |
| Brierスコア低いほど良い | 0.132 | 0.148 |
公平な十面サイコロを振る
1〜10の各面の割合 · 破線が公平な値
- Bongard‑mini1: 10%, 2: 10%, 3: 10%, 4: 10%, 5: 11%, 6: 10%, 7: 10%, 8: 10%, 9: 10%, 10: 10%
- Jev 1.131: 24%, 2: 1%, 3: 1%, 4: 2%, 5: 51%, 6: 13%, 7: 2%, 8: 1%, 9: 1%, 10: 4%
- DeepSeek V4.1 Flash1: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
- Qwen3.8 Max1: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
- Grok 4.71: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
- Kimi K31: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 98%, 8: 3%, 9: 0%, 10: 0%
- GLM‑5.31: 0%, 2: 0%, 3: 3%, 4: 0%, 5: 3%, 6: 0%, 7: 95%, 8: 0%, 9: 0%, 10: 0%
- Llama 4 Maverick1: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 5%, 8: 95%, 9: 0%, 10: 0%
- Mistral Medium 3.51: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
- Gemma 4 31B1: 0%, 2: 0%, 3: 0%, 4: 0%, 5: 0%, 6: 0%, 7: 100%, 8: 0%, 9: 0%, 10: 0%
短いリクエストは36ミリ秒です。同じ状態についての問いは一度の読み取りを共有するため、32問でも1.16秒ではなく221ミリ秒で済みます。
速度
| 項目 | 結果 |
|---|---|
| 短いリクエスト1件短いJevBench問題での中央値レイテンシ。 | 36 ms |
| 状態1つに問い32個根拠を共有。別々に32回リクエストすると1.16秒。 | 221 ms |
| その32問で短縮される時間問いが状態を共有すると、判断1件あたり6.9ミリ秒。 | 5.2× |
04 — 仕組み
一度読み、いくつも決める。
T5エンコーダは、問いの指示も視野に入れながら状況を双方向に読みます。独立したデコーダの分岐がその共有された根拠を使い、学習済みのヘッドが各問いの候補を採点して確率を返します。テキストは生成しません。
- Noul
- この記述は正しいか。答えは、それが正しい確率です。
- Choice
- どの名前付き選択肢が当てはまるか。選択肢は最大255個で、それぞれに説明を付けられ、すべてに確率が付きます。
- Score
- 順序のある尺度のどこか。2〜10の段階とその分布、そして期待される段階を返します。
T5Gemma 2 · 4B-4Bエンコーダ・デコーダ · 75.1億パラメータ · エンコーダは一度だけ実行し、問いは最大8個ずつ処理
ラッパーが変えるのはインターフェース。Bongardは判断そのものを学習する。
Jev、Kev、Bongardは同じ種類の問いに答えます。モデルがどう学び、根拠をどう読むかで、判断に至る道筋が決まります。
| システム | 根拠 | 学習 | 読み出し |
|---|---|---|---|
| Bongard | T5エンコーダ・デコーダ。双方向に読んだ根拠を共有し、問いごとに分岐。 | 判断、意味の関係、行動の結果でテキストモデル全体を学習。 | 学習済みのヘッドが、与えられた候補を採点。 |
| Jev | 非公開のアーキテクチャ。APIは共有の根拠と複数の問いを受け付ける。 | TypeSafeが説明するRLCD。完全なレシピは非公開。 | System One APIから確率を直接返す。 |
| Kev | Qwenの因果言語モデルが基盤。サーバーは問いのあいだで状態キャッシュを再利用。 | ラベル付きの判断でLoRAアダプタとポインタヘッドを学習。 | 学習済みのポインタヘッドが、判断状態に照らして各選択肢を採点。 |
| OpenJev(既定設定) | 事前学習済みのDiffusionGemma。状態と問いが一つの入力を共有。 | 既存の重みを包む推論ラッパー。 | マスク位置での回答トークンの確率。 |
2026年9月時点で公開されている設計。RLCD:Reinforcement Learning for Calibrated Decisions(較正された判断のための強化学習)。出典とその他の実装は技術レポートをご覧ください。
状況の全体を読む。
ある節が、前の節の意味を変えます。あるログが、以前の失敗の理由を説明します。双方向に符号化することで、判断を読み出す前に、それらの事実が互いの表現に影響を与えます。
経験をモデルに入れる。
意味のペアは表現や入力をまたぐ関係を、サンドボックスの結果は行動の後に何が起きるかを教えます。これらの学習目標が、根拠と判断を一緒に形づくります。
容量をどこに使うか選ぶ。
T5は、状態を読むことと各問いを判断することを分けています。Bongardは現在4B-4Bの均衡した構成ですが、この構造なら将来、共有の読み取りに容量を多く、問いごとの処理には少なく割り当てる設計もできます。
モデル全体の学習には、アダプタの学習より多くのデータと計算が必要です。Bongardは、再利用できる判断モデルをつくるためにその投資をしています。得意とするのは、関連する根拠がそろい、いくつもの判断が必要になる状況です。たとえば一つの文書、一件のインシデント、あるいはエージェントの現在の状態です。
05 — 学習
直観は学べる。
経験は、判断が必要になるより前に判断を形づくります。Bongardは三つの段階で学びます。どう判断するか、意味がどう関わり合うか、行動の後に何が起きるか。
01
判断
テキスト、記録、画像から判断を学びます。対になった例から、答えを変えるべき変化と、変えるべきでない変化を学びます。
02
関係
言葉、画像、状態のあいだの意味の関係を学びます。同時埋め込みの目的関数が、判断と、それに関わる内容や結果を結びつけます。
03
結果
行動が生む結果から学びます。サンドボックスでのロールアウトと厳密ソルバーが候補行動の結果の分布を与え、モデルはその分布で直接学習します。
T5Gemma 2に学習が加えたもの
正解率 · 事前学習モデルは公開値
| ベンチマーク | Gemma 3 4B | T5Gemma 2 | Bongard |
|---|---|---|---|
| BoolQ公開値 0-shot | 75.5% | 79.3% | 89.2% |
| WinoGrande公開値 5-shot | 69.9% | 71.6% | 85.7% |
| SocialIQA公開値 0-shot | 49.8% | 49.9% | 60.9% |
学習で変わること
| 評価 | 学習前 | 学習後 |
|---|---|---|
| 言い換えた保留問題での正解率ステージ2全体 | 75.7% | 85.9% |
| 固定したサンドボックス評価での正解率ステージ3 · 1,953状態・16,992問 | 50.6% | 64.8% |
| モデルのルーティングの正解率ステージ2 → 最終モデル · RouterBenchの保留問題600問 | 56.2% | 62.5% |
06 — 公開
オープンな重み、オープンなレポート。
Bongard-miniは、三段階の学習プログラムの最終モデルです。重みはGemma利用規約のもとで公開し、Apache 2.0のコードは学習、較正、サービングをカバーします。
- モデル
- Bongard-mini — 75億パラメータ、4B + 4Bのエンコーダ・デコーダ、T5Gemma 2ベース
- オンラインで試す
- Hugging Face Space
- ライセンス
- Gemma利用規約
- 著者
- Li Ding, Haidi Jin, Chen Ji
- 発行
- AgentBull Pte Ltd、シンガポール、2026年9月
# hf download AgentBull/bongard-mini --local-dir bongard-mini
from bongard.inference import Predictor
model = Predictor.load("bongard-mini")
model.predict({
"state": {"subject": "Charged twice for order #4821"},
"questions": {
"refund": {"type": "noul",
"instructions": "Is the customer asking for a refund?"},
"route": {"type": "choice",
"instructions": "Which team should handle this?",
"criteria": {"billing": "", "shipping": "", "technical": ""}},
},
})hf download AgentBull/bongard-mini --local-dir bongard-mini
uv run bongard serve --checkpoint bongard-mini --port 8000
curl http://127.0.0.1:8000/v1/systemone \
-H 'Content-Type: application/json' \
--data-binary @request.jsonuv sync --locked
hf download AgentBull/bongard-mini --local-dir bongard-mini
uv run bongard predict \
--checkpoint bongard-mini \
--request examples/request.json引用
@techreport{ding2026bongard,
title = {Bongard: Training Machine Intuition},
author = {Ding, Li and Jin, Haidi and Ji, Chen},
institution = {AgentBull Pte Ltd},
year = {2026},
month = sep
}