DiagSplat · local VLM capability test

qwen3-vl-8b-instruct:4 帧 × 4 个边界位置

每次仅输入两张独立的 512×512 PNG:真实 RGB 与 biased residual; 没有 HTML、没有 composite、也没有当前参考答案。模型只需在 C1–C4 中选择最小完整覆盖候选。 当前人工/强 critic 选择作为 reference。

Exact candidate agreement: 11/16 (68.8%)

Prediction distribution: C1=16, C2=0, C3=0, C4=0. Under-expanded vs reference: 5/16.

注意:总一致率会被 reference 本身大量为 C1 所抬高。 是否能识别需要更大安全带的 C2 难例,是本测试更关键的能力。

下载完整模型输出 JSON