DiagSplat · NTF-v2 six-way ablation · 9 August 2026

Identity 修好了;高噪声更强了。
但“减少错误 GS”只解释了一部分结果。

RawNeRF sharpshadow,31 train / 5 clean held-out test,30k iterations。六条不同 loss 路线先在 x0/x64 筛选,再自动选择两种补跑 x4/x16。最稳妥的是 confidence-linear:x0 只差 0.11 dB,x16 和 x64 分别超过 Vanilla 0.54 / 1.22 dB。Adaptive checkpoint 的 x64 达到 28.07 dB,但此时 α=1、loss 与 NTF-v1 相同,0.29 dB 的 checkpoint 差距不能算新算法增益。

6 diverse objectivestwo-stage automatic queuecamera-linear clean testconfidence x0: −0.11 dBadaptive x64: +1.96 dBsingle-run variance remains
Clean-control · confidence−0.11 dB唯一通过预设 ≤0.2 dB 门槛
Mid-noise · confidence x16+0.54 dB同时改善 SSIM 与 LPIPS
High-noise · NTF family x64+1.96 dBAdaptive α=1,与 NTF-v1 同 loss
Queue runtime39m 58s12 screening + 4 selected runs

训练与测试数据单独查看

数据页包含四档训练噪声的视角切换与全部 held-out clean test views。本页所有方法均使用同一 split、相机、30k budget 和直接 camera-linear evaluator。

Open data page ↗

四条核心结论

Confidence 是当前最稳候选

它完全不使用 asinh,只在线性域降低低 SNR 像素权重。x0 基本保持,x16/x64 开始稳定超过 Vanilla,证明“知道哪些观测不可靠”本身就有效。

Adaptive 的价值在中间噪声

x64 时 α=1,与 NTF-v1 是同一 objective,不能把 checkpoint 差距算作方法增益。真正的新证据是 x16 从 NTF-v1 的 −1.49 dB 修复到 −0.13 dB;但 x4 仍说明 gate 开启太早。

Gaussian 机制不是统一解释

Adaptive 减少 tiny/extreme-needle/low-opacity 尾部,但 Confidence 提分时 GS 从 185k 增至 239k,形状尾部也几乎不变。因此不能宣称所有收益都来自“减少错误 GS”。

x0 需要多 seed

六个 v2 模式在 x0 都走完全相同的 Vanilla loss,但最终 PSNR 仍跨越 27.26–27.88 dB。CUDA atomics 与离散 densification 会放大微小非确定性,单次 clean gate 不足以定论。

第一阶段:六种路线的 x0 / x64 筛选

Methodx0 PSNRx0 Δx64 PSNRx64 Δx64 SSIMx64 LPIPSSelection
Vanilla 3DGS27.99026.1100.83870.2567reference
NTF-v1 asinh21.728−6.26227.779+1.6690.86760.1800previous method
Adaptive blend27.259−0.73128.072+1.9610.87000.1876selected #2
Additive anchor27.645−0.34526.856+0.7460.84640.2513reject
Frequency split27.579−0.41127.394+1.2840.83060.2246reject: GS explosion
Confidence linear27.880−0.11027.331+1.2210.84460.2456selected #1
Curriculum27.493−0.49726.560+0.4500.85990.1849reject: late noise return
Variance deadzone27.287−0.70327.159+1.0490.83850.2562reject: weak perceptual gain

Δ 相对现有 Vanilla checkpoint。自动筛选规则优先选择 x0 drop ≤0.2 dB 的方法;不足两个时使用带 clean penalty 的 fallback score。Adaptive 是 fallback 入选。由于 x0 loss 完全相同但训练非确定,clean 差异必须用多 seed 复核。Adaptive x64 的 α=1,与 NTF-v1 objective 相同,因此 28.072 vs 27.779 是重复训练波动,不是 v2 对 v1 的公平算法增益。

第二阶段:两种候选的完整 noise sweep

NoiseMethodPSNR ↑ΔPSNRSSIM ↑ΔSSIMLPIPS ↓ΔLPIPSGaussians
x0Vanilla27.9900.89520.2354215,040
NTF-v121.728−6.2620.8609−0.03440.2223−0.0131191,648
Confidence27.880−0.1100.8982+0.00300.2325−0.0029208,069
Adaptive27.259−0.7310.8919−0.00330.2387+0.0033188,761
x4Vanilla28.2690.89330.2385189,358
NTF-v122.868−5.4010.8750−0.01820.1878−0.0508254,935
Confidence27.321−0.9480.8919−0.00140.2395+0.0010219,508
Adaptive25.051−3.2180.8885−0.00480.2245−0.0140113,895
x16Vanilla27.7120.88400.2407196,779
NTF-v126.226−1.4860.8912+0.00710.1720−0.0687236,104
Confidence28.253+0.5410.8888+0.00480.2354−0.0053207,307
Adaptive27.580−0.1320.9010+0.01690.1894−0.0513181,323
x64Vanilla26.1100.83870.2567185,472
NTF-v127.779+1.6690.8676+0.02880.1800−0.0767175,689
Confidence27.331+1.2210.8446+0.00580.2456−0.0111239,418
Adaptive28.072+1.9610.8700+0.03130.1876−0.0690198,000

Confidence − Vanilla PSNR

x0
−0.11
x4
−0.95
x16
+0.54
x64
+1.22

Adaptive − Vanilla PSNR

x0
−0.73
x4
−3.22
x16
−0.13
x64
+1.96

最重要的形状:Confidence 从 x16 开始超过 Vanilla;Adaptive 的 gate 将 NTF-v1 在 x16 的 −1.49 dB 修复到 −0.13 dB,但 x4 的 α≈0.27 仍然过强。下一版应把 x4 基本设为零、x16 部分开启、x64 完全开启。

视觉对比

选择 noise 与 held-out view。x0/x64 包含全部六种方案,x4/x16 展示两种入选方案。点击放大。

x64 肉眼观察

  • Vanilla 在屋顶、树冠和左侧阴影出现大面积拖影与跨结构扩散。
  • Adaptive 明显恢复建筑立面和车辆轮廓,但树冠仍是低频团块,并残留少量彩色 speckle。
  • Confidence 的高光/暗部拖影比 Adaptive 更明显,符合其较弱的 x64 SSIM/LPIPS。
  • Frequency split 产生密集高频纹理和色斑,数值与 560k GS explosion 一致。

不是“只靠模糊”

  • Adaptive x64 edge PSNR:20.13 → 21.98 dB,提升 1.85 dB。
  • Adaptive x64 flat PSNR:31.41 → 33.69 dB,提升 2.28 dB。
  • Confidence x64 edge / flat PSNR 分别提高 1.01 / 1.80 dB。
  • 因此高噪声收益覆盖真实边缘与平坦区域,但视觉上仍需专门解决树叶等高频结构。

Gaussian 机制:支持什么,不支持什么

x64 MethodPSNREdge PSNRGS countTiny %Aspect >20 %Opacity <.05 %Interpretation
Vanilla26.11020.131185,4720.69091.9748.24reference
NTF-v127.77921.851175,6890.93888.7431.56coarser / more opaque representation
Adaptive28.07221.981198,0000.11988.7940.65shape tail improves; count does not fall
Additive anchor26.85620.808166,6110.25091.0648.45fewer GS, modest quality gain
Confidence27.33121.146239,4181.33491.7347.10quality gain without geometry cleanup
Curriculum26.56020.569282,7910.16290.4445.26late linear stage regrows complexity
Frequency split27.39421.497559,9604.44590.9655.94clear pathological densification
Variance deadzone27.15921.258123,0300.67090.6245.13smallest model, not best image

Tiny threshold 固定为 clean x0 Vanilla geometric scale 的第 1 百分位。Aspect>10 在 clean baseline 已覆盖约 95% GS,因此不是有辨别力的“错误 GS”定义;表中改用更严格的 Aspect>20,但它仍只是 proxy,不能当几何真值。

得到支持

  • 强 asinh/Adaptive 路线减少 extreme aspect-ratio 与低 opacity 尾部,并提高 held-out edge PSNR。
  • Frequency split 的高频 artifact、GS 爆炸和 tiny tail 同时恶化,形成一致的失败机制证据。
  • Deadzone 证明减少 GS 数量不等于更高质量。

没有得到支持

  • “噪声越大,总 GS 一定越多”仍不成立。
  • “所有有效方法都通过减少错误 GS 工作”不成立;Confidence 是直接反例。
  • 小/细 Gaussian 不能直接定义为错误;需要投影回图像,测它们与 noise residual、跨视图不一致区域的空间相关性。

六种方案逐一判定

1 · Adaptive blend — 保留

它是 NTF-v1 的正确门控版本。x64 与 NTF-v1 同 loss;真正的进步是 x16 已接近 Vanilla。x4 gate 仍过强,下一版只需调整开启曲线。

2 · Additive anchor — 暂停

保留线性项确实稳定了 clean/highlight,但 x64 只有 +0.75 dB,未充分抑制 noisy gradients。

3 · Frequency split — 淘汰

产生 560k GS、4.45% tiny tail 和明显高频色斑。局部 edge loss 在噪声中会直接刺激 densification。

4 · Confidence linear — 主候选

最简单、唯一通过 clean gate,并在 x16/x64 形成正增益。它是后续方法的安全 backbone,也是必须保留的强 ablation。

5 · Curriculum — 当前实现淘汰

LPIPS 很好但 PSNR 弱、GS 增至 283k。15k 后恢复线性且继续优化全部参数,可能重新拟合 noise;若重试应冻结 geometry。

6 · Variance deadzone — 效率 baseline

只有 123k GS,但 SSIM/LPIPS 几乎不改善。可作为“模型变小不等于去噪成功”的机制对照,不作为主方法。

Decision gates 与下一步

Question
Observed
Decision
能否修复 clean collapse?
Confidence x0 −0.11 dB;显式 identity 生效
Yes,需多 seed 确认
x16 / x64 是否都超过 Vanilla?
Confidence +0.54 / +1.22 dB
Yes,首次完整通过
强 NTF 是否保住高噪声优势?
Adaptive x64 +1.96 dB
Yes
x4 是否安全?
Confidence −0.95;Adaptive −3.22 dB
No,gate onset 仍需后移
减少错误 GS 是统一机制吗?
Adaptive 支持;Confidence 反例
Partial,不作单一主 claim

下一版建议:Confidence backbone + late-onset transform

  1. 以 linear L1+DSSIM 和 SNR confidence 作为主损失。
  2. 只在全局噪声阈值明显超过 x4 时加入 transformed residual:x4≈0、x16≈0.25–0.4、x64≈1。
  3. transformed term 只替换低 SNR residual,不替换全图 SSIM;高光与可靠边缘继续使用线性锚点。
  4. 若使用两阶段训练,在 15k 冻结 position/scale/opacity,只恢复 appearance,避免重新 densify。

论文级验证前必须补的实验

  1. Vanilla、Confidence、Adaptive 在 x0/x16/x64 各跑 3 seeds,报告 mean±std。
  2. 固定 deterministic seed 仍不够;需记录 densification 轨迹和 final count 方差。
  3. 将 tiny/needle GS 投影到训练视角,测其与 synthetic noise residual 的空间相关性。
  4. 冻结设计后扩展至少 3 个 RawNeRF scene,再进入 real low-light/caves。

当前判断:项目方向继续。最有价值的新发现不是“六选一”,而是将方法拆成两个互补部件:Confidence 提供低/中噪声安全性,transform 提供极高噪声强度。下一步应组合二者,同时推迟 transform 的开启点。

运行与原始结果

StatusComplete · 2026-08-08 22:30:24–23:10:22 BST · no active process
Training12 x0/x64 screening runs + 4 selected x4/x16 runs · two RTX 4090 GPUs
Automatic selectionconfidence_linear, adaptive_blend
Artifactsselection.json · mechanism_summary.json · mechanism_summary.csv · experiment design
StorageRaw run directory ≈2.8 GB; source filesystem had ≈61 GB free after completion.
Expanded reconstruction