NY

重建指標、消融證據與結論邊界

弱紋理場景中的高斯表示與重建
技術筆記 神經渲染 3D Gaussian Splatting 3DGS 實驗設計 消融實驗 幾何評價 新視角合成 統計分析

《3DGS 的訓練目標與重建評價》推導了 PSNR、SSIM 與 LPIPS 的定義,也分析了這些指標對像素差異、局部結構和感知特徵的不同偏好 [1, 2]。同一項 3DGS 研究若同時改動增密、外觀解碼與幾何正則,單個指標只記錄最終渲染結果在相應度量下的變化,改善可能來自其中任意一條參數路徑。

測試視圖與配對統計

對觀測視圖集V,訓練、驗證與測試切分分別為

V=VtrainVvalVtest,ViVj=.

訓練圖像用於梯度更新,驗證圖像用於選擇權重、停止時刻或檢查點,測試圖像留作最終評價。對每個場景反覆根據測試 PSNR 調整閾值,測試視圖便實際參與了模型選擇;即使沒有對它反向傳播,人工選擇也會引入信息泄漏。

相機軌跡上的相鄰幀高度相關。固定步長抽取的測試幀通常仍靠近訓練軌跡,主要反映局部視角插值;按相機位置和觀察方向拉大間隔後,測試集會包含更明顯的視角變化。公開基準沿用社區常用切分,額外切分單獨成表,兩組結果各自對應一套視圖分佈。

令方向係數ηm=1表示指標越大越好,ηm=1表示越小越好。對同一個測試視圖v,方法 B 相對 A 的指標差定義為

Δv=ηm(mv(B)mv(A)).

平均差為

Δ=1|Vtest|vΔv.

按這個定義,Δv>0表示 B 在視圖v上更好。每個視圖自身的難度同時存在於mv(A)mv(B)中,在差值裏相互抵消。兩個總體平均值m(A)m(B)會隱去這層配對關係,也看不出收益分佈在多數視圖,還是集中於少量極端樣本。

不對Δv作高斯分佈假設時,可以對測試視圖做 bootstrap。每次有放回抽取|Vtest|個差值並計算均值,重複B次得到{Δ(b)}b=1B,以其2.5%97.5%分位數構造95%置信區間:

Δ[q0.025,q0.975].

連續軌跡中的逐幀差值並不獨立,逐幀重抽樣會低估不確定性。按連續幀塊做 block bootstrap,或先計算場景均值再在場景層級重抽樣,可以保留一部分相關結構。場景數很少時,置信區間表示的仍是當前場景集內的波動。

弱紋理區域的統計

全圖誤差中,每個像素的權重相同,大面積平滑區域因像素數量較多而佔據主要比例。特定材質、弱紋理、邊界或高光區域可以用預先定義的掩碼Mv(p)單獨統計,其加權 MSE 為

MSEM=v,pMv(p)I^v(p)Iv(p)223v,pMv(p)+ε.

對應的區域 PSNR 為

PSNRM=10log10L2MSEM.

區域結果的可比性取決於掩碼是否獨立於待比較方法。若用某個方法的渲染深度或殘差定義「難區域」,不同方法實際上落在不同像素集上。由真值圖像、外部語義或邊緣檢測生成掩碼,或者預先固定幾何條件,可以讓所有結果共用同一統計區域。

圖像質量與幾何質量

對真值深度D和預測深度D^,有效像素集為ΩD,可計算

RMSED=1|ΩD|pΩD(D^(p)D(p))2.

全局尺度存在歧義時,尺度與偏置對齊會改變深度 RMSE 的含義。以最小二乘估計sb可寫為

(s,b)=argmins,bpΩD(sD^(p)+bD(p))2.

對點雲P與真值表面Q,對稱 Chamfer 距離為

dCD(P,Q)=1|P|xPminyQxy2+1|Q|yQminxPyx2.

第一項近似準確性,第二項近似完整性。只輸出少量高置信度點可以降低第一項,同時會損失表面覆蓋。準確性與完整性共同描述點集和真值表面的雙向接近程度,也可以進一步組成調和指標。

2DGS 在半透明玻璃與強高光區域的表面重建失敗案例
2DGS 的兩類失敗案例。半透明玻璃同時包含透射與多層表面,強高光又會隨視角改變;兩者都偏離局部不透明表面的假設,紅框與藍框中的網格因而出現孔洞或缺失 [3]

全場景平均 Chamfer 距離對這類局部失敗並不敏感。玻璃、高光與細薄結構通常只佔少量像素,局部孔洞會被大面積穩定表面稀釋;按材質類型和結構尺度拆分後,指標可以顯示這些區域的實際變化。圖像指標仍可能保持穩定,因為外觀分支可以在缺失幾何附近合成相近顏色。

消融中的主效應與交互項

以越大越好的指標y為例,兩個模塊 A 與 B 的2×2消融包含四組結果:基線y00,只加 A 的y10,只加 B 的y01,以及同時加入兩者的y11。A 在 B 關閉時的效應為

ΔA(B=0)=y10y00,

A 在 B 開啟時的效應為

ΔA(B=1)=y11y01.

交互項為

ΔAB=y11y10y01+y00.

ΔAB=0時,兩個模塊對該指標的影響在當前四組設置中近似可加;ΔAB<0對應收益重疊或相互干擾;ΔAB>0則顯示正向協同。它仍是特定數據、指標和訓練預算下的統計量,具體機制要結合中間輸出判斷。

《傳播式增密中的候選生成與幾何門控》引用的 GaussianPro 消融正好包含這四組結果。傳播與平面約束的 PSNR 單獨收益分別為0.95dB 和0.49dB,組合收益為1.15dB,交互項由此得到0.29dB [4]。負值表明兩項收益存在重疊;深度、法線、高斯數和候選接受統計可以進一步定位重疊發生在哪些區域與訓練階段。

四組結果共用數據切分、圖像預處理、相機位姿、初始點雲、訓練預算與評價實現,交互項才有一致的計算基礎。GaussianPro 額外列出不同 SfM 點雲下的 3DGS 基線,從傳播收益中分離了初始化變化。Color MLP 的對照固定高斯初始化與增密調度,本徵監督的對照固定偽標籤、置信掩碼和啟用時刻,差值便分別落在外觀參數化與監督信號上。

定量差值的空間分佈

均值Δ把視圖間差異壓縮成一個數。將配對差值{Δv}排序後,中位數附近、改善分佈上分位和下分位的視圖分別對應典型結果、明顯收益與退化案例。預先固定這三個位置,也能減少先查看渲染圖再挑選樣本帶來的偏差。

視圖內部還可計算逐像素改善圖。以方法 B 相對 A 的 L1 殘差變化為例,

Gv(p)=I^v(A)(p)Iv(p)1I^v(B)(p)Iv(p)1.

Gv(p)>0的區域表示 B 的像素殘差較小。它與弱紋理掩碼、深度差和法線差並排後,可以顯示收益集中在大面積低頻區域、物體邊界,還是少量高對比像素。比較中的相機、裁切範圍、縮放倍數與色彩空間保持一致。

Waymo 和 Mip-NeRF 360 場景中真值、GaussianPro 與 3DGS 的新視角局部細節對比
左側 Waymo 場景的樹枝與道路,右側 Mip-NeRF 360 場景的遮陽簾與地面細節,分別展示紋理豐富邊緣和弱紋理表面。放大框呈現 GaussianPro 與 3DGS 的局部差異,測試視圖的總體分佈則由配對統計和失敗案例補足 [4]

局部放大圖中的場景上下文用於辨認邊緣、遮擋關係和物體尺度。裁切過緊時,局部結構失去參照;裁切過鬆時,差異在網頁寬度下又會變得過小。保留主圖並附同比例放大框,可以兼顧兩種觀察尺度。

訓練過程與計算預算

記測試指標在訓練步tm(t)。最終值m(T)不含收斂速度、中途震蕩和後期退化的信息。對固定評價時刻t1<<tK,歸一化曲線面積可以概括訓練期間的表現:

AUCm=1tKt1k=1K1m(tk)+m(tk+1)2(tk+1tk).

後期穩定性可在最後J個檢查點上計算

sm=1J1k=KJ+1K(m(tk)mtail)2.

對 PSNR 與 SSIM,AUC 越大且sm越小,表示在當前評價頻率下收斂更快、後期波動更小;LPIPS 與誤差指標的方向相反。曲線平滑與隨機種子穩定性是兩個統計量,同一次訓練中的相鄰檢查點本身具有強相關性。

從整條測試曲線選擇最佳點,相當於使用了K次測試反饋。由驗證集選定檢查點後,測試集只在該點評價一次;採用固定訓練預算時,各方法則共用同一預算定義。

終點質量與取得該結果的成本可以組成多目標向量:

y=[PSNR,LPIPS,dgeom,ttrain,FPS,Mmodel].

對所有分量都以越小越好為約定。若方法 A 在每個分量上都不差於 B,且至少一項更好,則 A 支配 B。若 A 的圖像質量更高但訓練更慢、模型更大,兩者位於不同 Pareto 點,具體選擇取決於應用預算。

高斯數N只是成本的一個代理量。真實渲染成本還受每個高斯的屏幕覆蓋範圍(footprint)、覆蓋 tile 數、深度排序實例和像素過度繪製影響。較少的高斯直接對應更緊湊的表示,FPS 仍以實測結果為準。

固定迭代數比較每一步優化帶來的收益,固定訓練時間比較端到端計算成本。傳播式增密增加候選生成和多視圖檢查,Color MLP 也改變每次前向與反向傳播的開銷,兩種預算下的排序可能不同。固定分辨率、硬件、預熱方式與數據寫回範圍後,FPS 即可與模型存儲和高斯數一起進入 Pareto 比較。

結語

新視角 PSNR、SSIM 和 LPIPS 衡量測試圖像與參考圖的接近程度;深度、法線與表面距離描述幾何誤差;反照率或光照分解則依賴相應真值。三類觀測可以同時改善,也會因外觀補償、尺度對齊和局部失敗而呈現不同趨勢。

對 3DGS 的增密、外觀解碼和幾何正則,配對差值給出收益在視圖間的分佈,區域指標和誤差圖指出變化發生的位置,消融交互項刻畫模塊組合,訓練曲線與 Pareto 向量補充取得結果所需的預算。這些觀測共同描述本次比較中的圖像質量、幾何變化、模塊作用與計算成本。

參考文獻

  1. Wang Z, Bovik AC, Sheikh HR, et al.. Image Quality Assessment: From Error Visibility to Structural Similarity[J]. IEEE Transactions on Image Processing, 2004, 600–612.
  2. Zhang R, Isola P, Efros AA, et al.. The Unreasonable Effectiveness of Deep Features as a Perceptual Metric[C]. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, 586–595.
  3. Huang B, Yu Z, Chen A, et al.. 2D Gaussian Splatting for Geometrically Accurate Radiance Fields[C]. ACM SIGGRAPH 2024 Conference Papers, 2024, 1–11.
  4. Cheng K, Long X, Yang K, et al.. GaussianPro: 3D Gaussian Splatting with Progressive Propagation[C]. Proceedings of the International Conference on Machine Learning, 2024, 8123–8140.↩1 ↩2
Copyright © Nishikori Yui. All rights reserved.