單幀本徵分解允許多種合理解釋。即使每一幀單獨看起來平滑、材質邊界清楚,不同視角的反照率仍可能處於不同尺度和色彩規範中。3DGS 的外觀參數由多張訓練圖像共享;把這些預測直接作為等權標籤,會在同一三維表面上產生互相衝突的梯度。
跨視角處理需要完成兩層工作。第一層是校準:估計可以由低維變換解釋的全局或逐通道漂移。第二層是決策:判斷校準後的殘差來自正常噪聲、局部失敗還是錯誤對應,並據此決定監督是否進入訓練。兩層不能合併為一個誤差閾值,因為一個自由度過高的校準模型也能降低殘差,卻不一定提高偽標籤質量。
多視圖重疊區域 設第i 個視角的反照率預測為A ^ i ,參考視角為r 。像素p 通過當前深度D i ( p ) 反投影到三維:
X i ( p ) = R i T ( D i ( p ) K i − 1 p ~ − t i ) , 再投影到參考視角:
q i r ( p ) = π ( K r ( R r X i ( p ) + t r ) ) . 這裏的p ~ 是齊次像素座標。只有同時滿足下列條件的像素才能進入重疊域Ω i r :投影位於參考圖像內部,兩側深度在容差內一致,視線未被遮擋,反照率預測有效,且像素不處於明顯飽和或動態區域。可以寫成
m i r ( p ) = m in ( p ) ⋅ m depth ( p ) ⋅ m visible ( p ) ⋅ m valid ( p ) ∈ { 0 , 1 } , Ω i r = { p : m i r ( p ) = 1 } , 其中乘號表示多個二值條件的合取。
深度一致性常用相對形式:
m depth ( p ) = I [ | z r ( X i ( p ) ) − D r ( q i r ( p ) ) | D r ( q i r ( p ) ) + ϵ < τ z ] . 若幾何本身尚不穩定,Ω i r 會繼承深度誤差。反照率校準因此不應在訓練最早期由任意像素對應驅動;更穩妥的做法是使用可靠的初始幾何、稀疏匹配或經過前後向檢查的對應,並保留重疊率作為質量變量。
逐通道仿射校準 本徵分解中的尺度規範、相機曝光與白平衡通常表現為低維色彩漂移。對顏色通道c ,用仿射模型
A i , c ∗ ( p ) = a i , c A ^ i , c ( p ) + b i , c 將第i 幀映射到參考域。忽略魯棒損失時,加權最小二乘問題為
min a , b ∑ p ∈ Ω i r ω p ( a x p + b − y p ) 2 , 其中
x p = A ^ i , c ( p ) , y p = A ^ r , c ( q i r ( p ) ) . 令
x ― w = ∑ p ω p x p ∑ p ω p , y ― w = ∑ p ω p y p ∑ p ω p , 閉式解為
a ∗ = ∑ p ω p ( x p − x ― w ) ( y p − y ― w ) ∑ p ω p ( x p − x ― w ) 2 , b ∗ = y ― w − a ∗ x ― w . 分母是源預測在有效重疊域內的加權方差。當場景幾乎只有均勻白牆時,
∑ p ω p ( x p − x ― w ) 2 ≈ 0 , 尺度a 變得不可辨識;這時很小的像素噪聲也會導致很大的尺度變化。給分母加ϵ 只能避免數值除零,不能恢復缺失的信息。工程上需要限制a 與b 的合理範圍、增加先驗,或者在色彩跨度不足時退化為僅估計偏置/尺度。
將問題寫成矩陣形式
y = X β + ϵ , X = [ x 1 1 ⋮ ⋮ x n 1 ] , β = [ a b ] , 若殘差方差近似為σ 2 ,參數協方差為
Cov ( β ^ ) ≈ σ 2 ( X T W X ) − 1 . X T W X 的最小特徵值越小,對齊參數越不穩定。因而質量評估除了查看校準誤差,還應檢查重疊面積、源值方差和法方程條件數。
魯棒重加權與局部失敗 遮擋邊界、鏡面高光、錯誤深度和單幀分解失敗會形成離群殘差。把平方損失替換為魯棒 M 估計:
min a , b ∑ p ∈ Ω i r ω p ρ δ ( a x p + b − y p ) , 以 Huber 損失為例 [1 ] ,
ρ δ ( r ) = { 1 2 r 2 , | r | ≤ δ , δ ( | r | − 1 2 δ ) , | r | > δ . 它對應的迭代重加權係數為
u ( r ) = ρ δ ′ ( r ) r = { 1 , | r | ≤ δ , δ / | r | , | r | > δ . 每輪用ω p u ( r p ) 更新加權最小二乘,能夠降低孤立大殘差的影響。然而,若一整塊牆面都被預測成錯誤色調,這些殘差可能彼此一致,並不會表現為統計離群點。魯棒估計保護的是參數免受少量異常值支配,不負責判斷模型偏差是否具有空間結構。
可以用有效樣本量觀察權重是否集中在少數像素:
N eff = ( ∑ p ω ~ p ) 2 ∑ p ω ~ p 2 , ω ~ p = ω p u ( r p ) . 即使| Ω i r | 很大,若大多數像素被降權,N eff 仍會很小。僅報告重疊像素數量會高估校準的實際支撐。
多視圖圖上的規範傳播 逐幀都對齊到單一參考視角會讓參考幀的局部錯誤傳播到整個場景。把視角看成圖G = ( V , E ) ,邊( i , j ) 上估計相對仿射參數。為便於推導,先考慮無偏置的對數尺度
g i j = log a i j . 每個視角具有未知規範s i = log a i ,理想情況下
g i j = s j − s i + ϵ i j . 全局估計可以寫成
min { s i } ∑ ( i , j ) ∈ E w i j ( s j − s i − g i j ) 2 , s r = 0. 其法方程由加權圖拉普拉斯矩陣給出。固定一個參考規範後,只有與參考節點連通的視角才能被確定;弱連接節點的不確定性會明顯增大。這個圖結構比“每幀是否存在預測文件”更接近多視圖監督的真實可用性。
環路還能提供不依賴絕對規範的一致性檢查。對閉環i → j → k → i ,理想情況下
g i j + g j k + g k i = 0. 帶偏置的仿射變換記為T i j ( x ) = a i j x + b i j ,則複合閉環應滿足
T k i ∘ T j k ∘ T i j ≈ Id . 較大的閉環誤差說明至少一條邊的對應或校準不可靠。它仍不能定位哪一幀必然錯誤,但能發現單參考誤差指標無法暴露的相互矛盾。
校準一致性與反照率偏差 記校準前後在驗證重疊域上的誤差為
E before = 1 Z ∑ p ω p ∥ A ^ i ( p ) − A ^ r ( q p ) ∥ 1 , E after = 1 Z ∑ p ω p ∥ A i ∗ ( p ) − A ^ r ( q p ) ∥ 1 , Z = ∑ p ω p . 改善比例可寫為
ρ i = E before − E after E before + ϵ . ρ i > 0 表示低維校準提高了兩幀的一致性,但它不證明二者接近真實反照率。若兩幀都把陰影錯誤地烘焙進材質,校準後仍可高度一致;若參考幀自身錯誤,其他幀向它靠近反而擴大偏差。質量向量至少應包括
q i = [ E after , ρ i , r overlap , N eff , κ i , E cycle , u i ] , 分別描述殘餘誤差、改善比例、重疊率、有效樣本量、條件數、閉環誤差與預測不確定性。多維質量不能由一個指標完全替代。
真實圖像中的反照率候選並非處處同樣可靠。多個樣本在大面積漫反射表面較一致,在燈具、鏡面、物體邊緣和小結構附近方差升高;場景級校準只能處理整體規範,局部不確定性仍需進入像素掩碼或連續權重 [2 ] 。 質量路由與監督權重 令渲染或解碼得到的反照率為A θ , i ( p ) ,校準後的偽標籤為A i ∗ ( p ) 。帶路由的監督項可以寫成
L A ( t ) = ∑ i , p w A ( 0 ) η ( t ) Γ ( q i ) c i ( p ) m i ( p ) ℓ ( A θ , i ( p ) , A i ∗ ( p ) ) ∑ i , p η ( t ) Γ ( q i ) c i ( p ) m i ( p ) + ϵ . w A ( 0 ) 是基礎權重,η ( t ) 是時間調度,Γ ( q i ) 是場景/幀級質量路由,c i ( p ) 是像素級連續置信度,m i ( p ) 處理無效區域。將這些因子分開,可以區分四類問題:監督總體量綱、當前訓練階段、整幀是否可信、局部像素是否有效。
離散路由可以取
通 過 警 告 失 敗 Γ ( s i ) = { 1 , s i = 通過 , γ , s i = 警告 , 0 , s i = 失敗 , 0 < γ < 1. 它便於記錄和復現實驗,但閾值附近會產生跳變。連續形式可以用標準化風險分數r i :
Γ i = σ ( τ − r i T ) , 其中T 控制過渡寬度。連續權重更平滑,代價是質量變量的標定必須穩定;若不同場景的分數分佈不一致,同一個τ 並不代表相同風險。
質量路由的誤判代價 設偽標籤正確的概率為q 。啟用監督時,正確標籤帶來的期望收益為B ,錯誤標籤帶來的代價為C ;禁用監督的收益記為零。啟用的期望效用為
U on = q B − ( 1 − q ) C . 只有當
q > C B + C 時,啟用監督才更合適。如果錯誤偽標籤會通過共享外觀進一步擾動幾何,C 較大,閾值自然應更保守;若反照率分支與幾何完全隔離且具有強魯棒性,C 較小,可以保留更多弱監督。這說明路由閾值取決於下游損害,不只是上游預測指標。
質量狀態還會改變梯度偏差。設真實反照率梯度為g ∗ ,偽標籤產生的梯度為
g ~ = g ∗ + b + ξ , b 是系統偏差,ξ 是零均值噪聲。乘以置信度w 後,梯度均方誤差為
E ∥ w g ~ − g ∗ ∥ 2 2 = ∥ ( w − 1 ) g ∗ + w b ∥ 2 2 + w 2 E ∥ ξ ∥ 2 2 . 降權能壓低噪聲方差,也會削弱有效信號;若偏差方向與真實梯度相反,較大的w 尤其危險。質量路由需要在信息增益與偏差傳播之間取得可解釋的折中,偽標籤的使用數量並非優先目標。
時間調度與幾何狀態 訓練初期的投影、覆蓋率和外觀特徵都在快速變化。過早啟用跨視角反照率監督,可能把錯誤對應固定到共享表示;過晚啟用則讓顏色參數先吸收照明。一個平滑的升權函數可以寫為
η ( t ) = { 0 , t < t 0 , 1 2 [ 1 − cos ( π t − t 0 t 1 − t 0 ) ] , t 0 ≤ t < t 1 , 1 , t ≥ t 1 . 固定迭代數只是近似。更直接的啟用條件可以依賴幾何狀態,例如覆蓋率、深度方差、重投影殘差或對應閉環誤差。當這些量穩定後再提高η ,調度會更接近監督實際可靠性的變化。
質量也可能隨訓練發生改變。若偽標籤對齊完全基於固定初始幾何,後期幾何改善不會反映到對應;若每輪都在線重算,標籤與模型又形成強反饋迴路。常見折中是低頻更新對應與質量緩存,並用滯回閾值避免狀態在邊界附近反覆切換:
通 過 失 敗 s i ( t + 1 ) = { 通過 , q i > τ on , 失敗 , q i < τ off , s i ( t ) , τ off ≤ q i ≤ τ on , 其中τ off < τ on 。
校準與路由的適用範圍 診斷量 能說明的內容 不能說明的內容 校準後誤差 低維變換後的剩餘不一致 反照率是否接近物理真值 改善比例 仿射校準是否有作用 參考幀是否正確 重疊率 對齊可用區域的覆蓋程度 對應是否沒有系統偏差 有效樣本量 魯棒權重是否集中 大範圍一致錯誤是否存在 條件數 仿射參數是否可辨識 分解語義是否正確 閉環誤差 多視圖相對變換是否矛盾 錯誤具體位於哪條邊 預測方差 單幀模型的解空間分散程度 低方差預測是否無偏
多視圖反照率偽監督需要把圖像、對應、校準參數、掩碼和質量狀態作為一個整體保存。缺少其中任何一項,後續訓練都難以區分“沒有標籤”“標籤未對齊”“標籤不可靠”和“標籤只在局部有效”。
校準解決的是規範差異,路由控制的是錯誤傳播。它們都不改變 3DGS 的外觀參數化:即使偽標籤已經足夠穩定,球諧係數、逐高斯潛在特徵和顏色解碼器仍會以不同方式吸收監督並影響幾何。《無球諧外觀表示與神經顏色解碼》 從這條梯度路徑繼續分析外觀參數化的影響。
參考文獻 Huber PJ. Robust Estimation of a Location Parameter[J]. The Annals of Mathematical Statistics, 1964, 73–101. ↩ Kocsis P, Sitzmann V, Nießner M. Intrinsic Image Diffusion for Indoor Single-View Material Estimation[C]. IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, 5198–5208. ↩