NY

跨視角反照率校準與質量路由

弱紋理場景中的高斯表示與重建
技術筆記 神經渲染 3D Gaussian Splatting 3DGS 反照率 多視圖一致性 魯棒估計 質量路由

單幀本徵分解允許多種合理解釋。即使每一幀單獨看起來平滑、材質邊界清楚,不同視角的反照率仍可能處於不同尺度和色彩規範中。3DGS 的外觀參數由多張訓練圖像共享;把這些預測直接作為等權標籤,會在同一三維表面上產生互相衝突的梯度。

跨視角處理需要完成兩層工作。第一層是校準:估計可以由低維變換解釋的全局或逐通道漂移。第二層是決策:判斷校準後的殘差來自正常噪聲、局部失敗還是錯誤對應,並據此決定監督是否進入訓練。兩層不能合併為一個誤差閾值,因為一個自由度過高的校準模型也能降低殘差,卻不一定提高偽標籤質量。

多視圖重疊區域

設第i個視角的反照率預測為A^i,參考視角為r。像素p通過當前深度Di(p)反投影到三維:

Xi(p)=RiT(Di(p)Ki1p~ti),

再投影到參考視角:

qir(p)=π(Kr(RrXi(p)+tr)).

這裏的p~是齊次像素座標。只有同時滿足下列條件的像素才能進入重疊域Ωir:投影位於參考圖像內部,兩側深度在容差內一致,視線未被遮擋,反照率預測有效,且像素不處於明顯飽和或動態區域。可以寫成

mir(p)=min(p)mdepth(p)mvisible(p)mvalid(p){0,1},Ωir={p:mir(p)=1},

其中乘號表示多個二值條件的合取。

深度一致性常用相對形式:

mdepth(p)=I[|zr(Xi(p))Dr(qir(p))|Dr(qir(p))+ϵ<τz].

若幾何本身尚不穩定,Ωir會繼承深度誤差。反照率校準因此不應在訓練最早期由任意像素對應驅動;更穩妥的做法是使用可靠的初始幾何、稀疏匹配或經過前後向檢查的對應,並保留重疊率作為質量變量。

逐通道仿射校準

本徵分解中的尺度規範、相機曝光與白平衡通常表現為低維色彩漂移。對顏色通道c,用仿射模型

Ai,c(p)=ai,cA^i,c(p)+bi,c

將第i幀映射到參考域。忽略魯棒損失時,加權最小二乘問題為

mina,bpΩirωp(axp+byp)2,

其中

xp=A^i,c(p),yp=A^r,c(qir(p)).

xw=pωpxppωp,yw=pωpyppωp,

閉式解為

a=pωp(xpxw)(ypyw)pωp(xpxw)2,b=ywaxw.

分母是源預測在有效重疊域內的加權方差。當場景幾乎只有均勻白牆時,

pωp(xpxw)20,

尺度a變得不可辨識;這時很小的像素噪聲也會導致很大的尺度變化。給分母加ϵ只能避免數值除零,不能恢復缺失的信息。工程上需要限制ab的合理範圍、增加先驗,或者在色彩跨度不足時退化為僅估計偏置/尺度。

將問題寫成矩陣形式

y=Xβ+ϵ,X=[x11xn1],β=[ab],

若殘差方差近似為σ2,參數協方差為

Cov(β^)σ2(XTWX)1.

XTWX的最小特徵值越小,對齊參數越不穩定。因而質量評估除了查看校準誤差,還應檢查重疊面積、源值方差和法方程條件數。

魯棒重加權與局部失敗

遮擋邊界、鏡面高光、錯誤深度和單幀分解失敗會形成離群殘差。把平方損失替換為魯棒 M 估計:

mina,bpΩirωpρδ(axp+byp),

以 Huber 損失為例 [1]

ρδ(r)={12r2,|r|δ,δ(|r|12δ),|r|>δ.

它對應的迭代重加權係數為

u(r)=ρδ(r)r={1,|r|δ,δ/|r|,|r|>δ.

每輪用ωpu(rp)更新加權最小二乘,能夠降低孤立大殘差的影響。然而,若一整塊牆面都被預測成錯誤色調,這些殘差可能彼此一致,並不會表現為統計離群點。魯棒估計保護的是參數免受少量異常值支配,不負責判斷模型偏差是否具有空間結構。

可以用有效樣本量觀察權重是否集中在少數像素:

Neff=(pω~p)2pω~p2,ω~p=ωpu(rp).

即使|Ωir|很大,若大多數像素被降權,Neff仍會很小。僅報告重疊像素數量會高估校準的實際支撐。

多視圖圖上的規範傳播

逐幀都對齊到單一參考視角會讓參考幀的局部錯誤傳播到整個場景。把視角看成圖G=(V,E),邊(i,j)上估計相對仿射參數。為便於推導,先考慮無偏置的對數尺度

gij=logaij.

每個視角具有未知規範si=logai,理想情況下

gij=sjsi+ϵij.

全局估計可以寫成

min{si}(i,j)Ewij(sjsigij)2,sr=0.

其法方程由加權圖拉普拉斯矩陣給出。固定一個參考規範後,只有與參考節點連通的視角才能被確定;弱連接節點的不確定性會明顯增大。這個圖結構比“每幀是否存在預測文件”更接近多視圖監督的真實可用性。

環路還能提供不依賴絕對規範的一致性檢查。對閉環ijki,理想情況下

gij+gjk+gki=0.

帶偏置的仿射變換記為Tij(x)=aijx+bij,則複合閉環應滿足

TkiTjkTijId.

較大的閉環誤差說明至少一條邊的對應或校準不可靠。它仍不能定位哪一幀必然錯誤,但能發現單參考誤差指標無法暴露的相互矛盾。

校準一致性與反照率偏差

記校準前後在驗證重疊域上的誤差為

Ebefore=1ZpωpA^i(p)A^r(qp)1,Eafter=1ZpωpAi(p)A^r(qp)1,Z=pωp.

改善比例可寫為

ρi=EbeforeEafterEbefore+ϵ.

ρi>0表示低維校準提高了兩幀的一致性,但它不證明二者接近真實反照率。若兩幀都把陰影錯誤地烘焙進材質,校準後仍可高度一致;若參考幀自身錯誤,其他幀向它靠近反而擴大偏差。質量向量至少應包括

qi=[Eafter,ρi,roverlap,Neff,κi,Ecycle,ui],

分別描述殘餘誤差、改善比例、重疊率、有效樣本量、條件數、閉環誤差與預測不確定性。多維質量不能由一個指標完全替代。

三組真實室內圖像的反照率基線、多個預測樣本、均值和方差圖
真實圖像中的反照率候選並非處處同樣可靠。多個樣本在大面積漫反射表面較一致,在燈具、鏡面、物體邊緣和小結構附近方差升高;場景級校準只能處理整體規範,局部不確定性仍需進入像素掩碼或連續權重 [2]

質量路由與監督權重

令渲染或解碼得到的反照率為Aθ,i(p),校準後的偽標籤為Ai(p)。帶路由的監督項可以寫成

LA(t)=i,pwA(0)η(t)Γ(qi)ci(p)mi(p)(Aθ,i(p),Ai(p))i,pη(t)Γ(qi)ci(p)mi(p)+ϵ.

wA(0)是基礎權重,η(t)是時間調度,Γ(qi)是場景/幀級質量路由,ci(p)是像素級連續置信度,mi(p)處理無效區域。將這些因子分開,可以區分四類問題:監督總體量綱、當前訓練階段、整幀是否可信、局部像素是否有效。

離散路由可以取

Γ(si)={1,si=通過,γ,si=警告,0,si=失敗,0<γ<1.

它便於記錄和復現實驗,但閾值附近會產生跳變。連續形式可以用標準化風險分數ri

Γi=σ(τriT),

其中T控制過渡寬度。連續權重更平滑,代價是質量變量的標定必須穩定;若不同場景的分數分佈不一致,同一個τ並不代表相同風險。

質量路由的誤判代價

設偽標籤正確的概率為q。啟用監督時,正確標籤帶來的期望收益為B,錯誤標籤帶來的代價為C;禁用監督的收益記為零。啟用的期望效用為

Uon=qB(1q)C.

只有當

q>CB+C

時,啟用監督才更合適。如果錯誤偽標籤會通過共享外觀進一步擾動幾何,C較大,閾值自然應更保守;若反照率分支與幾何完全隔離且具有強魯棒性,C較小,可以保留更多弱監督。這說明路由閾值取決於下游損害,不只是上游預測指標。

質量狀態還會改變梯度偏差。設真實反照率梯度為g,偽標籤產生的梯度為

g~=g+b+ξ,

b是系統偏差,ξ是零均值噪聲。乘以置信度w後,梯度均方誤差為

Ewg~g22=(w1)g+wb22+w2Eξ22.

降權能壓低噪聲方差,也會削弱有效信號;若偏差方向與真實梯度相反,較大的w尤其危險。質量路由需要在信息增益與偏差傳播之間取得可解釋的折中,偽標籤的使用數量並非優先目標。

時間調度與幾何狀態

訓練初期的投影、覆蓋率和外觀特徵都在快速變化。過早啟用跨視角反照率監督,可能把錯誤對應固定到共享表示;過晚啟用則讓顏色參數先吸收照明。一個平滑的升權函數可以寫為

η(t)={0,t<t0,12[1cos(πtt0t1t0)],t0t<t1,1,tt1.

固定迭代數只是近似。更直接的啟用條件可以依賴幾何狀態,例如覆蓋率、深度方差、重投影殘差或對應閉環誤差。當這些量穩定後再提高η,調度會更接近監督實際可靠性的變化。

質量也可能隨訓練發生改變。若偽標籤對齊完全基於固定初始幾何,後期幾何改善不會反映到對應;若每輪都在線重算,標籤與模型又形成強反饋迴路。常見折中是低頻更新對應與質量緩存,並用滯回閾值避免狀態在邊界附近反覆切換:

si(t+1)={通過,qi>τon,失敗,qi<τoff,si(t),τoffqiτon,

其中τoff<τon

校準與路由的適用範圍

診斷量能說明的內容不能說明的內容
校準後誤差低維變換後的剩餘不一致反照率是否接近物理真值
改善比例仿射校準是否有作用參考幀是否正確
重疊率對齊可用區域的覆蓋程度對應是否沒有系統偏差
有效樣本量魯棒權重是否集中大範圍一致錯誤是否存在
條件數仿射參數是否可辨識分解語義是否正確
閉環誤差多視圖相對變換是否矛盾錯誤具體位於哪條邊
預測方差單幀模型的解空間分散程度低方差預測是否無偏

多視圖反照率偽監督需要把圖像、對應、校準參數、掩碼和質量狀態作為一個整體保存。缺少其中任何一項,後續訓練都難以區分“沒有標籤”“標籤未對齊”“標籤不可靠”和“標籤只在局部有效”。

校準解決的是規範差異,路由控制的是錯誤傳播。它們都不改變 3DGS 的外觀參數化:即使偽標籤已經足夠穩定,球諧係數、逐高斯潛在特徵和顏色解碼器仍會以不同方式吸收監督並影響幾何。《無球諧外觀表示與神經顏色解碼》從這條梯度路徑繼續分析外觀參數化的影響。

參考文獻

  1. Huber PJ. Robust Estimation of a Location Parameter[J]. The Annals of Mathematical Statistics, 1964, 73–101.
  2. Kocsis P, Sitzmann V, Nießner M. Intrinsic Image Diffusion for Indoor Single-View Material Estimation[C]. IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, 5198–5208.
Copyright © Nishikori Yui. All rights reserved.