NY

複雜光照下的本徵圖像與反照率先驗

弱紋理場景中的高斯表示與重建
技術筆記 神經渲染 3D Gaussian Splatting 3DGS 本徵圖像 反照率 複雜光照 逆向渲染

多通道渲染把深度、法線和特徵接入了 3DGS 的可微管線,卻沒有拆開 RGB 本身。對同一塊淺色牆面,像素變暗可能來自牆面材質、入射光減弱、遮擋形成的陰影,也可能來自曝光和相機響應。這些因素最後落入同一個三通道觀測,僅靠重投影殘差很難判定應當修改幾何還是外觀。

本徵圖像(Intrinsic Image)提供了一種中間描述:把相對穩定的表面反射屬性與隨照明變化的成分分開。它並不自動給出場景的真實材質,也不能消除單張圖像中的固有歧義;更合適的定位是帶有物理含義、同時受模型假設約束的外觀先驗 [1]

反射方程與像素乘積

表面點x沿觀察方向ωo的出射輻亮度可寫為

Lo(x,ωo)=Ω+fr(x,ωi,ωo)Li(x,ωi)V(x,ωi)(nTωi)+dωi.

fr是雙向反射分佈函數,Li是入射光,V表示可見性,n是表面法線。若表面近似朗伯反射,則

fr=ρ(x)π,

其中ρ[0,1]3為漫反射反照率。代回積分可得

Lo(x)=ρ(x)1πΩ+LiV(nTωi)+dωi.

把積分項記為彩色漫反射陰影S(x),在線性相機響應、沒有飽和與後處理的近似下,像素形成式為

I(p)=A(p)S(p)+ε(p).

A是反照率,S同時包含光源強度、光源顏色、法線朝向、遮擋和間接光;ε則吸收鏡面反射、透射、傳感器噪聲以及模型未表示的部分。常見的灰度陰影模型進一步令

S(p)=s(p)1,

它等價於假設入射光在三個通道上的比例固定。室內混合色溫、彩色牆面二次反射和窗外光進入後,這個條件很容易失效。

分解中的尺度規範

即使乘法模型完全成立,I=AS仍然沒有唯一解。任取逐通道正數k,都有

I=(kA)(Sk).

因此,反照率絕對尺度無法僅由像素乘積恢復。轉到對數域,令

i=log(I+ϵ),a=log(A+ϵ),s=log(S+ϵ),

i=a+s.

對任意常量向量δ,變換

a=a+δ,s=sδ

保持觀測不變。其雅可比

J=[I3I3]

至少具有三維零空間

null(J)={[δδ]:δR3}.

灰度陰影把自由度從三個通道縮到一個全局尺度,卻仍需要規範條件。固定某一區域的平均陰影、約束反照率動態範圍、使用已知白色表面或在評價時先作尺度對齊,都屬於選擇規範(gauge fixing);它們讓數值可比較,卻沒有從觀測中創造新的物理信息。

一幅室內輸入圖像對應多組材質假設、方差區域和重照明結果
同一幅室內圖像可以對應多組合理的材質解釋。中間的候選在整體反照率、局部材質和高光歸屬上不同,方差圖在燈具、鏡面及邊緣附近響應更強;這種多解性來自觀測本身,不能只靠確定性迴歸消除 [2]

局部變化的分解歧義

對乘法模型作一階微分,有

δI=diag(S)δA+diag(A)δS.

若要求像素保持不變,則

δS=diag(A)1diag(S)δA.

任何小的反照率擾動都能被相應的陰影擾動抵消。實際方法必須加入空間或語義先驗,決定哪些變化更像材質、哪些變化更像照明。例如,反照率通常被假設為分段平滑且在材質邊界跳變;陰影通常變化較緩,但投影陰影邊緣又可以非常銳利。簡單的“高頻歸反照率、低頻歸陰影”無法處理牆紙緩變、軟陰影邊界和帶紋理光源。

序關係為尺度歧義之外增加了另一類約束。若人工或模型判斷像素pq屬於相同反照率,可約束a(p)a(q)0;若判斷一個表面更亮,則約束差值符號。Ordinal Shading 通過陰影序關係和全局結構組織分解,說明相對判斷能夠在沒有絕對反照率標定時提供信息 [3]。不過,序關係只縮小可行集,仍不會給出唯一的輻射尺度。

反照率的條件分佈

單張圖像同時容許多組材質與光照解釋時,確定性模型只能把它們壓到一個輸出。設輸入圖像為x,材質屬性圖為m,使用均方誤差訓練的確定性預測器滿足

f(x)=argminyE[my22x]=E[mx].

條件分佈p(mx)若含有多個峰,條件均值可能落在任何一個峰之外。對反照率來說,表現為材質邊界變軟、小結構被平均,或同一區域混合了相互排斥的材質解釋。機率模型改為描述這個條件分佈,在同一x下通過不同隨機噪聲產生m(1),,m(K)

Intrinsic Image Diffusion 先把反照率與 BRDF 屬性編碼到潛空間。對潛在材質z0加噪得到

zt=α¯tz0+1α¯tϵ,ϵN(0,I),

並以輸入圖像的條件特徵c(x)預測噪聲:

Ldiff=Et,z0,ϵ[ϵϵθ(zt,t,c(x))22].

去噪過程對應從條件分佈中取樣,每個樣本仍需滿足輸入圖像中可觀測的邊界、語義和幾何線索。訓練集來自含有反照率、粗糙度和金屬度標籤的合成場景,預訓練圖像先驗則為真實圖像提供高頻細節與物體語義線索 [2]

Intrinsic Image Diffusion 把反照率和 BRDF 屬性編碼到潛空間並由輸入圖像條件引導去噪的訓練管線
反照率與粗糙度、金屬度分別編碼為潛在材質特徵,輸入圖像同時提供空間特徵與 CLIP 條件。模型在潛空間學習預測所加噪聲,推理時從不同噪聲起點得到多組可能的材質圖 [2]

彩色照明與殘差分量

真實圖像中,把全部非反照率變化塞入單通道s會產生系統誤差。一個更寬的分量模型可以寫成

I=AdSd+R,

AdSd分別表示漫反射反照率與彩色漫反射陰影,R表示非漫反射殘差。進一步分解

R=R+R,R+,R0,

可以分別表示在漫反射預測之上增加亮度的鏡面/發光分量,以及曝光截斷或模型過估導致的負殘差。Colorful Diffuse Intrinsic Image Decomposition 使用彩色陰影與殘差層處理多光源、二次反射和高光,給出了比灰度乘法更接近複雜圖像的描述 [4]

威尼斯場景的輸入圖像、反照率、彩色漫反射陰影和鏡面殘差四個分量
輸入圖像被分解為反照率、彩色漫反射陰影與非漫反射殘差。天空與水面的色調需要彩色照明解釋,強反射和局部高光則集中在殘差中;若只保留灰度陰影,這些變化更容易泄漏到反照率 [4]

分量增加會降低單個分支的建模偏差,同時擴大解空間。對

I^=AdSd+R

而言,僅使用重建損失

Lrec=I^I1

不能阻止R吸收全部圖像,也不能阻止AdSd交換內容。分支必須具有不同的容量、輸入和正則:反照率需要跨照明穩定,陰影應與幾何和光照相關,殘差應保持稀疏或低容量。分解的意義來自這些結構約束,而非變量名稱。

相機管線帶來的額外歧義

相機記錄值通常不是線性輻亮度。把曝光時間記為t、每通道增益記為g、相機響應與色調映射記為h,則

Iobs=Q(h(clip(tgL,0,Lmax)))+η,

其中Q表示量化。若直接在顯示域應用I=AS,響應曲線會改變乘法關係;白平衡會製造逐通道尺度;局部色調映射還會讓相鄰像素的響應彼此相關。

飽和區域的信息損失更直接。標量通道滿足

Iobs=min(tL,Lmax),

tL>Lmax時,

IobsL=0.

高光區域中多個不同的輻亮度會映射為同一上限值,分解模型只能依靠鄰域和數據先驗猜測被截斷的內容。暗部量化與讀出噪聲也會降低有效信噪比。因此,反照率置信度應當在飽和、極暗、鏡面和透明區域下降,而不能只根據預測圖是否平滑來判斷。

多視圖條件下的可辨識性

設同一三維表面點在視角v中的觀測為

Iv=ASv+εv.

共享的A為多視圖提供了耦合。若多個視角的光照調製不同,而反照率保持不變,聯合觀測可以排除一部分單幀解釋。對數域中

iv=a+sv,

兩視角作差後得到

iviu=svsu,

共享反照率被消去。這有助於估計相對照明變化,卻仍保留共同尺度自由度。更重要的是,只有對應到同一表面點、沒有遮擋切換且材質近似視角無關時,共享假設才成立。位姿誤差、深度誤差和鏡面反射都會讓所謂的跨視角反照率差異混入幾何與視角效應。

若把像素對應寫為由幾何參數θg決定的映射q=πu(X(p;θg)),反照率一致性殘差為

ruv(p)=A^v(p)A^u(q).

其幾何雅可比包含

ruvθg=A^u(q)qθg.

反照率在平坦區域的梯度很小,跨視角一致性對幾何的直接約束仍然會變弱;它主要減少光照變化造成的偽殘差,不能憑空恢復弱紋理區域的深度。這個結論與前文的幾何可觀測性分析一致:更乾淨的外觀信號能夠減少錯誤梯度,但新增幾何秩仍需深度、法線、邊界或多視圖傳播等證據提供。

本徵分解的實驗結果

Intrinsic Image Diffusion 在 InteriorVerse 合成測試集上對每張圖像取樣10組材質解。原文同時報告逐樣本指標的均值(Mean metric)、先對10張預測圖取均值後的指標(Mean),以及借助真值選出的最佳樣本(Best) [2]

方法與統計口徑PSNR ↑SSIM ↑LPIPS ↓FID ↓
Li 等 [5]12.31
± 3.32
0.68
± 0.11
0.52
± 0.11
77.79
Zhu 等 [6]15.92
± 3.93
0.78
± 0.09
0.34
± 0.09
46.21
逐樣本指標的均值16.14
± 3.27
0.73
± 0.10
0.26
± 0.11
均值圖像17.42
± 3.08
0.80
± 0.08
0.22
± 0.08
25.42
最佳樣本18.43
± 2.97
0.77
± 0.09
0.26
± 0.11

均值圖像的 PSNR 比逐樣本均值高1.28dB,說明隨機樣本中有一部分偏差可被平均抵消。最佳樣本又比均值圖像高1.01dB,則顯示取樣集合中確實存在更接近真值的解。這一列需要真值才能選擇,它描述候選集的上限,無法代表實際部署時的可獲得誤差。

與 Zhu 等的確定性基線相比,均值圖像的 FID 從46.21降至25.42,相對降幅約為44.99%。FID 比較的是預測集與真值集的特徵分佈;數值下降支持整體分佈更接近數據集,對某一張圖像的材質是否正確仍需逐張判斷。

IIW 中兩個場景的輸入圖像、三組反照率預測與對應 WHDR 數值
WHDR 只在人工標註的像素對上檢查相對深淺關係,對高頻細節、陰影泄漏與全局色彩的覆蓋有限。上排中 Li 等的結果取得最低 WHDR,卻保留了明顯的照明色塊;下排又出現指標次序與視覺細節不一致的情況 [7, 2]

表中的尺度不變指標、分佈指標與圖中的序關係指標分別覆蓋不同性質。一個反照率先驗需要同時檢查三者,並保留樣本間方差、飽和率以及局部邊界誤差。後續跨視角訓練中,這些量會比單一的 PSNR 或 WHDR 更直接地決定偽標籤權重。

反照率先驗的監督範圍

把二維反照率估計接入 3DGS 時,需要區分三種對象:單幀預測給出的候選解釋、跨視角共享的材質狀態、最終 RGB 渲染。它們不應被默認視為同一個真值。

條件反照率先驗的作用主要風險需要同步檢查
漫反射、曝光穩定、對應準確減少陰影對顏色參數的佔用全局尺度漂移對齊參數與跨視角殘差
彩色混合照明提供材質色的粗約束光源色泄漏到反照率陰影色度與殘差圖
鏡面或透明表面僅能作為低置信提示視角效應被固化為材質視角變化與高光掩碼
飽和或極暗區域鄰域先驗和缺失值提示不可逆信息丟失飽和率、信噪比與曝光
幾何或位姿不準輔助外觀診斷錯誤對應污染三維參數重投影誤差與遮擋一致性

二維模型給出的反照率更適合作為偽標籤,並攜帶尺度、對齊狀態、有效掩碼和置信度。若直接以固定權重監督三維外觀,單幀模型的錯誤會被寫入共享場景表示;若完全捨棄它,又失去複雜光照下有價值的材質線索。《跨視角反照率校準與質量路由》將這個問題轉化為明確的估計與決策過程:在重疊區域校準多視圖反照率,區分可校準漂移與局部失敗,並讓質量狀態控制監督進入訓練的強度。

參考文獻

  1. Garces E, Rodriguez-Pardo C, Casas D, et al.. A Survey on Intrinsic Images: Delving Deep Into Lambert and Beyond[J]. International Journal of Computer Vision, 2022, 836–868.
  2. Kocsis P, Sitzmann V, Nießner M. Intrinsic Image Diffusion for Indoor Single-View Material Estimation[C]. IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, 5198–5208.↩1 ↩2 ↩3 ↩4 ↩5
  3. Careaga C, Aksoy Y. Intrinsic Image Decomposition via Ordinal Shading[J]. ACM Transactions on Graphics, 2023, 1–24.
  4. Careaga C, Aksoy Y. Colorful Diffuse Intrinsic Image Decomposition in the Wild[J]. ACM Transactions on Graphics, 2024, 1–12.↩1 ↩2
  5. Li Z, Shafiei M, Ramamoorthi R, et al.. Inverse Rendering for Complex Indoor Scenes: Shape, Spatially-Varying Lighting and SVBRDF from a Single Image[C]. IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2020, 2472–2481.
  6. Zhu J, Luan F, Huo Y, et al.. Learning-Based Inverse Rendering of Complex Indoor Scenes with Differentiable Monte Carlo Raytracing[C]. SIGGRAPH Asia 2022 Conference Papers, 2022, 6:1–6:8.
  7. Bell S, Bala K, Snavely N. Intrinsic Images in the Wild[J]. ACM Transactions on Graphics, 2014, 159:1–159:12.
Copyright © Nishikori Yui. All rights reserved.