NY

無球諧外觀表示與神經顏色解碼

弱紋理場景中的高斯表示與重建
技術筆記 神經渲染 3D Gaussian Splatting 3DGS 球諧函數 Color MLP 外觀表示 神經渲染

反照率偽標籤經過跨視角校準和質量路由後,仍需通過具體的外觀參數化進入 3DGS。球諧係數、逐高斯潛在特徵和共享顏色網絡都能生成視角相關顏色,卻具有不同的參數共享範圍、頻率偏置與梯度路徑。除了最終 RGB 的表達能力,外觀參數化還決定圖像誤差由哪些參數吸收,以及有多少梯度能繼續修正高斯幾何。

球諧顏色的解析結構

3DGS 為第i個高斯保存球諧(Spherical Harmonics,SH)係數,用觀察方向dS2解碼顏色 [1]。對顏色通道c,階數為L的展開為

ci,c(d)=l=0Lm=llki,c,lmYlm(d).

yL(d)=[Y00(d)Y11(d)YLL(d)]T,

則三通道顏色可以緊湊寫成

ci(d)=KiyL(d),KiR3×(L+1)2.

固定方向後,顏色對係數是線性的:

civec(Ki)=yLT(d)I3.

這一結構帶來穩定而便宜的前向計算,也使每個高斯的外觀參數相互獨立。L=0只有常量顏色;增加階數後,基函數數量按(L+1)2增長。3DGS 常逐步啟用更高階球諧,使優化先建立近似漫反射基色,再學習視角相關分量。

球諧函數是定義在完整球面上的正交基,但訓練相機只覆蓋有限方向集合{dv}。對單個高斯,把這些方向上的基向量堆疊成

Yi=[yLT(d1)yLT(dM)].

可辨識的係數方向由rank(Yi)決定。若高斯僅從很窄的視角範圍可見,某些高階基在採樣方向上近似相關,YiTYi會病態。訓練視圖顏色可以擬合得很好,未觀測方向卻可能出現振盪或顏色突變。解析基的正交性只在連續完整球面積分下成立,不保證有限相機採樣下的數值正交。

共享神經解碼器的參數組織

無球諧表示通常讓每個高斯保存低維潛在特徵fiRD與可選顏色偏置bi,再由共享網絡Fϕ根據特徵和視角生成顏色:

ci(d)=g(Fϕ(fi,γ(d))+bi).

γ是方向編碼,g決定輸出域。LDR 顏色可以使用 sigmoid 或有界映射;在線性 HDR 域中,上界會截斷亮度,LE3D 使用指數輸出

ci=exp(Fϕ(fi,v)+bi),

並用多視圖投影顏色的對數均值初始化偏置,使初始輸出接近觀測亮度 [2]

LE3D 從噪聲 RAW 圖像初始化高斯並用逐高斯特徵、視角和偏置輸入 Color MLP 的管線
LE3D 用逐高斯特徵 $f_i$、視角 $v$ 和顏色偏置 $b_i$ 生成線性 RAW 顏色,幾何、不透明度與外觀特徵仍由同一組高斯承載。圖中同時包含該工作的初始化和幾何正則模塊;這裏關注中部的 Color MLP 顏色路徑 [2]

共享網絡把外觀先驗從“每個高斯獨立的一組解析係數”改為“每個高斯代碼與全局解碼函數”。其參數量近似為

PMLP=ND+Nb+Pϕ,

球諧參數量則為

PSH=3N(L+1)2.

N很大且D<3(L+1)2時,潛在代碼可以降低逐高斯存儲;但共享網絡的計算成本、緩存訪問和批處理方式會進入渲染開銷。參數更少也不等於表達更弱:Fϕ在全部高斯之間共享統計規律,能夠用非線性組合複用容量。

解碼與 Alpha 混合的次序

“先解碼再混合”和“先混合再解碼”經常都被稱為顏色 MLP,二者在非線性網絡下並不等價。

逐高斯解碼先得到

ci=F(fi,di),

再執行 Alpha 混合:

Cpre(p)=iwi(p)ci.

像素級解碼先聚合特徵

f(p)=iwi(p)fiW(p)+ϵ,W(p)=iwi(p),

再生成顏色:

Cpost(p)=F(f(p),dp).

F對特徵是仿射函數,且權重已歸一化,則兩者可以相等。對一般非線性網絡,令

w~i=wiW,f=iw~ifi,

f附近作二階展開:

F(fi)F(f)+JF(fif)+12(fif)THF(fif).

w~i求和後,一階項消失:

iw~iF(fi)F(f)12iw~i(fif)THF(fif).

差異由特徵在射線上的方差和網絡曲率共同決定。單一表面、權重高度集中時,兩者接近;遮擋邊界、半透明區域或多層高斯混合時,像素級解碼會先把不同表面的特徵混在一起,可能生成任何一個高斯都沒有的顏色。逐高斯解碼保持圖元語義,代價是對每個可見高斯執行網絡或查表。

視角方向的導數

球諧顏色的方向導數為

cid=KiyL(d)d.

最高階數限制了方向頻率,也使導數具有明確的解析結構。神經解碼器則有

cid=JoutFϕγγ(d)d.

若方向編碼包含高頻正餘弦,γ/d會隨頻率增大;網絡能夠表示更尖銳的視角變化,也更容易在訓練方向之間出現高頻振盪。對鏡面高光這可能是必要容量,對漫反射牆面則可能成為記憶相機方向的捷徑。

方向本身由相機中心ov與高斯位置μi決定:

div=μiovμiov2.

r=μiov2,則

divμi=1r(I3divdivT).

因此,顏色對位置還存在一條經過觀察方向的路徑:

ciμi=cidivdivμi.

當神經外觀對方向非常敏感時,移動高斯不僅改變投影權重,也會顯著改變解碼顏色。幾何梯度由此混入外觀方向導數,位置更新更難單獨解釋為投影對齊。

外觀容量與幾何補償

設所有像素殘差堆疊為

r=Irender(θg,θa)Igt,

θg是幾何參數,θa是外觀參數。局部線性化得到

r(Δθg,Δθa)r0+JgΔθg+JaΔθa.

消去外觀增量後的幾何正規矩陣為

Hga=JgT[IJa(JaTJa+λaI)1JaT]Jg.

中括號把可以由外觀子空間解釋的殘差方向投影出去。col(Ja)越大,落到幾何上的有效信息越少。增加 MLP 寬度、潛在特徵維度或方向編碼頻率,可能提高訓練圖像擬合,同時降低某些幾何方向的條件數。外觀容量與幾何質量之間不存在單調關係。

一個更直觀的標量例子是帶顏色斜率的邊緣。設投影位置誤差為δu,圖像梯度為Iu,外觀偏置為δb,殘差近似為

rIuδu+δb.

δb可自由調整,則取δb=Iuδu可以完全抵消位置誤差。給偏置加入λbδb2後,消去δb得到位置方向的有效曲率

Hub=Iu2λb1+lambdab.

λb0時,幾何曲率趨近於零;強約束外觀後,位置才重新受到圖像證據約束。這個推導解釋了為何獨立顏色偏置既能加速初期擬合,也可能在弱紋理區域長期掩蓋幾何偏移。

LE3D 對初始化、Color MLP 和幾何正則的消融結果,包括訓練早期使用和不使用 Color MLP 的顏色差異
LE3D 的消融把顏色表示與幾何結果放在同一組對比中:去除 Color MLP 後,線性 RAW 顏色在訓練早期出現明顯異常,相關結構結果也發生變化;同時,初始化與幾何正則仍各自影響深度。該結果說明外觀路徑會參與幾何優化,但不能據此把全部幾何改善歸因於解碼器 [2]

反照率與陰影分支的規範

若神經解碼器輸出反照率與陰影

Ai=σ(FA(fi,d)),Si=gS(FS(fi,d)),

並組合為

ci=AiSi+mathbfbi,

則本徵分解的尺度自由度直接進入三維外觀表示。對正數k

(Ai,Si)(kAi,Sik)

保持顏色不變;若還有自由偏置bi,加性誤差也能被第三條路徑吸收。僅用 RGB 重建損失無法讓分支獲得穩定語義。

跨視角反照率偽監督為A選擇規範,陰影正則限制S的空間與時間變化,偏置容量則應保持受控。聯合目標可以寫成

L=Lrgb+wALA+λSRS+λbRb.

如果wA=0,反照率與陰影的變量名不保證任何分解;如果wA過大且偽標籤有偏,錯誤材質會反向污染共享特徵。第 6 篇中的質量路由恰好控制這一入口。

對像素級特徵解碼,還需決定反照率偽標籤監督的是

FA(iw~ifi)

還是

iw~iFA(fi).

兩者的差異仍由網絡曲率和射線特徵方差決定。在遮擋邊界處,前者容易把前後表面的材質代碼混合,後者更接近可見圖元的反照率合成;但後者計算更重,並要求每個圖元分支具有明確含義。

初始化、複製與分裂

神經顏色表示引入了新的結構演化問題。高斯複製或分裂時,子高斯通常繼承父高斯的fibi。這樣能保持渲染連續,但兩個子高斯初始外觀完全相同。若後續可見視角也相似,它們可能長期無法分化。

設兩個子高斯特徵為

fi1=fi+ϵ,fi2=fiϵ.

對稱小擾動可打破完全相同的狀態,但ϵ過大會在緻密化瞬間造成顏色閃爍。另一種方式是複製特徵而改變幾何,讓可見性差異自然產生不同梯度。選擇取決於解碼器是否容易出現特徵塌縮,以及渲染連續性要求。

偏置初始化同樣影響優化。若使用觀測顏色均值初始化bi,網絡殘差從接近零開始,能夠快速得到合理圖像;但觀測均值包含陰影和曝光,偏置可能先佔據本應由反照率或陰影分支解釋的成分。初始化提供的是優化起點,不應被當作材質估計。

解析基與神經解碼的取捨

維度球諧顏色逐高斯神經解碼像素級特徵解碼
參數共享每個高斯獨立係數逐高斯代碼 + 全局網絡逐高斯代碼 + 全局網絡
方向頻率由階數明確限制由編碼和網絡容量決定由編碼和網絡容量決定
混合次序解碼後混合解碼後混合混合後解碼
多層邊界線性顏色組合非線性顏色的線性組合潛在特徵先發生混合
渲染成本低且規則與可見高斯數相關與像素數相關
外觀捷徑高階係數擬合視角特徵、偏置和網絡共同補償混合特徵與網絡共同補償
可解釋性基函數頻率明確潛在維度缺少直接語義像素輸出更難回到單個高斯

球諧適合受限頻率的視角相關外觀,計算路徑簡單;神經解碼適合線性 HDR、複雜相機響應或需要顯式反照率/陰影接口的場景。選擇外觀模型時,至少要同時報告訓練視圖擬合、新視角穩定性、方向導數、幾何指標與運行開銷。只比較 PSNR 會把外觀容量和幾何質量混為一個結論。

無球諧表示的真正變化不在於刪除一組係數,而在於重新分配場景級與圖元級參數。共享網絡可以建立跨高斯外觀先驗,潛在代碼可以提供更靈活的輸入,反照率分支也能接收經過路由的偽監督;相應代價是非線性混合、規範自由度和更大的外觀捷徑空間。《傳播式增密中的候選生成與幾何門控》將局部 RGB 梯度不足時的結構增長問題獨立展開,並保留這條外觀消元視角。

參考文獻

  1. Kerbl B, Kopanas G, Leimkühler T, et al.. 3D Gaussian Splatting for Real-Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 139:1–139:14.
  2. Jin X, Jiao P, Duan ZP, et al.. Lighting Every Darkness with 3DGS: Fast Training and Real-Time Rendering for HDR View Synthesis[C]. Advances in Neural Information Processing Systems, 2024, 80191–80219.↩1 ↩2 ↩3
Copyright © Nishikori Yui. All rights reserved.