NY

3DGS 的多通道可微渲染與監督傳遞

弱紋理場景中的高斯表示與重建
技術筆記 神經渲染 3D Gaussian Splatting 3DGS 可微渲染 多通道渲染 深度 法線 幾何監督

《弱紋理場景中的幾何可觀測性》分析了弱紋理區域中的局部零空間:圖像梯度不足時,移動高斯引起的 RGB 變化很小,顏色、不透明度和協方差還能進一步吸收幾何擾動。這個結論限定了純光度優化能提供的幾何信息,也留下了下一段梯度鏈——深度、法線和特徵等輔助通道如何從同一組高斯得到,又如何把誤差傳回位置、尺度與旋轉。

3DGS 的 Alpha 混合並不專屬於 RGB。只要為每個高斯指定一組屬性,同一套可見性權重就能在屏幕上合成相應通道。問題的關鍵隨之轉向三個更細的環節:屬性的像素定義是否符合幾何含義,通道損失的梯度是否真正抵達幾何參數,不同來源的監督是否在當前狀態下彼此相容。

Alpha 混合的通用屬性形式

考慮像素p上按深度由近到遠排列的N個高斯。第i個高斯的有效不透明度、到達該高斯前的透射率及其混合權重分別為 [1]

αi(p)=oiGi(p),Ti(p)=j<i(1αj(p)),wi(p)=Ti(p)αi(p).

若每個高斯攜帶d維屬性aiRd,背景屬性為abg,像素通道可以統一寫成

A(p)=i=1Nwi(p)ai+TN+1(p)abg,

其中

TN+1(p)=i=1N(1αi(p)).

ai=ci得到 RGB,令ai=zi得到深度矩,令ai=ni得到法線向量和;高維的語義或外觀特徵也能以相同方式累積。光柵化器仍然執行一次投影、分塊、排序和前向遍歷,附加通道主要增加每個像素需要維護的累加量。

混合權重之和具有一個有用的閉式形式。由

wi=TiTi+1

可得

W(p)=i=1Nwi(p)=1TN+1(p).

W是前景累積不透明度,也可以看作當前高斯集合對像素的覆蓋程度。當W0時,顏色可以由背景補齊,深度和法線卻沒有可靠的前景支撐;因此,幾何通道通常需要保留W,用於歸一化、掩碼或置信度估計。

2D Gaussian Splatting 對同一場景渲染顏色、表面法線並提取網格的結果
顯式高斯圖元可以同時承載外觀和幾何屬性。圖中 2DGS 從同一組平面高斯得到顏色與法線渲染,並進一步提取網格;多通道輸出由此成為圖像重建和表面重建之間的接口 [2]

通道梯度的兩條路徑

θ包含全部高斯參數。忽略固定背景後,通用屬性通道的導數為

A(p)θ=i[aiwi(p)θ+wi(p)aiθ].

第一項經過混合權重傳遞,會改變投影位置、二維 footprint、不透明度與遮擋關係;第二項更新高斯攜帶或由高斯推導的屬性。兩條路徑是否同時存在,取決於通道的定義。

以法線為例,若ni是每個高斯獨立學習的向量,法線損失可以直接修改ni,對尺度和旋轉的影響主要經過wi間接產生。若ni由協方差的最短軸推導,ni/θ會把法線誤差直接傳給旋轉和尺度。兩種設計輸出同樣是法線圖,對幾何的約束強度卻不同。

混合權重本身也揭示了遮擋下的梯度衰減。對第k個不透明度有

wiαk={0,i<k,Tk,i=k,wi1αk,i>k.

前方高斯的αk增大時,自身貢獻增加,後方所有層的權重同時下降。對直接攜帶的屬性,還有

Aak=wkId.

遠處高斯若被前景遮擋,Tkwk都會很小;即使該位置的深度或法線誤差很大,單個視角也難以向它傳遞有效梯度。多通道渲染共享可見性,因此不能繞過遮擋,只能從其他視角、外部觀測或空間先驗補充約束。

深度通道的統計含義

把相機空間中的高斯深度記為zi。直接替換 RGB 屬性得到的是一階深度矩

M1(p)=iwi(p)zi,

它同時受表面深度和覆蓋率影響。相同平面在圖像邊緣的W較低時,M1會向零收縮,不能直接解釋為表面深度。常用的期望深度因此寫成 [2, 3]

Dmean(p)=M1(p)W(p)+ε=iwi(p)ziiwi(p)+ε.

暫時忽略ε,它對某個權重的導數為

Dmeanwk=zkDmeanW.

位於當前均值前方的高斯接收負梯度,後方高斯接收正梯度,偏離均值越遠,權重變化對期望深度的影響越大。分母中的W也說明低覆蓋像素存在放大效應:W很小時,微小權重擾動就可能令深度劇烈變化。實際監督需要對低W區域設置有效掩碼,或者讓置信度隨W連續衰減。

二階矩可以進一步描述同一光線上的深度分散程度:

M2(p)=iwi(p)zi2,σz2(p)=M2(p)W(p)+εDmean2(p).

兩個場景可能具有相近的Dmean,其中一個由窄而集中的權重峰形成,另一個由前後兩層半透明高斯共同平均得到。深度均值看不出這項差異,σz2則會直接暴露沿射線的厚度。

W>0且省略數值穩定項ε的有效像素上,考慮平方形式的兩兩深度失真項

Ldist(p)=i,jwiwj(zizj)2,

展開後可以得到

Ldist=2WM22M12=2W2σz2.

因此,深度失真正則本質上在壓縮可見權重的深度方差。2DGS 沿用 Mip-NeRF 360 的射線失真思想,使用相近的兩兩距離形式,使沿同一光線分散的圖元向較薄的表面集中 [4, 2]。這項假設適合單一不透明表面,在玻璃、植被、毛髮或真實多層結構中需要降低權重,否則會把合理的深度多峰分佈強行壓成單峰。

中值深度與可導性

期望深度容易受遠處小權重離群點影響。另一種做法是沿前向合成順序尋找累積不透明度首次越過閾值τ的位置:

k=min{k:ikwiτ},Dmedian=zk.

常見的τ=0.5對應近似的中值表面。若W<τ,該像素沒有越過閾值的有效表面,應當標記為無效或採用明確的回退規則。中值深度對少量遠處浮點更穩健,也更適合把多視圖深度融合為網格;但k是離散索引,權重尚未跨過閾值時深度不變,跨過閾值後又會突然跳到另一層。它適合幾何提取和診斷,直接作為訓練通道時通常需要平滑近似或額外處理不可導的閾值選擇。

法線通道與局部表面方向

三維高斯的協方差可寫為

Σi=Ridiag(si12,si22,si32)RiT.

當一個尺度明顯小於另外兩個尺度時,高斯接近薄橢球,其最短軸可以近似局部法線。令

mi=argminr{1,2,3}sir,ni=Riemi.

ni的符號需要相對相機或鄰域統一,因為nn描述同一個無向切平面。最短軸索引在尺度次序交換時也會發生離散跳變;當三個尺度接近時,高斯仍是體積圖元,法線方向本身就缺少穩定含義。

把相機座標系下的法線以可見性權重合成,得到

N~(p)=iwi(p)ni,N(p)=N~(p)N~(p)2+ε.

若忽略ε且令r=N~2,歸一化的雅可比為

NN~=1r(INNT).

INNT會去掉平行於當前法線的分量,反向傳播主要調整方向。若前後層法線相反,向量和可能接近零,1/r會放大數值波動;這也是法線符號、遮擋邊界掩碼和低覆蓋過濾不能省略的原因。

另一條法線來源是渲染深度。對像素齊次座標p~=(u,v,1)T,反投影點為

X(u,v)=D(u,v)K1p~.

局部切向量給出深度法線

ND(u,v)=uX×vXuX×vX2+ε.

渲染法線N來自高斯的方向與權重,深度法線ND來自鄰域深度變化。二者一致時,單個高斯的局部朝向、沿射線的表面位置和圖像鄰域中的幾何變化互相支持。常用一致性項為

Lnormal=pΩv(1N(p)TND(p)),

其中Ωv應排除低覆蓋、深度不連續和法線退化區域。深度的有限差分會把單像素噪聲傳播到相鄰法線,邊界兩側還可能屬於不同表面;不加選擇地平滑整張法線圖,會令真實折線和薄結構一同變鈍。

輸入圖像、移除法線一致性、移除深度失真以及完整模型的法線渲染對比
2DGS 的幾何正則消融。移除法線一致性(w/o. NC)後,屋頂和平面出現高頻方向噪聲;移除深度失真(w/o. DD)後,法線邊界和局部表面變得模糊。兩項約束分別處理表面朝向與沿射線厚度,作用範圍並不相同 [2]

正則項與幾何提取的定量影響

2DGS 在 DTU 上使用 Accuracy、Completion 及兩者的平均值評估重建表面,三項均為距離誤差,數值越低越好。消融實驗同時變化了訓練正則、深度統計量和網格提取方法,可以看出最終幾何誤差並非只由渲染模型決定 [2]

設置AccuracyCompletionAverage
無法線一致性1.351.131.24
無深度失真0.890.870.88
使用期望深度0.881.010.94
使用 SPSR1.250.891.07
完整模型0.790.860.83

移除法線一致性後,Average 由0.83上升到1.24,相對增幅約為

1.240.830.83×100%49.4%.

移除深度失真後,Average 增至0.88,相對增幅約為6.0%。在這組 DTU 實驗中,法線一致性對平均誤差的影響更大;這個結果依賴訓練數據的視角覆蓋、場景的局部平面結構和後續網格提取策略,不能直接推廣到透明、多層或極薄表面。

期望深度的 Average 為0.94,差於完整模型使用的中值深度。這與前面的導數分析一致:期望深度對每個權重的敏感度為(zkDmean)/W,少量遠離主表面的權重就能拉動均值;中值深度只取累積不透明度跨過閾值的主要表面,用於 TSDF 融合時對小權重浮點更穩健。SPSR 的 Average 為1.07,則說明將高斯中心和法線轉換為網格時,若未顯式利用圖元的不透明度和尺度,渲染模型中已經學到的可見性信息會在提取階段損失。

DTU Scan 24 和 Scan 105 上 3DGS、SuGaR 與 2DGS 的表面重建對比
DTU Scan 24 與 Scan 105 的表面重建結果。對比同時顯示全局網格與局部細節;2DGS 在細薄邊緣、局部平面和幾何邊界上保留了更連續的表面 [2]

因此,正則項的幾何收益需要沿完整管線解讀:訓練階段的法線一致性限制局部方向,深度失真壓縮沿射線的權重分佈,深度統計量決定來自多層高斯的信息如何被折疊,網格提取又決定這些信息如何落到最終表面。只看渲染法線或單個平均誤差,都會隱藏這幾個環節之間的誤差傳遞。

特徵通道與解碼位置

高維特徵的合成形式為

F(p)=iwi(p)fi.

它可以用於語義分類、材質預測或顏色解碼。非線性解碼器g()放在 Alpha 混合前後,會形成兩種不同的模型:

Cdecode-then-blend=iwig(fi),Cblend-then-decode=g(iwifiW+ε).

只在線性g和適當歸一化條件下,兩者才可能等價。前者在高斯層面生成屬性,遮擋關係清晰,但每個高斯都要執行解碼;後者先在像素上匯聚特徵,計算更集中,解碼結果會依賴當前視角下共同覆蓋該像素的高斯集合。模型將材質、光照或視角相關外觀放在哪一側,會改變通道的物理解釋,也會改變輔助損失能夠抵達的參數塊。

這一差別對偽監督尤其重要。若監督目標描述的是表面固有屬性,而解碼器輸入已經混合了多個深度層,遮擋邊界處的標籤誤差可能同時更新前景和背景高斯。屬性通道的名字不能保證其可解釋性,合成位置、歸一化方式和參數依賴關係才決定實際含義。

多通道監督的幾何信息

設幾何參數為g,外觀及其他屬性參數為a,第k個通道的殘差在當前狀態附近線性化為

rkrk,0+Jk,gδg+Jk,aδa.

所有通道的加權信息矩陣為

H=kλk[Jk,gTWkJk,gJk,gTWkJk,aJk,aTWkJk,gJk,aTWkJk,a].

消去屬性增量後,幾何實際獲得的約化信息仍由 Schur 補決定:

Hgeff=HggHgaHaa1Hag.

新增通道若只重複 RGB 已有的雅可比方向,或者其誤差能被獨立屬性參數完全吸收,Hgeff的最小特徵值未必明顯提高。深度傳感器、多視圖匹配和可靠法線先驗能夠提供與顏色不同的方向;單目預測、平滑項和深度失真項則通過模型假設壓縮解空間。二者都能改善數值可解性,信息來源需要分開表述:前者引入額外觀測,後者引入外部先驗或結構偏置。

這個區分還能解釋一種常見現象。將可學習法線直接擬合偽標籤時,法線圖可能很快變得平滑,位置和協方差仍然噪雜;從協方差最短軸推導法線時,同樣的誤差會更直接地限制高斯方向,卻依賴“高斯應當趨於扁平”這一額外假設。監督目標、通道參數化和幾何收益之間沒有一一對應關係。

監督衝突與權重

把各通道損失對共享參數的梯度記為

gk=θLk,

總更新為

Δθ=ηjλjgj.

對第k個損失作一階展開:

ΔLkgkTΔθ=ηλkgk22ηjkλjgkTgj.

第一項保證該損失沿自身負梯度下降,第二項描述其他通道帶來的幫助或衝突。可用梯度夾角

cosϕkj=gkTgjgk2gj2

觀察局部關係。cosϕkj>0時,兩項在當前附近相互促進;cosϕkj<0時,一項的下降方向會推高另一項。遮擋邊界處,RGB 可能希望移動高斯以修正顏色輪廓,平滑法線項卻傾向於保持鄰域方向一致;錯誤的單目深度也可能與多視圖光度證據直接衝突。

損失數值的量綱同樣會影響更新。米制深度誤差、單位法線的角度誤差和[0,1]RGB 殘差不能僅按標量大小比較。除了固定權重,還可以把空間有效性、先驗質量和時間調度分開寫成

L(t)=kpΩλksk(t)qk(p)mk(p)k(p).

λk控制通道的基礎尺度,sk(t)描述訓練階段,qk(p)表示連續置信度,mk(p)則處理遮擋、缺失值和無效區域。訓練初期幾何和可見性尚未穩定,強輔助監督可能固定錯誤對應;後期若始終保持過強平滑,又可能抹去已經形成的細節。時間權重需要針對監督可靠性變化設置,不能只把全部通道同時打開。

若某個觀測殘差r(p)的噪聲近似為方差σ2(p)的高斯分佈,其負對數似然給出

(p)=r2(p)2σ2(p)+12logσ2(p).

1/σ2自然充當置信度權重,logσ2防止通過無限增大不確定性逃避監督。傳感器誤差模型、單目預測置信度、多視圖一致性和渲染覆蓋率都可以進入σ2(p),比單一全局係數更接近各通道真實的可靠範圍。

多通道監督的適用範圍

多通道輸出既服務訓練,也服務診斷。兩種用途需要保留不同的信息:訓練通道強調可導和穩定,診斷通道還要揭示被歸一化或聚合隱藏的狀態。

通道像素量主要參數路徑需要同時檢查的量常見失效條件
RGBiwici權重、顏色與視角外觀訓練/測試視圖殘差曝光變化、鏡面反射、外觀補償
覆蓋率W=iwi不透明度與 footprint背景透射率TN+1空洞、低不透明度、邊界混合
期望深度M1/(W+ε)權重與高斯位置Wσz2低覆蓋、多層半透明、浮點
中值深度zk排序與閾值層閾值是否被越過離散跳變、薄結構、透明表面
渲染法線normalize(iwini)權重、旋轉與尺度向量和範數、符號一致性球狀高斯、相反法線抵消
深度法線normalize(uX×vX)深度及其鄰域深度梯度、遮擋邊界深度噪聲、有限差分跨表面
特徵iwifi權重與特徵參數解碼前後位置、歸一化方式多層特徵混合、語義邊界洩漏

只保存歸一化深度會丟失W,只保存法線顏色圖會丟失歸一化前的向量範數,只觀察總損失會混合各通道的量綱和啟用狀態。更完整的訓練記錄應至少保留覆蓋率、深度一二階矩、法線有效掩碼、各子項的未加權值與加權貢獻。這樣才能判斷某次指標改善來自新增幾何約束、外觀參數補償,還是監督區域本身發生了變化。

結語

多通道可微渲染建立在同一組 Alpha 權重上。顏色、深度、法線和特徵因而觀察同一個高斯集合,也共同受到投影誤差、近似排序、遮擋和覆蓋不足的影響。期望深度需要與覆蓋率和深度方差一起解釋,法線合成需要處理方向符號、歸一化和深度邊界,特徵通道還受到非線性解碼位置的影響。

輔助監督能否改善幾何,最終取決於它對幾何參數的雅可比是否提供了新的有效方向。外部深度和多視圖幾何可以增加觀測證據,單目預測、法線平滑與深度失真則引入先驗假設;兩類信息都要經過可見性權重和通道參數化才能抵達高斯。《複雜光照下的本徵圖像與反照率先驗》繼續拆開顏色通道內部的反照率、光照和視角相關外觀,並分析這些分量各自能夠吸收哪些誤差。

參考文獻

  1. Kerbl B, Kopanas G, Leimkühler T, et al.. 3D Gaussian Splatting for Real-Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 139:1–139:14.
  2. Huang B, Yu Z, Chen A, et al.. 2D Gaussian Splatting for Geometrically Accurate Radiance Fields[C]. ACM SIGGRAPH 2024 Conference Papers, 2024.↩1 ↩2 ↩3 ↩4 ↩5 ↩6
  3. Turkulainen M, Ren X, Melekhov I, et al.. DN-Splatter: Depth and Normal Priors for Gaussian Splatting and Meshing[C]. IEEE/CVF Winter Conference on Applications of Computer Vision, 2025.
  4. Barron JT, Mildenhall B, Verbin D, et al.. Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields[C]. IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022, 5470–5479.
Copyright © Nishikori Yui. All rights reserved.