NY

本徵、外觀與幾何監督的聯合優化

弱紋理場景中的高斯表示與重建
技術筆記 神經渲染 3D Gaussian Splatting 3DGS 本徵圖像 LE3D GaussianPro 聯合損失 多任務優化 梯度衝突

《複雜光照下的本徵圖像與反照率先驗》將單幅圖像分解為材質、陰影與殘差;《跨視角反照率校準與質量路由》為偽標籤選擇統一規範並估計可用性;《無球諧外觀表示與神經顏色解碼》討論材質信號通過逐高斯特徵與 Color MLP 進入渲染的路徑 [1]《傳播式增密中的候選生成與幾何門控》又在 RGB 梯度之外增加了結構候選 [2]。這些擴展仍共用 3DGS 的顯式高斯表示與可微光柵化基礎 [3]

這些模塊進入同一個訓練循環後,問題從「某個損失如何寫」變為「當多種誤差同時改變幾何、外觀和高斯集合時,殘差會被分配給誰」。加權求和只是目標函數的表面形式;實際優化還受殘差單位、有效像素數、梯度方向、參數共享範圍與離散增密調度影響。

參數、觀測與殘差空間

將場景參數分為幾何、外觀與共享解碼器三組:

θ=[θgT,θaT,θfT]T.

θg包含高斯中心、協方差與不透明度;θa包含逐高斯潛在特徵、顏色偏置或反照率代碼;θf是多個高斯共享的 Color MLP 參數。對視圖v和像素p,多通道渲染器輸出

Rv(θ)=(I^v,A^v,S^v,D^v,N^v,Wv).

I^是最終顏色,A^S^分別表示反照率與陰影/調制分支,D^N^提供幾何觀測,W表示當前高斯對像素的前景解釋程度。同一個渲染結果可以生成多組殘差,但這些殘差不共享同一種統計含義。

圖像、本徵與幾何項

圖像保真項維持對真實觀測的擬合:

Lrgb=(1λs)I^I1+λsLD-SSIM.

反照率偽標籤Av在進入損失前已經做過跨視角校準,仍然只有局部可靠。記場景級質量為qv,像素級不確定性為uv(p),有效掩碼為mv(p),可定義

ωv(p)=qvmv(p)exp(uv(p)τu),LA=pωv(p)ρA(A^v(p)Av(p))pωv(p)+ε.

分母使損失不會因「這一幀只有少量可用像素」而系統性變小。ρA採用 Charbonnier 或 Huber 函數時,局部偽標籤失敗不會產生無界梯度。

幾何項可以包含深度分佈集中、渲染法線與深度法線一致,以及局部平面性 [4, 5]。用wi(p)表示射線上第i個高斯的 Alpha 混合權重,歸一化權重為

w~i(p)=wi(p)jwj(p)+ε.

沿射線的深度方差為

VD(p)=iw~i(ziz)2,z=iw~izi.

深度分佈正則可寫成

Rdist=pmg(p)VD(p)pmg(p)+ε,

其中mg應排除半透明物體、深度不連續邊界與前景解釋權重過低的像素。法線一致項為

Rnormal=pmg(p)[1N^(p)TND(p)]pmg(p)+ε.

ND由深度反投影後的局部切向叉積得到。當深度本身帶有噪聲,ND也會把高頻差分放大,因此它更適合與圖像邊緣權重和置信掩碼一起使用。

2DGS 在去除法線一致性、去除深度畸變正則和完整模型下的表面法線對比
從左至右為輸入圖像、去除法線一致項、去除深度畸變項,以及兩項都保留的結果。法線一致性壓低局部方向噪聲,深度分佈正則限制沿射線的多層模糊;完整模型的平面更連續,同時也提示這些損失存在過度平滑風險 [4]

多任務目標與有效觀測

將各項放在一起,可以寫出一個通用的聯合目標:

L(θ,t)=λrgbLrgb+ηA(t)λALA+ηg(t)(λdRdist+λnRnormal+λpRplane)+ηs(t)(λidRid+λsmRshading).

ηA(t)ηg(t)ηs(t)同時包含時間調度與數據可用性門控。當偽反照率不可用時,ηA=0;當像素處於深度邊界或前景覆蓋不足時,它不進入幾何項的有效集;當反照率分支缺少監督時,陰影恶性震蕩或任意分解的風險才需要RidRshading

用有效集改寫損失比「所有項永遠開啟,再慢慢調小權重」更清楚。權重表示可靠觀測之間的相對強度,門控則回答某個觀測是否屬於當前目標的定義域。

殘差尺度與歸一化

令第k項損失是nk個有效殘差的平均:

Lk=1nkj=1nkρk(rkj).

即使各項都輸出一個標量,它們的數值範圍仍然受殘差單位與魯棒函數影響。RGBL1的單位是顏色值,法線項是無量綱角度,深度方差又隨場景尺度的平方變化。若世界座標整體縮放s

DsD,VDs2VD.

固定λd會讓同一個配置在不同場景尺度下實際強度不同。可以使用相對深度、以場景中位深度D~歸一化,或將深度分佈項寫為

VD=VDz2+ε.

歸一化還要覆蓋像素數。若一項按全圖求平均,另一項只對弱紋理掩碼求和,後者的有效面積會直接改變損失強度。因此,每項損失都應明確寫出「對誰求和」和「用什麼歸一化」。

梯度對齊與衝突

對共享參數子集θs,第a與第b項損失的梯度為

ga=θsLa,gb=θsLb.

它們的餘弦相似度為

ρab=gaTgbga2gb2+ε.

ρab>0時,兩項在當前局部共同降低;ρab<0時,某一項的下降方向會升高另一項。對反照率監督與 RGB 監督,衝突常出現在陰影、高光和曝光截斷區域;對圖像監督與平面幾何正則,衝突常出現在真實小結構與遮擋邊界。

若只查看損失數值,「反照率損失很小」並不代表它沒有主導某些參數。參數梯度還會經過解碼器雅可比、Alpha 混合權重與投影雅可比放大或縮小。實驗記錄中至少應分別統計幾何參數、逐高斯外觀參數和共享 MLP 的梯度范數。

外觀—幾何消元

將局部殘差線性化為

rr0+Jgδθg+Jaδθa.

對應的 Gauss–Newton 矩陣為

H=[HggHgaHagHaa]=[JgTJgJgTJaJaTJgJaTJa].

消去外觀增量後,幾何的有效信息矩陣為

Hga=HggHga(Haa+λaI)1Hag.

當 Color MLP、逐高斯特徵與顏色偏置具有很強的殘差吸收能力,Haa的可用方向增加,消元項會減少留給幾何的曲率。Intrinsic 反照率監督和陰影正則可以限制外觀自由度,傳播式增密又為幾何增加新基底;這些模塊的作用不只體現在各自的損失值,還會改變其他殘差可以沿哪些參數方向下降。

LE3D 完整模型、移除近遠深度正則和移除深度分佈正則後的深度對比
LE3D 的深度正則消融。完整模型中,渲染深度 $d$ 與近、遠深度 $d^{\mathrm N}$、$d^{\mathrm F}$ 基本重合;移除近遠約束 $\mathcal R_{nf}$ 後,三種深度在弱觀測區域分離;繼續移除分佈正則 $\mathcal R_{dist}$ 時,玻璃與高亮附近的深度異常進一步擴散 [1]

不確定性加權

以同方差不確定性為例,多任務損失可寫成 [6]

L=k(12σk2Lk+logσk).

學習到的σk會降低噪聲較大任務的權重,logσk防止所有權重縮到零。這個形式需要殘差對應明確的似然模型。本徵偽標籤中的結構性偏差、幾何邊界上的非高斯誤差,以及根本不可用的標籤,都不能只靠一個全局σk解決。質量路由與像素掩碼仍然需要先定義有效集。

GradNorm 類方法會根據各任務梯度范數和相對訓練速度調整權重 [7]。它能緩解「某一項因單位較大長期壓過其他項」,但梯度范數相等不代表方向相容。對gaTgb<0的任務,PCGrad 類投影可寫成 [8]

ga=gagaTgbgb22+εgb.

投影後ga不再包含反對gb的分量。在 3DGS 中,不建議對所有參數盲目做全局梯度手術:本徵項本來就應更直接影響外觀分支,法線項本來就應主要更新幾何。更有解釋性的做法是先限定各損失的參數作用域,再在真正共享的子空間中診斷衝突。

參數作用域

用 stop-gradient 或分組優化器可以把監督語義轉化為明確的梯度邊界。一個可用的參數—損失關係如下:

損失主要更新謹慎更新通常阻斷
RGB 保真幾何、不透明度、外觀特徵、Color MLP結構增密統計
反照率偽監督反照率/外觀特徵、解碼分支高斯幾何顏色偏置的任意補償通道
深度分佈中心、尺度、不透明度外觀特徵Color MLP
法線/平面旋轉、尺度、中心不透明度外觀解碼
陰影恲等/平滑陰影分支共享外觀特徵幾何

反照率項是否應更新幾何沒有固定答案。若偽標籤已做好對齊且邊界可靠,其梯度可以幫助幾何邊界;若偽標籤來自單幅二維模型並含有結構偏差,允許它直接拉動高斯中心會把二維幻覺固化成三維結構。可以用較小幾何學習率、延遲啟用,或只在多視圖一致區域放行這條梯度。

分階段調度

聯合目標在不同訓練階段的信任基礎不同。幾何未形成時,渲染反照率、深度和法線都只是初始化狀態的投影;訓練後期仍持續高頻增密,又會讓每次新增高斯重新擾動已穩定的外觀分解。一個通用調度可分為:

  1. 表示熱身:以 RGB 保真建立可渲染的主要結構,反照率只做質量統計,幾何正則使用小權重。
  2. 幾何形成:啟用深度分佈、法線一致與傳播式候選,並記錄候選接受率、剪枝率與高斯數量。
  3. 外觀解耦:當基礎結構可靠後,依質量權重漸進啟用反照率監督,避免早期偽標籤將錯誤邊界寫入幾何。
  4. 結構冷卻:停止或大幅降低增密頻率,讓已有高斯的幾何與外觀參數在固定結構上收斂。

漸進因子可以用平滑階躍表示。以反照率項為例,

ηA(t)=qvsmoothstep(ttAΔtA).

tA是啟用中心,ΔtA決定渡越寬度。直接從0切換到固定大權重,會讓 Adam 的一階與二階動量同時面對殘差分佈突變,平滑啟用能夠降低這種瞬時震蕩。

訓練過程的梯度監測

單獨記錄總損失無法分辨「某項已收斂」與「某項已被其他參數屏蔽」。訓練日誌中更有用的診斷量包括:

診斷量對應問題
各項歸一化損失和有效像素數數值變化來自誤差還是掩碼面積
幾何、外觀、MLP 的分組梯度范數哪組參數正在吸收當前殘差
主要損失之間的梯度餘弦值當前是協同更新還是相互抵消
反照率質量權重分佈偽監督是否只由少量幀主導
候選數、接受率、新增與剪枝高斯數結構改變來自哪個階段
深度方差與法線誤差的掩碼內/外統計幾何收益是局部還是全局

聯合損失的價值不在於把更多項加到一行公式中。Intrinsic 把外觀殘差分配到材質與陰影語義,LE3D 式解碼器決定這些語義通過哪些參數表達,GaussianPro 式傳播在圖像梯度不足時提出新幾何,而深度與法線正則限制新舊圖元如何組成表面。只有將數據有效性、參數作用域、梯度尺度和結構調度同時寫清,這些模塊才能形成可診斷的優化管線。

《重建指標、消融證據與結論邊界》以測試視圖的配對統計、局部幾何、消融交互和計算預算整理這些變化的評價方式。

參考文獻

  1. Jin X, Jiao P, Duan ZP, et al.. Lighting Every Darkness with 3DGS: Fast Training and Real-Time Rendering for HDR View Synthesis[C]. Advances in Neural Information Processing Systems, 2024, 80191–80219.↩1 ↩2
  2. Cheng K, Long X, Yang K, et al.. GaussianPro: 3D Gaussian Splatting with Progressive Propagation[C]. Proceedings of the International Conference on Machine Learning, 2024, 8123–8140.
  3. Kerbl B, Kopanas G, Leimkühler T, et al.. 3D Gaussian Splatting for Real-Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 139:1–139:14.
  4. Huang B, Yu Z, Chen A, et al.. 2D Gaussian Splatting for Geometrically Accurate Radiance Fields[C]. ACM SIGGRAPH 2024 Conference Papers, 2024, 1–11.↩1 ↩2
  5. Turkulainen M, Ren X, Melekhov I, et al.. DN-Splatter: Depth and Normal Priors for Gaussian Splatting and Meshing[C]. Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, 2025, 2421–2431.
  6. Kendall A, Gal Y, Cipolla R. Multi-Task Learning Using Uncertainty to Weigh Losses for Scene Geometry and Semantics[C]. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, 7482–7491.
  7. Chen Z, Badrinarayanan V, Lee CY, et al.. GradNorm: Gradient Normalization for Adaptive Loss Balancing in Deep Multitask Networks[C]. Proceedings of the International Conference on Machine Learning, 2018, 794–803.
  8. Yu T, Kumar S, Gupta A, et al.. Gradient Surgery for Multi-Task Learning[C]. Advances in Neural Information Processing Systems, 2020, 5824–5836.
Copyright © Nishikori Yui. All rights reserved.