反照率偽標籤經過跨視角校準和質量路由後,仍需通過具體的外觀參數化進入 3DGS。球諧係數、逐高斯潛在特徵和共享顏色網絡都能生成視角相關顏色,卻具有不同的參數共享範圍、頻率偏置與梯度路徑。除了最終 RGB 的表達能力,外觀參數化還決定圖像誤差由哪些參數吸收,以及有多少梯度能繼續修正高斯幾何。
球諧顏色的解析結構 3DGS 為第i 個高斯保存球諧(Spherical Harmonics,SH)係數,用觀察方向d ∈ S 2 解碼顏色 [1 ] 。對顏色通道c ,階數為L 的展開為
c i , c ( d ) = ∑ l = 0 L ∑ m = − l l k i , c , l m Y l m ( d ) . 令
y L ( d ) = [ Y 0 0 ( d ) Y 1 − 1 ( d ) ⋯ Y L L ( d ) ] T , 則三通道顏色可以緊湊寫成
c i ( d ) = K i y L ( d ) , K i ∈ R 3 × ( L + 1 ) 2 . 固定方向後,顏色對係數是線性的:
∂ c i ∂ vec ( K i ) = y L T ( d ) ⊗ I 3 . 這一結構帶來穩定而便宜的前向計算,也使每個高斯的外觀參數相互獨立。L = 0 只有常量顏色;增加階數後,基函數數量按( L + 1 ) 2 增長。3DGS 常逐步啟用更高階球諧,使優化先建立近似漫反射基色,再學習視角相關分量。
球諧函數是定義在完整球面上的正交基,但訓練相機只覆蓋有限方向集合{ d v } 。對單個高斯,把這些方向上的基向量堆疊成
Y i = [ y L T ( d 1 ) ⋮ y L T ( d M ) ] . 可辨識的係數方向由rank ( Y i ) 決定。若高斯僅從很窄的視角範圍可見,某些高階基在採樣方向上近似相關,Y i T Y i 會病態。訓練視圖顏色可以擬合得很好,未觀測方向卻可能出現振盪或顏色突變。解析基的正交性只在連續完整球面積分下成立,不保證有限相機採樣下的數值正交。
共享神經解碼器的參數組織 無球諧表示通常讓每個高斯保存低維潛在特徵f i ∈ R D 與可選顏色偏置b i ,再由共享網絡F ϕ 根據特徵和視角生成顏色:
c i ( d ) = g ( F ϕ ( f i , γ ( d ) ) + b i ) . γ 是方向編碼,g 決定輸出域。LDR 顏色可以使用 sigmoid 或有界映射;在線性 HDR 域中,上界會截斷亮度,LE3D 使用指數輸出
c i = exp ( F ϕ ( f i , v ) + b i ) , 並用多視圖投影顏色的對數均值初始化偏置,使初始輸出接近觀測亮度 [2 ] 。
LE3D 用逐高斯特徵 $f_i$、視角 $v$ 和顏色偏置 $b_i$ 生成線性 RAW 顏色,幾何、不透明度與外觀特徵仍由同一組高斯承載。圖中同時包含該工作的初始化和幾何正則模塊;這裏關注中部的 Color MLP 顏色路徑 [2 ] 。 共享網絡把外觀先驗從“每個高斯獨立的一組解析係數”改為“每個高斯代碼與全局解碼函數”。其參數量近似為
P MLP = N D + N b + P ϕ , 球諧參數量則為
P SH = 3 N ( L + 1 ) 2 . 當N 很大且D < 3 ( L + 1 ) 2 時,潛在代碼可以降低逐高斯存儲;但共享網絡的計算成本、緩存訪問和批處理方式會進入渲染開銷。參數更少也不等於表達更弱:F ϕ 在全部高斯之間共享統計規律,能夠用非線性組合複用容量。
解碼與 Alpha 混合的次序 “先解碼再混合”和“先混合再解碼”經常都被稱為顏色 MLP,二者在非線性網絡下並不等價。
逐高斯解碼先得到
c i = F ( f i , d i ) , 再執行 Alpha 混合:
C pre ( p ) = ∑ i w i ( p ) c i . 像素級解碼先聚合特徵
f ― ( p ) = ∑ i w i ( p ) f i W ( p ) + ϵ , W ( p ) = ∑ i w i ( p ) , 再生成顏色:
C post ( p ) = F ( f ― ( p ) , d p ) . 若F 對特徵是仿射函數,且權重已歸一化,則兩者可以相等。對一般非線性網絡,令
w ~ i = w i W , f ― = ∑ i w ~ i f i , 在f ― 附近作二階展開:
F ( f i ) ≈ F ( f ― ) + J F ( f i − f ― ) + 1 2 ( f i − f ― ) T H F ( f i − f ― ) . 按w ~ i 求和後,一階項消失:
∑ i w ~ i F ( f i ) − F ( f ― ) ≈ 1 2 ∑ i w ~ i ( f i − f ― ) T H F ( f i − f ― ) . 差異由特徵在射線上的方差和網絡曲率共同決定。單一表面、權重高度集中時,兩者接近;遮擋邊界、半透明區域或多層高斯混合時,像素級解碼會先把不同表面的特徵混在一起,可能生成任何一個高斯都沒有的顏色。逐高斯解碼保持圖元語義,代價是對每個可見高斯執行網絡或查表。
視角方向的導數 球諧顏色的方向導數為
∂ c i ∂ d = K i ∂ y L ( d ) ∂ d . 最高階數限制了方向頻率,也使導數具有明確的解析結構。神經解碼器則有
∂ c i ∂ d = J out ∂ F ϕ ∂ γ ∂ γ ( d ) ∂ d . 若方向編碼包含高頻正餘弦,∂ γ / ∂ d 會隨頻率增大;網絡能夠表示更尖銳的視角變化,也更容易在訓練方向之間出現高頻振盪。對鏡面高光這可能是必要容量,對漫反射牆面則可能成為記憶相機方向的捷徑。
方向本身由相機中心o v 與高斯位置μ i 決定:
d i v = μ i − o v ∥ μ i − o v ∥ 2 . 令r = ∥ μ i − o v ∥ 2 ,則
∂ d i v ∂ μ i = 1 r ( I 3 − d i v d i v T ) . 因此,顏色對位置還存在一條經過觀察方向的路徑:
∂ c i ∂ μ i = ∂ c i ∂ d i v ∂ d i v ∂ μ i . 當神經外觀對方向非常敏感時,移動高斯不僅改變投影權重,也會顯著改變解碼顏色。幾何梯度由此混入外觀方向導數,位置更新更難單獨解釋為投影對齊。
外觀容量與幾何補償 設所有像素殘差堆疊為
r = I render ( θ g , θ a ) − I gt , θ g 是幾何參數,θ a 是外觀參數。局部線性化得到
r ( Δ θ g , Δ θ a ) ≈ r 0 + J g Δ θ g + J a Δ θ a . 消去外觀增量後的幾何正規矩陣為
H g ∣ a = J g T [ I − J a ( J a T J a + λ a I ) − 1 J a T ] J g . 中括號把可以由外觀子空間解釋的殘差方向投影出去。col ( J a ) 越大,落到幾何上的有效信息越少。增加 MLP 寬度、潛在特徵維度或方向編碼頻率,可能提高訓練圖像擬合,同時降低某些幾何方向的條件數。外觀容量與幾何質量之間不存在單調關係。
一個更直觀的標量例子是帶顏色斜率的邊緣。設投影位置誤差為δ u ,圖像梯度為I u ,外觀偏置為δ b ,殘差近似為
r ≈ I u δ u + δ b . 若δ b 可自由調整,則取δ b = − I u δ u 可以完全抵消位置誤差。給偏置加入λ b δ b 2 後,消去δ b 得到位置方向的有效曲率
H u ∣ b = I u 2 λ b 1 + l a m b d a b . λ b → 0 時,幾何曲率趨近於零;強約束外觀後,位置才重新受到圖像證據約束。這個推導解釋了為何獨立顏色偏置既能加速初期擬合,也可能在弱紋理區域長期掩蓋幾何偏移。
LE3D 的消融把顏色表示與幾何結果放在同一組對比中:去除 Color MLP 後,線性 RAW 顏色在訓練早期出現明顯異常,相關結構結果也發生變化;同時,初始化與幾何正則仍各自影響深度。該結果說明外觀路徑會參與幾何優化,但不能據此把全部幾何改善歸因於解碼器 [2 ] 。 反照率與陰影分支的規範 若神經解碼器輸出反照率與陰影
A i = σ ( F A ( f i , d ) ) , S i = g S ( F S ( f i , d ) ) , 並組合為
c i = A i ⊙ S i + m a t h b f b i , 則本徵分解的尺度自由度直接進入三維外觀表示。對正數k ,
( A i , S i ) ↦ ( k ⊙ A i , S i ⊘ k ) 保持顏色不變;若還有自由偏置b i ,加性誤差也能被第三條路徑吸收。僅用 RGB 重建損失無法讓分支獲得穩定語義。
跨視角反照率偽監督為A 選擇規範,陰影正則限制S 的空間與時間變化,偏置容量則應保持受控。聯合目標可以寫成
L = L rgb + w A L A + λ S R S + λ b R b . 如果w A = 0 ,反照率與陰影的變量名不保證任何分解;如果w A 過大且偽標籤有偏,錯誤材質會反向污染共享特徵。第 6 篇中的質量路由恰好控制這一入口。
對像素級特徵解碼,還需決定反照率偽標籤監督的是
F A ( ∑ i w ~ i f i ) 還是
∑ i w ~ i F A ( f i ) . 兩者的差異仍由網絡曲率和射線特徵方差決定。在遮擋邊界處,前者容易把前後表面的材質代碼混合,後者更接近可見圖元的反照率合成;但後者計算更重,並要求每個圖元分支具有明確含義。
初始化、複製與分裂 神經顏色表示引入了新的結構演化問題。高斯複製或分裂時,子高斯通常繼承父高斯的f i 與b i 。這樣能保持渲染連續,但兩個子高斯初始外觀完全相同。若後續可見視角也相似,它們可能長期無法分化。
設兩個子高斯特徵為
f i 1 = f i + ϵ , f i 2 = f i − ϵ . 對稱小擾動可打破完全相同的狀態,但ϵ 過大會在緻密化瞬間造成顏色閃爍。另一種方式是複製特徵而改變幾何,讓可見性差異自然產生不同梯度。選擇取決於解碼器是否容易出現特徵塌縮,以及渲染連續性要求。
偏置初始化同樣影響優化。若使用觀測顏色均值初始化b i ,網絡殘差從接近零開始,能夠快速得到合理圖像;但觀測均值包含陰影和曝光,偏置可能先佔據本應由反照率或陰影分支解釋的成分。初始化提供的是優化起點,不應被當作材質估計。
解析基與神經解碼的取捨 維度 球諧顏色 逐高斯神經解碼 像素級特徵解碼 參數共享 每個高斯獨立係數 逐高斯代碼 + 全局網絡 逐高斯代碼 + 全局網絡 方向頻率 由階數明確限制 由編碼和網絡容量決定 由編碼和網絡容量決定 混合次序 解碼後混合 解碼後混合 混合後解碼 多層邊界 線性顏色組合 非線性顏色的線性組合 潛在特徵先發生混合 渲染成本 低且規則 與可見高斯數相關 與像素數相關 外觀捷徑 高階係數擬合視角 特徵、偏置和網絡共同補償 混合特徵與網絡共同補償 可解釋性 基函數頻率明確 潛在維度缺少直接語義 像素輸出更難回到單個高斯
球諧適合受限頻率的視角相關外觀,計算路徑簡單;神經解碼適合線性 HDR、複雜相機響應或需要顯式反照率/陰影接口的場景。選擇外觀模型時,至少要同時報告訓練視圖擬合、新視角穩定性、方向導數、幾何指標與運行開銷。只比較 PSNR 會把外觀容量和幾何質量混為一個結論。
無球諧表示的真正變化不在於刪除一組係數,而在於重新分配場景級與圖元級參數。共享網絡可以建立跨高斯外觀先驗,潛在代碼可以提供更靈活的輸入,反照率分支也能接收經過路由的偽監督;相應代價是非線性混合、規範自由度和更大的外觀捷徑空間。《傳播式增密中的候選生成與幾何門控》 將局部 RGB 梯度不足時的結構增長問題獨立展開,並保留這條外觀消元視角。
參考文獻 Kerbl B, Kopanas G, Leimkühler T, et al.. 3D Gaussian Splatting for Real-Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 139:1–139:14. ↩ Jin X, Jiao P, Duan ZP, et al.. Lighting Every Darkness with 3DGS: Fast Training and Real-Time Rendering for HDR View Synthesis[C]. Advances in Neural Information Processing Systems, 2024, 80191–80219. ↩1 ↩2 ↩3