渲染損失的反向傳播 #
《3DGS 的表示、渲染與優化》將場景表示、投影、Alpha 混合和密度控制串成了完整管線。渲染器給定相機
訓練還需要把渲染圖像與真實圖像
其中
這條梯度鏈也劃分了兩種不同角色:訓練目標參與參數更新,重建指標在留出視角上描述最終結果。二者可以共享相似的數學形式,使用時的統計範圍和解釋方式卻不同。
L1:逐像素殘差的直接尺度 #
把顏色通道和像素位置統一編號為
平均 L1 損失為
除
因此,大殘差像素不會像 L2 那樣獲得與誤差幅值成正比的更大梯度。少量高亮、遮擋錯配或曝光異常像素對整體更新的支配作用相對較弱,這也是圖像重建中常用 L1 的原因之一。
L1 的穩健性還可以從統計估計的角度理解。把某個待預測的標量記為
在分佈連續處,其導數可以寫成
令導數為零,得到
其最優解是均值。當殘差分佈帶有長尾時,少量極端觀測會直接拉動均值,對中位數的影響則小得多。映射到多視角重建中,遮擋切換、鏡面高光和相機標定殘差都可能形成長尾誤差;L1 由此提供了較穩定的基礎修正信號。
L1 對每個坐標獨立計算。兩片紋理即使具有相似的局部結構,只要發生一兩個像素的位移,逐點殘差仍會迅速上升;反過來,一塊平滑區域只要平均顏色接近,也可能得到很低的 L1,而其邊界位置、局部對比度或細微紋理仍然不準確。3DGS 在 L1 之外加入結構項,補充的正是這部分局部關係。
SSIM:局部亮度、對比度與相關性 #
結構相似性指標(Structural Similarity Index Measure,SSIM)在局部窗口中比較兩幅圖像的均值、方差和協方差。對窗口內的兩組像素
若窗口權重
第一個分式主要比較局部亮度,第二個分式同時反映對比度與結構相關性。常數
整幅圖像的 SSIM 一般由各通道、各窗口中心的局部分數取平均。這個平均看似簡單,具體實現仍包含窗口尺寸、高斯核標準差、邊界填充、通道聚合和動態範圍等選擇。兩組實驗若使用不同設置,最後幾位小數未必具有可比性。
局部統計量也能直接給出 SSIM 的梯度結構。把渲染窗口記為
則
代入乘法與商法則,得到
這個導數同時含有目標像素
兩個簡化情形能進一步說明 D-SSIM 的尺度。若真實窗口只比渲染窗口多一個常數亮度偏移,即
若只考察零均值窗口中的對比度縮放
亮度偏移

D-SSIM 在 3DGS 中的實際含義 #
3DGS 論文把結構損失記為
在 3DGS 的參考實現中,這一項直接計算為
部分圖像處理文獻也把 D-SSIM 定義為
混合目標的梯度組成 #
對任意高斯參數
L1 部分直接從像素殘差給出修正方向。SSIM 部分會把一個像素與周圍窗口綁在一起。若
高斯對某個像素的貢獻由其屏幕 footprint 和透射率決定;SSIM 又把這個像素同鄰域統計相連。結構梯度經兩層局部支撐域傳回高斯,使邊緣、紋理和低對比度平面中的更新不再完全由單點顏色殘差決定。
Alpha 混合的梯度傳遞 #
對某個像素,把高斯按深度從前到後排序。令
表示到達第
由此可以直接求出
第一式表明,顏色梯度由可見性
忽略實現中的數值截斷,若屏幕空間高斯寫成
其中
再與
即使

這組對比還說明,單一損失曲線無法完整描述重建結果。訓練後期的標量損失可能只小幅下降,改善卻集中在小面積背景、細杆件或高頻紋理中;相反,平均損失下降也可能主要來自大面積平滑區域,而視覺上醒目的邊界仍有錯位。評價需要同時保留像素、結構和感知三個觀察尺度。
目標函數之外的優化結構 #
原論文的消融實驗保持重建損失不變,分別關閉初始化、密度控制、球諧外觀或梯度路徑。這組數據能夠區分「使用什麼損失」與「損失可以通過哪些參數和圖元傳播」 [2]。

| 消融設置 | 平均 PSNR-5k | 平均 PSNR-30k |
|---|---|---|
| 限制傳播梯度的高斯數 | 19.16 | 19.19 |
| 隨機點雲初始化 | 19.17 | 20.42 |
| 移除 Split | 21.50 | 23.90 |
| 移除 SH | 23.48 | 25.35 |
| 移除 Clone | 23.35 | 25.91 |
| 各向同性協方差 | 23.56 | 25.23 |
| 完整模型 | 23.90 | 26.05 |
在
限制只有前
四項常用重建指標 #
3DGS 論文使用 PSNR、SSIM 和 LPIPS 評價留出測試視角,實驗管線中也常加入 L1,便於直接觀察平均絕對殘差 [2, 3]。
| 指標 | 方向 | 計算空間 | 主要敏感因素 |
|---|---|---|---|
| L1 | RGB 像素 | 平均絕對顏色殘差,對極端值相對穩健 | |
| PSNR | RGB 像素 | 平方誤差,對少量大殘差更敏感 | |
| SSIM | 局部窗口統計 | 亮度、對比度、局部結構相關性 | |
| LPIPS | 深度網絡特徵 | 紋理、邊緣和感知特徵差異 |
PSNR 與 MSE #
對
峰值信噪比(Peak Signal-to-Noise Ratio,PSNR)定義為
其中
兩個方法的 PSNR 差值還能直接還原成 MSE 比值:
因此,PSNR 提高約
PSNR 對 MSE 的導數為
同樣大小的 MSE 絕對下降,在低誤差階段會換來更大的 dB 增量。因而 PSNR 曲線的縱向變化不能直接當作像素誤差的線性變化;比較訓練早期和後期時,回到 MSE 比值更容易判讀實際改善幅度。
L1 與 MSE 的界限 #
若圖像已歸一化到
對所有像素取平均,再利用均方根不小於算術平均,可得
這組界限只約束數值範圍,不保證排序一致。少量大殘差會被平方項顯著放大,因而可能出現 L1 更低、PSNR 反而更差的情況。遇到反光、高亮、遮擋邊界或少量嚴重錯配時,這種指標分歧尤其常見。
微小位移下的圖像誤差 #
新視角中的幾何偏差常先表現為屏幕空間位移。假設渲染結果相對真實圖像存在一個很小的二維偏移
相應的 L1 和 MSE 近似為
方括號內正是圖像梯度的二階矩陣。平滑區域的
LPIPS 的特徵距離 #
學習感知圖像塊相似度(Learned Perceptual Image Patch Similarity,LPIPS)把兩幅圖像送入固定的深度網絡,在多層特徵上計算加權距離 [4]。省略實現細節後,可寫成
其中
通道歸一化賦予了這個距離一個直觀的幾何解釋。若暫時忽略學習權重,並令兩個特徵向量
未加權的局部特徵距離等價於比較兩個特徵方向的餘弦相似度。加入
即在特徵空間中使用學習得到的對角度量。權重較大的通道對最終分數影響更強,而歸一化削弱了整體激活幅值的作用。LPIPS 因此測量的是經骨幹網絡與感知數據共同塑形的特徵差異,並非與網絡無關的通用視覺距離。

LPIPS 較低不等於幾何一定更準確。模糊、微小位移、重複紋理或網絡訓練域之外的材質,都可能令感知特徵與幾何誤差之間出現偏差。涉及三維幾何的研究仍需另行報告深度、法線、點雲或網格指標。
評價指標的聚合方式 #
假設測試集包含
而「先合併全部像素的 MSE 再換算」近似為
把
則兩種 PSNR 可分別寫成
二者的差值恰好為
最後一步來自算術平均不小於幾何平均。這個差值不只說明兩種口徑的方向,也刻畫了逐圖 MSE 的離散程度:各視角誤差完全相同時差值為零,難易視角分化越明顯,
因此,兩者滿足
若各圖像分辨率不同,先逐圖平均還會讓小圖和大圖具有相同權重;全像素聚合則由大圖主導。SSIM、L1 和 LPIPS 也存在逐圖平均、逐場景平均、按像素加權等口徑差異。報告結果時,聚合方法應當與數據劃分、圖像縮放和掩碼規則一起固定。
訓練損失與評價指標 #
同一方法內部,訓練損失曲線可以用來觀察是否收斂、是否出現數值異常,以及某次密度控制後優化狀態如何恢復。跨方法比較時,只有損失定義、權重、掩碼、歸一化和採樣方式完全一致,總損失數值才有直接比較意義。
若方法
方法
那麼
SSIM 同時出現在訓練和評價中也需要分開記錄。訓練時它是帶梯度的局部結構約束,只在當前採樣視角上參與更新;評價時模型保持固定,SSIM 在留出視角上統計泛化結果。即使兩處調用同一段函數,觀察對象仍不相同。
重建評價的實驗設置 #
指標表之外,至少需要固定以下條件:
- 測試視角:使用相同的訓練/測試劃分,避免把參與優化的視角混入評價。
- 相機與分辨率:保持相同內參、裁剪、縮放和渲染尺寸;亞像素偏移也會同時影響四項指標。
- 顏色空間:明確在線性 RGB 還是 sRGB 中計算,並統一像素動態範圍。
- 背景與 Alpha:透明區域應使用相同背景合成;前景掩碼的使用範圍也要一致。
- 指標實現:記錄 SSIM 的窗口與邊界處理、LPIPS 的骨幹和權重版本,以及各指標的聚合順序。
- 可視化:保存同一視角的真實圖像、渲染圖像和誤差圖,優先檢查高亮、遮擋邊界、細杆件、重複紋理與弱紋理平面。
- 效率條件:涉及訓練時間、幀率或顯存時,固定硬件、圖像尺寸、高斯數量統計時刻和渲染設置。
對每個測試視角保留逐圖指標,通常比只保存場景均值更有價值。均值回答整體趨勢,逐圖分布可以定位失敗視角;中位數、分位數或最差若干視角則能補充平均值容易掩蓋的長尾問題。
結語 #
3DGS 的混合訓練目標把兩種誤差信號送入同一條可微渲染鏈:L1 提供穩定、直接的逐像素顏色修正,D-SSIM 通過局部統計把相鄰像素聯繫起來。梯度到達高斯參數之前,還要經過透射率、前後景顏色差和屏幕空間高斯的雅可比;損失權重相同,不代表每個高斯能接收到同等強度的更新。
重建評價則從不同尺度觀察留出視角:L1 和 PSNR 描述像素殘差,SSIM 觀察局部結構,LPIPS 補充深度特徵距離。微小位移的展開表明,RGB 指標的敏感度本身受圖像梯度方向支配;PSNR 的算術平均—幾何平均差值又會放大視角難度分化。任何單項指標都有盲區,總損失也只有在定義一致時才能橫向比較。將公式、實現配置、聚合口徑和同視角圖像放在一起,指標才真正具有可解釋性。
參考文獻
- Wang Z, Bovik AC, Sheikh HR, et al.. Image Quality Assessment: From Error Visibility to Structural Similarity[J]. IEEE Transactions on Image Processing, 2004, 600–612.↩1 ↩2
- Kerbl B, Kopanas G, Leimkühler T, et al.. 3D Gaussian Splatting for Real-Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 139:1–139:14.↩1 ↩2 ↩3 ↩4 ↩5
- Chen G, Wang W. A survey on 3d gaussian splatting[J]. ACM Computing Surveys, 2024.↩
- Zhang R, Isola P, Efros AA, et al.. The Unreasonable Effectiveness of Deep Features as a Perceptual Metric[C]. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, 586–595.↩1 ↩2