NY

弱紋理場景中的幾何可觀測性

弱紋理場景中的高斯表示與重建
技術筆記 神經渲染 3D Gaussian Splatting 3DGS 弱紋理 幾何可觀測性 多視圖幾何 SfM 光束法平差

《3DGS 的訓練目標與重建評價》將微小屏幕位移展開為圖像梯度與位移的內積:幾何位置已經改變,平滑區域的 RGB 誤差仍可能很小。沿着這個結果繼續向參數空間追蹤,會遇到一個更基本的條件——觀測圖像能否區分相鄰的幾何狀態。

設場景參數為θ,觀測模型為h(θ),圖像數據為y。在當前估計θ0附近,殘差可以線性化為

r(θ0+δθ)r0+Jδθ,J=rθ|θ0.

若存在非零方向v滿足Jv0,參數沿v改變後,當前觀測幾乎不變。這個方向在局部缺少可觀測性。加權最小二乘對應的信息矩陣為

H=JTWJ.

H的小特徵值標記弱約束方向,零特徵值則對應局部零空間。弱紋理的影響由此可以拆成三層:圖像是否提供位移方向,視角是否提供足夠視差,以及渲染模型中的幾何變化能否同外觀變化區分開來。

光度殘差的幾何雅可比

取參考圖像Ir中的像素p,根據深度、相機位姿和投影模型,把它映射到目標圖像中的w(p;θ)。直接法使用的光度殘差可寫為 [1]

rp(θ)=It(w(p;θ))Ir(p).

對幾何參數求導,鏈式法則得到

Jp=It(w)T圖像方向wθ投影與幾何.

第二項描述深度或位姿變化會把像素移到哪裏,第一項決定這次移動能否改變觀測值。當It很小時,即使投影位置對幾何非常敏感,乘積仍然接近零;圖像沒有為這次幾何變化提供足夠的判別信號。

把圖像噪聲近似為方差σI2的獨立高斯噪聲,局部參數協方差可由高斯—牛頓近似寫成

Cov(δθ)σI2(JTJ)1.

這個表達式需要J滿列秩;退化時應使用偽逆,零空間方向的方差沒有有限上界。低 RGB 殘差只表示某個解能解釋訓練圖像,沒有給出JTJ的譜,也就沒有給出幾何置信度。

局部窗口的秩

先把幾何變化簡化成圖像窗口的二維平移δ=(u,v)T。亮度恆常假設給出

I(x+u,y+v)I(x,y)+Ixu+Iyv.

在窗口Ω中疊加殘差,得到經典的二階矩陣 [2, 3]

G=pΩwp[Ix2IxIyIxIyIy2]=pΩwpIpIpT.

G正是位移參數的信息矩陣。令其特徵值滿足λ1λ20

  • 平坦窗口中,λ1λ2都很小,兩個平移方向都缺少約束;
  • 單一邊緣通常只有λ1較大,沿邊緣方向仍可滑動,形成孔徑問題;
  • 角點或方向豐富的紋理使兩個特徵值都較大,二維位移才能穩定估計。
四幅室內外圖像及 Direct Sparse Odometry 根據局部梯度分層選出的候選像素
Direct Sparse Odometry 的候選像素選擇。上排為輸入圖像,下排為分層梯度閾值選出的像素;高梯度候選覆蓋邊緣和紋理,較弱的亮度變化需要降低閾值、擴大分塊後才能得到稀疏採樣 [1]

如果每個像素殘差的噪聲方差仍為σI2,位移估計的協方差近似為

Cov(δ^)σI2G1=V[σI2/λ100σI2/λ2]VT.

因而λ2直接控制最差方向的方差上界,條件數

κ(G)=λ1λ2

則描述兩個方向的敏感度差異。只使用平均梯度幅值會把「兩個方向都弱」和「一個方向很強、另一個方向近乎為零」混在一起。對幾何可觀測性而言,最小特徵值和條件數比單個梯度閾值更有解釋力。

視差的深度靈敏度

局部窗口可被穩定匹配後,深度仍取決於視角幾何。在校正後的雙目模型中,焦距為f,基線為B,深度為Z,視差d滿足

d=fBZ,Z=fBd.

對視差做一階誤差傳播,可得

σZ|Zd|σd=Z2fBσd,σZZZfBσd.

深度越遠、基線越小,固定的亞像素匹配誤差會被放大得越嚴重。視差誤差本身又受紋理約束。對一維水平匹配,信息量近似為

Id=1σI2pΩIx(p)2,σd2σI2pΩIx(p)2.

把兩段誤差傳播連起來,得到

σZ2Z4f2B2σI2pΩIx(p)2.

這個式子把弱紋理和視角退化放在了同一個尺度上:低梯度減小分母,遠距離和小基線增大分子。增加視圖數只有在新視圖帶來有效梯度、共視關係和新的射線方向時,才會真正增加信息量。

一般相機模型下可以用兩條觀測射線的夾角θ代替校正雙目的水平視差。當θ0時,兩條射線接近平行,三角化信息矩陣沿深度方向的特徵值趨近於零。基線—深度比、共視數量和射線夾角應一起考察,單獨統計「看見了幾次」仍可能高估幾何約束 [4]

參考視圖中的像素和多個深度法線平面候選通過單應變換投影到相鄰視圖
GaussianPro 的平面候選匹配示意。每組深度與法線 $(d_k,\mathbf n_k)$ 都會在相鄰視圖中產生不同的單應映射;只有圖像塊具有足夠辨識度且視角幾何有效時,跨視圖光度代價才能排除錯誤候選 [5]
GaussianPro 從現有高斯渲染深度與法線,經幾何傳播、過濾與選擇後生成新高斯的管線
GaussianPro 的漸進高斯傳播管線。現有高斯先渲染深度和法線,再經由鄰域傳播產生候選,通過幾何過濾與選擇保留可信的深度、法線,最後將需要補充的像素投影到三維空間初始化為新高斯,再回到訓練管線 [5]

位姿與結構的聯合零空間

SfM 在多幅圖像中建立特徵軌跡,並通過光束法平差聯合優化相機與三維點 [6, 7]。第i個相機觀測第j個點時,重投影殘差可寫成

rij=zijπ(TiXj).

線性化後,每條觀測只連接一個相機塊和一個點塊:

δrijJc,ijδξi+Jx,ijδXj.

全部觀測形成的法方程具有分塊結構

[HccHcxHxcHxx][δcδx]=[gcgx].

消去三維點後,相機位姿接收到的有效信息由 Schur 補給出

Sc=HccHcxHxx1Hxc.

某個三維點只有短軌跡、小三角化角或集中在單一方向的觀測時,Hxx會變得病態;這部分不確定性經交叉塊傳到Sc,令位姿和結構沿某些組合方向一起漂移。弱紋理在特徵法中常表現為軌跡數量不足,在直接法中則表現為光度雅可比過小,最後都會反映到法方程的譜上。

單目重建還天然具有全局相似變換自由度:同時旋轉、平移和縮放全部相機與三維點,重投影不變。未固定坐標系時,這對應3+3+1=7個規範自由度。它和弱紋理造成的局部退化需要分開處理:前者可通過固定參考相機與尺度消除,後者即使在規範固定後仍然存在。

3DGS 的外觀—幾何耦合

3DGS 通常從 SfM 稀疏點初始化高斯位置,然後依靠渲染損失更新位置、尺度、旋轉、不透明度與顏色,並根據屏幕空間位置梯度進行致密化 [8]。SfM 在弱紋理表面留下的稀疏或不穩定初始化,會直接縮小後續幾何優化的有效支撐域。

對某個像素,按深度排序的 Alpha 混合為

C^(p)=iTi(p)αi(p)ci,Ti=j<i(1αj).

令第k個高斯的二維核為

Gk(p)=exp[12(pμk)TQk(pμk)],αk=okGk,

其中Qk=(Σk)1。把第k層之後的合成顏色記為Bk+1,則

C^αk=Tk(ckBk+1),αkμk=okGkQk(pμk).

再乘上投影雅可比,就得到世界空間高斯中心的像素梯度。平坦區域中,相鄰位置產生的顏色差異很小,footprint 兩側的殘差也容易對稱抵消;位置梯度隨之變弱。此時致密化缺少觸發信號,增加訓練迭代並不會憑空增加新的幾何證據。

參數耦合會進一步削弱幾何的可觀測性。把位置、旋轉和尺度合記為幾何參數g,把顏色與不透明度合記為外觀參數a,局部渲染變化為

δC^Jgδg+Jaδa.

若先允許外觀參數自由調整,再考察幾何剩餘的信息量,可消去δa,得到幾何的約化信息矩陣

Sg=JgTWJgJgTWJa(JaTWJa)1JaTWJg.

第一項是固定外觀時的幾何信息,第二項扣除了可以由外觀參數解釋的分量。若Jg的列接近Ja的列空間,Sg便會出現小特徵值:移動高斯造成的圖像變化,可以通過調整顏色、不透明度或 footprint 近似抵消。訓練視角的 RGB 因而能繼續改善,表面位置、法線與新視角遮擋關係仍可能不穩定。

3DGS 與帶幾何傳播約束的方法在高斯分佈、渲染圖像和渲染法線上的對比
訓練圖像指標接近時,高斯分佈和渲染法線仍可能存在明顯差異。上排 3DGS 的道路區域可以形成連貫 RGB 外觀,幾何分佈與法線卻更噪雜;下排加入多視圖幾何傳播後,幾何結構更集中 [5]

傳播與平面約束的實驗分解

GaussianPro 將相鄰高斯的幾何線索傳播到低紋理區域,並用多視圖單應代價篩選深度—法線候選。其 Waymo 消融實驗把幾何傳播和平面約束分別開關,因而可以觀察兩條路徑對渲染結果的單獨與聯合影響 [5]

幾何傳播平面約束PSNRSSIMLPIPS
33.530.9380.226
34.020.9420.218
34.480.9460.203
34.680.9490.191

幾何傳播單獨使 PSNR 由33.53dB 增至34.48dB,增量為0.95dB;只啟用平面約束時,增量為0.49dB。當傳播已經啟用,再加入平面約束只增加0.20dB。若兩項影響可以線性相加,完整設置的預期增量應為0.95+0.49=1.44dB;實際增量為1.15dB,少了0.29dB。這部分差值反映出兩項約束會更新重疊的高斯參數,並沿共享的誤差路徑改變相同的渲染結果;後加入的約束只能繼續修正尚未被前一項消除的分量。

Room 場景中 3DGS 與 GaussianPro 的高斯分佈對比
Room 場景中 3DGS 與 GaussianPro 的高斯分佈。左圖的雜散高斯和紅圈浮點顯示弱紋理區域的幾何分佈不夠集中,右圖的高斯更近於主要表面 [5]

表中三項都是圖像指標,只能間接支撐幾何改善。PSNR 和 SSIM 的增長可能同時來自更正確的表面位置、更密集的高斯覆蓋以及外觀參數調整。因此,定量表格要同時對照高斯分佈和法線圖:前者顯示幾何質量是否集中在表面附近,後者顯示局部方向是否連續。這比單獨用 RGB 指標推斷可觀測性更符合前面的約化信息矩陣分析。

弱紋理的幾種退化型態

「弱紋理」常被簡化成梯度小於某個閾值,實際退化還包含方向、對應唯一性、成像假設和視角幾何。它們在信息矩陣中留下的症狀不同。

場景條件主要退化信息矩陣中的表現常見結果
大面積平坦區域兩個圖像方向都缺少變化λ1,λ2都小匹配漂移、深度不確定、致密化不足
單一長邊緣孔徑問題λ1大、λ2沿邊緣方向滑動
重複紋理對應不唯一局部曲率可大,但存在多個離散極小值錯誤匹配、週期性深度跳變
小基線或遠距離三角化角過小深度方向特徵值小深度方差快速放大
鏡面反射與曝光變化亮度恆常失效殘差帶系統偏差幾何吸收外觀誤差,或反之
遮擋與視野邊界共視關係中斷有效觀測行數減少前後景錯連、浮點與空洞
外觀自由度過高幾何與外觀列空間重疊Sg出現小特徵值RGB 良好,深度與法線不穩定

重複紋理尤其容易被單純的局部特徵值判斷漏掉。每個候選位置附近都可能具有很強的二階曲率,但全局目標包含多個相似極小值;這屬於離散歧義。局部可觀測性回答「當前解附近能否辨識」,還需要多視圖循環一致性、極線約束或更大範圍的上下文排除錯誤分支。

可觀測性的診斷尺度

弱紋理區域的判定可以沿着優化管線逐層記錄,而不必壓縮成單一掩碼:

  • 圖像層:統計窗口結構張量的λ2κ(G)和梯度方向分佈;
  • 匹配層:保留代價曲線的峰值比、次優候選間隔和前後向一致性;
  • 視角層:統計有效共視數、基線—深度比、三角化角與遮擋狀態;
  • 優化層:觀察重投影雅可比或近似 Hessian 的小特徵值,以及阻尼前後的條件數;
  • 3DGS 層:比較幾何梯度與外觀梯度範數,檢查屏幕空間位置梯度、可見視圖數、深度和法線的跨視圖一致性;
  • 結果層:把 RGB 指標同深度、法線、點雲或網格指標分開報告,並保留新視角誤差圖。

正則項與先驗會抬高某些弱方向的曲率。若原始信息矩陣為H,加入二次先驗

λ2L(θθ0)22

後,法方程變為

Hreg=H+λLTL.

數值條件會改善,但新增曲率來自先驗假設。當數據項在某個方向沒有信息時,結果主要由θ0Lλ決定;先驗的偏差也會直接進入幾何。診斷時應把數據可觀測性和正則化後的可解性分開記錄。

結語

弱紋理場景的幾何困難可以沿一條連續的誤差鏈理解:圖像梯度決定局部位移信息,視差和射線夾角把像素不確定性傳到深度,位姿—結構耦合把局部退化擴散到整個重建,而 3DGS 的顏色、不透明度和協方差又能吸收一部分幾何引起的圖像變化。

局部結構張量的最小特徵值、三角化角、光束法平差的 Schur 補和 3DGS 的約化幾何信息矩陣,描述的是同一件事在不同階段的投影:幾何擾動是否會留下無法被其他參數消除的觀測差異。這也解釋了弱紋理平面上常見的現象——訓練視角已經平滑、乾淨,深度、法線和新視角邊界仍然漂移。後續幾何約束應當針對這些弱方向補充跨視圖證據,同時明確新增信息來自觀測、模型假設還是外部先驗。

參考文獻

  1. Engel J, Koltun V, Cremers D. Direct Sparse Odometry[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2018, 611–625.↩1 ↩2
  2. Lucas BD, Kanade T. An Iterative Image Registration Technique with an Application to Stereo Vision[C]. Proceedings of the International Joint Conference on Artificial Intelligence, 1981, 674–679.
  3. Shi J, Tomasi C. Good Features to Track[C]. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 1994, 593–600.
  4. Hartley R, Zisserman A. Multiple View Geometry in Computer Vision[M]. Cambridge University Press, 2004.
  5. Cheng K, Long X, Yang K, et al.. GaussianPro: 3D Gaussian Splatting with Progressive Propagation[C]. Proceedings of the International Conference on Machine Learning, 2024, 8123–8140.↩1 ↩2 ↩3 ↩4 ↩5
  6. Schönberger JL, Frahm JM. Structure-from-Motion Revisited[C]. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016, 4104–4113.
  7. Triggs B, McLauchlan PF, Hartley RI, et al.. Bundle Adjustment---A Modern Synthesis[M]. Vision Algorithms: Theory and Practice, 2000, 298–372.
  8. Kerbl B, Kopanas G, Leimkühler T, et al.. 3D Gaussian Splatting for Real-Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 139:1–139:14.
Copyright © Nishikori Yui. All rights reserved.