完成影像整理与相机位姿恢复后,山东大学“智绘文脉”社会实践队进一步进入文物三维重建的核心阶段——NeRF神经辐射场训练。团队在经典NeRF方法基础上,结合真实博物馆文物影像存在的玻璃反射、曝光变化、背景复杂和有效视角有限等特点,对训练流程进行针对性改进,探索更加适用于真实文物数字化场景的三维重建方案。

NeRF并不是直接通过照片“拼”出一个传统三维模型,而是利用神经网络学习空间位置、观察方向与颜色、密度之间的对应关系。训练过程中,计算机会从不同相机视角发射大量虚拟射线,在三维空间中进行采样,通过体积渲染预测图像颜色,再不断比较预测结果与真实照片之间的差异,使网络逐步学习文物所在空间的三维信息。

项目采用粗细两级神经网络结构,并利用位置编码和视角方向信息描述复杂空间变化。针对有限显存环境,团队加入自动混合精度训练,在控制显存占用的同时提高计算效率;同时设置从快速预览到高质量训练的分阶段方案,先通过5000次训练检查数据和位姿是否可靠,再逐步推进至40000次清晰结果和80000次高质量训练,避免在存在数据问题时盲目投入长时间计算。
真实文物影像与标准NeRF数据集相比更加复杂。展柜反射可能产生并不存在于文物表面的高亮纹理,不同角度照片还可能由于展厅照明出现明显亮度变化。为此,项目加入曝光鲁棒归一化,通过有限范围的亮度调整降低不同照片之间的曝光差异;同时采用MSE与Charbonnier鲁棒损失相结合的方式,降低玻璃反光和轻微位姿误差对训练的干扰。
为了让模型更加关注文物本身,团队还设计了边缘、中心区域与均匀随机射线相结合的采样方式,提高文物轮廓和纹理进入训练批次的概率;通过连续图像块采样,引入SSIM结构相似度损失和图像梯度损失,加强模型对局部结构、边缘和高频纹理的学习;同时利用密度畸变约束抑制三维空间中容易出现的“漂浮物”和雾状密度。
针对博物馆照片中远处墙面和展柜背景容易占据大量采样空间的问题,团队进一步加入对象中心深度范围约束,使射线采样更加集中于文物附近。项目现有样本的诊断结果显示,这一处理使有效训练深度范围显著收缩,有助于有限计算资源更加集中地服务于主体重建。
从二维像素到三维神经场,模型训练让照片中的文物逐渐拥有了数字空间中的体积和视角信息。下一步,“智绘文脉”实践队将继续对不同训练阶段的结果进行对比,优化文物边缘、纹理与几何细节表现,并进一步开展新视角渲染,让数字文物真正能够在屏幕中被多角度观看。