目录

1.研究目的

2.基本思路

3.关键技术和主要技术指标

3.1数据收集与离线场景搭建

3.2改进3DGS的大件运输物体高质量重建模块

3.3基于球面几何的全景图测距技术模块

3.3.1技术实现

3.4大件运输三维空间感知技术模块

3.5大件运输目标智能识别模块

4.市场分析和经济效益预测

4.1市场分析

4.2经济效益预测


1.研究目的

本研究旨在开发基于多源数据融合的智慧运输决策支持系统。针对大件货物运输中涉及的复杂场景与动态环境,通过无人机航摄影像、GNSS定位数据及传感器信息,构建港口全域高精度三维数字模型,并结合YOLO目标检测与OCC占用感知技术,实现对船舶、特种车辆及货物的实时监控与精准定位。系统将综合考虑道路状况、货物特性及外部环境因素,降低运输时间与能耗,同时通过风险预警机制有效减少安全事故的发生概率。

其次,本研究聚焦于构建高保真运输仿真系统,利用改进的3D Gaussian Splatting技术,结合多视角影像处理与MVS稠密点云优化策略,实现港口场景的高质量三维重建,为运输方案的虚拟验证提供真实可信的数字孪生平台。通过Unity3D平台对运输过程进行可视化模拟,系统能够在实际操作前对装卸、转运及路径规划方案进行预演,识别潜在风险点,优化设备调度与资源配置,从而大幅降低试错成本与操作风险。

此外,本研究还将探索多功能模块化架构的协同应用,集成三维重建、全景测量、目标检测与占用感知等功能,通过标准接口实现数据互通,形成闭环的“感知-决策-仿真”管理流程。系统不仅支持港口内部的精细化管理,还可扩展至多式联运场景,为跨区域大件运输提供统一的技术支持。

最后,本研究旨在推动大件智慧运输与仿真系统的标准化与产业化应用,促进“智运通”平台在港口作业、智慧物流及多式联运领域的广泛推广。系统通过整合先进的三维重建、目标检测与虚拟仿真技术,为大件物流的智能化升级提供全面解决方案,不仅提升作业效率与安全性,还为绿色低碳的可持续发展目标提供技术支撑,为现代物流行业的数字化转型奠定坚实基础。

2.基本思路

大件货物具有“超长、超宽、超高、超重”四大典型特性,这就对大件货物运输提出了高复杂、高风险和高技术的要求,大件货物在装卸、堆存和转运过程中涉及多设备协同和复杂路径规划;由于货物超重超大,运输过程中存在设备超载、碰撞、倾覆等安全隐患,需要精确的环境感知、路径优化和设备调度,针对这些特点本文提出了相关需求,并构建相关研究目标。

该系统的基本思路是以港口—工厂场景为研究背景,针对传统运输管理模式的局限性,根据构建的研究目标,设计一个集三维场景重构、智能动态感知与虚拟仿真验证为一体的智慧运输平台。系统通过计算机视觉、人工智能及虚拟仿真技术的集成应用,实现港口及周边环境的数字孪生建模、运输过程的实时感知与智能决策,以及运输方案的高保真仿真优化。其目标是为大件物流提供全流程的闭环管理支持,解决作业效率、安全性及精细化管理的核心需求。

通过无人机等设备进行数据采集与离线场景搭建,然后设计相关模块来解决本文的主要研究目标,由五大功能模块组成,具体如下如图所示。

(1)三维重建模块

采用改进的3D Gaussian Splatting(3DGS)技术,改进的3DGS算法引入3D滤波器与2D滤波器优化高斯椭球的尺寸与投影成像,并借鉴MVS稠密点云的优化策略,提升重建质量与渲染效率。这种高保真虚拟场景为后续仿真与决策奠定了基础。

(2)OCC占用检测模块

通过Occupancy Grid(OCC)三维占用感知网络,将港口场景划分为规则网格单元,动态计算各单元的占用概率,实现对障碍物、货物堆存区及空闲区域的精确感知。该模块包括多视图特征提取、2D到3D视图变换及3D解码与语义输出等步骤,确保复杂动态环境下的高精度感知,为路径规划与避障提供实时支持。

(3)全景测量模块

基于360°全景图技术,结合球面几何算法,该模块支持用户在全景图中点击两点计算实景距离,并以3D文字形式直观显示。这种精确测量功能为大件货物的装卸与转运提供了关键距离参考,辅助调度决策。

(4)目标检测模块

采用改进的YOLOv8算法,通过加入空间注意力模块与多尺度检测头,增强对遮挡目标和小目标的检测能力。该模块实现对船舶、特种运输车辆及大件货物的快速精准定位与监控,为运输过程中的动态感知与风险预警提供数据支撑。

(5)运输仿真模块

借助Unity3D平台,结合三维重建模型与感知数据,构建港口场景的虚拟仿真环境。该模块通过可视化模拟大件货物的装卸、转运及路径规划过程,支持运输方案的预演与优化,识别潜在风险,降低试错成本与操作隐患。

上述五大模块协同工作,形成了“感知-决策-仿真”的全链路闭环管理流程。从港口场景的数字孪生建模与动态感知开始,到运输路径的智能规划与决策,再到虚拟仿真验证与方案优化,系统实现了大件运输全过程的智能化管理。

3.关键技术和主要技术指标

3.1数据收集与离线场景搭建

数据处理是倾斜摄影工作中承前启后的关键环节,直接影响三维模型的完整性与精度。基于影像数据采集结果,倾斜摄影三维建模通常采用结构光束法与多视图立体匹配技术。首先,利用空三算法提取影像间的特征点,计算相机姿态参数,并生成稀疏点云;随后通过密集匹配算法生成高密度点云数据。点云数据经过滤波、分类和优化处理后,可进行网格重建及纹理映射,形成完整的三维模型。最终,根据三维地理建模系统(3DGS)平台要求,将模型导出为支持格式,如OSGB、OBJ或3DTiles等,完成数据入库与展示。该流程对影像质量和重叠度有较高要求,需在数据采集阶段加以控制,以保障模型精度与后续应用效果。

在无人机上搭载多台传感器,从不同角度对影像进行采集。相比于传统的摄影测量,它有四个倾斜拍摄角度,因此可以获得纹理更加清晰的信息。传统的航空摄影测量拍摄到的是顶视图,而倾斜摄影测量获得的是地表的侧视图,这种拍摄方式获得的影像更加立体,特别是能获得建筑物或场景的立体信息,还有从斜面角度拍摄到的地形地貌纹理信息。因此它近年来被广泛用于三维重建的上游工作中,倾斜摄影测量可以从多角度拍摄地面场景,可以获得多方位场景数据与信息,再将这些视角采集到的三维场景进行拼接,得到的三维场景更加完整和精确。

倾斜摄影生成模型的精度一般为正射影像分辨率的2~3倍,即垂直视角所采集的照片分辨率的2~3倍。正射影像成像分辨率有公式所对应的比例关系,a为像元尺寸,GSD为地面分辨率,f为镜头焦距,H为摄影系统航高(即飞行高度),由此可推断出特定分辨率下的飞行高度H应为下式所示。

本文以山东乳山港为例,针对大件作业的需求,采用无人机获取作业区的高分辨率影像数据,并搭载全球导航卫星系统(GNSS)定位设备以同步采集曝光瞬间的POS数据(包含相机位置与姿态)。通过对无人机航摄影像及POS数据进行自动化处理,结合空三技术进行高效建模,快速生成场景的MVS点云、DOM、DSM等基础数据。随后,利用ContextCapture倾斜摄影软件对影像数据进行重建,提取高质量三角网格模型,并映射真实纹理,构建具备真实感和高精度的三维离线场景,为后续运输仿真与路径规划提供高保真建模支持。

3.2改进3DGS的大件运输物体高质量重建模块

3DGS是一种显式方法,使用可学习的三维高斯分布对场景进行建模。该模型通过监督学习进行训练,以最大限度地减少合成图像与地面实况多视角图像之间的差异。显式三维高斯表示大大提高了学习效率,并能实时渲染复杂的高分辨率场景。在3DGS中,场景的几何形状被建模为一系列3D高斯(椭圆体),每个高斯由其辐射属性和位置属性定义。

为确保协方差矩阵 是正半有限矩阵且可解释,可将其分解为:

其中,R是旋转矩阵(通常以四元数为参数),S是对角缩放矩阵。

渲染过程包括拼接,将三维高斯投影到二维图像平面上。为了提高效率,我们使用挫面剔除来剔除摄像机视野之外的高斯。投影后,每个三维高斯都会变成图像平面上的二维高斯(椭圆)。然后,一种像素渲染算法通过混合所有重叠高斯的贡献值来计算每个像素的颜色,这些贡献值按它们到摄像机的距离排序。通过α混合计算出最终像素的颜色C:

为了支持高分辨率场景中的实时性能,并行计算技术,如基于瓦片的光栅化和基于CUDA的渲染。此外,在训练过程中,还应用了密度控制技术,包括点密集化和点修剪,以根据梯度和不透明度信息调整高斯的空间分布,进一步提高重建质量。

具体的3D高斯泼溅技术可参考原论文:

3D Gaussian Splatting for Real-Time Radiance Field Rendering

改进的3DGS的训练流程包括以下步骤,如图所示:

首先,捕捉场景的多视角图像。使用SfM或随机初始化生成的点云初始化3D高斯集。其次,将三维高斯投影到图像平面上,并使用渲染过程生成合成视图。最后,通过最小化合成图像与地面实况图像之间的差异来优化高斯参数,同时根据学习到的梯度和不透明度动态完善高斯分布。

3.3基于球面几何的全景图测距技术模块

全景实地测量是基于360°全景图像与球面投影模型实现的一种虚拟环境下的空间测量技术。该功能通过在Unity等三维引擎中加载高分辨率全景图像,构建沉浸式全景视图,使用户能够在图像中任意点击两个点,系统根据球面几何原理计算两点之间的实际空间距离,并在视图中以3D标注形式直观显示测量结果。

该技术不仅具备良好的交互性和可视化效果,还大大简化了传统实地测量的流程,适用于大件运输、港口布设、施工勘察等场景。通过与实际位置参数(如拍摄高度、相机视场)结合,可实现高精度、高效率的远程测量与辅助决策支持。

3.3.1技术实现

1、全景图构建

通过专业全景相机或无人机采集图像后拼接生成360°球面图,在Unity中以Skybox或球面贴图的方式构建视觉场景;用户视角通过虚拟摄像机绕球面自由旋转,实现沉浸式观察体验。

2、实地测量交互

用户可通过鼠标点击全景图任意两个点,系统获取点击点在球面上的二维像素坐标,映射为球面单位向量。

3、实景测量算法

转换像素坐标为球面单位向量,屏幕点(u,v)可转换为球面单位向量P:

计算两点的夹角θ:

计算球面弧长S:

技术原理如图所示:

3.4大件运输三维空间感知技术模块

OCC(Occupancy,占用感知网络)是一种用于三维空间环境感知的关键技术,通过将场景划分为规则的三维网格单元,并基于传感器数据动态计算每个单元的占用概率(Occupancy Probability),实现对场景中障碍物、货物堆存区域及空闲区域的精确表征。OCC网络具备以下优势:表达能力强:可预测每个空间体素的占据概率,不局限于有限类别的物体。遮挡恢复能力:可根据周围语义信息补全不可见区域(相比深度图仅预测可视表面)。多视角一致性:通过直接在三维空间内预测体素状态,实现多个摄像头视角的信息一致融合。可扩展性高:能应用于3D语义分割、场景重建、场景流估计等下游任务。

在这项技术中,我们的目标是通过多摄像头图像I = {I1 , I2 , --- IN}预测周围场景的三维占位率。从形式上看,三维空间占用率的预测可表示为:

其中,G是一个神经网络,V∈R H×W×Z是三维占用率。V的值介于0和1之间,代表网格的占用概率。将V提升到(L,H,W,Z)张量,我们可以得到三维语义占用率,其中L是类号,类0表示未占用网格。

Deformable Attention融合多摄像头视角,在2D-3D空间注意力中,对每个3D查询点,融合多个摄像头的图像特征,关键公式如下:

其中,Fp和Qp表示输出特征点和三维体查询点的第p个元素。Vhit表示三维查询点的命中视图。Wi和W′i是可学习权重,Aij∈[0,1]是通过查询和关键点的点积计算的关注权重。

借此进一步将2D-3D空间注意力扩展到多尺度方式。与三维检测任务不同,三维场景重建需要更多底层特征来帮助网络学习细粒度细节。为了解决这个问题,OCC设计了一种2D-3DU-Net架构。具体来说,给定多尺度2D特征 {{X j i } N i=1}M j=1,采用不同数量的2D-3D空间注意层来提取多尺度三维体积特征{Fj ∈ R Cj×Hj×Wj×Zj }M j=1。然后,利用三维解卷积层对第j - 1层三维体积特征 Yj-1进行上采样,并与Fj融合:

对于每个级别,网络输出不同分辨率Vj∈R Cj×Hj×Wj×Zj 的占用率预测结果。为了获得强大的高层和低层三维特征,在每个尺度上都对网络进行了监督。对于三维语义占位预测,采用多类交叉熵损失,而对于三维场景重建,我们将其改为两类表述。

本文的港区三维空间环境占用感知的技术如图所示,是一种基于多摄像头图像的三维占据预测网络,完整流程包括:图像采集,通过安装在车辆四周的多视角摄像头采集RGB图像,覆盖全方位视野;图像特征提取:利用CNN提取每张图像的多尺度特征图,为后续3D建模做准备;2D-3D空间注意力融合:将体素点投影到图像平面,使用变形跨视角注意力机制将2D图像特征提升到3D空间,形成稠密的三维体素特征体;多尺度3D解码与占据预测:采用3D卷积U-Net结构对体素特征进行多尺度解码,逐层输出体素的占据概率和语义类别;监督训练机制:使用自动生成的稠密占据标签对网络进行逐层监督,提升精度与一致性;最终输出:模型输出一个包含占据概率和语义信息的三维体素网格,表示周围环境中所有物体(静态+动态)的立体状态。

具体关于OCC的技术内容可以关注原论文:

weiyithu/SurroundOcc: [ICCV 2023] SurroundOcc: Multi-camera 3D Occupancy Prediction for Autonomous Driving

3.5大件运输目标智能识别模块

本文设计了一个空间注意力模块加入到YOLOv8的主干网络部分,以增强被遮挡部分的关键特征提取能力,从而提高检测精度。改进的目标识别算法模型主要由主干特征提取模块(Backbone)、特征加强模块(Neck)、检测模块(Detect)等3部分构成,主干特征提取模块沿用了CSPDarkNet结构,并采用梯度流更加丰富的C2f模块代替C3模块,并调整了不同尺度模型的通道数,降低了模型计算量,提升了收敛速度与收敛效果。特征加强模块采用Path Aggregation Network(PANet)结构,通过上采样、通道融合,最终将PANet的3个输出分支送入检测模 块。检测模块采用解耦头结构进行检测,将回归分支和预测分支分离,加速模型收敛。

总体损失函数由三部分组成:

Lcls:分类损失(通常为BCE或Focal Loss)

Lbox:边界框回归损失(使用DIOU Loss)

Lobj:目标置信度损失(objectness)

IoU是目标检测的一个重要评价指标,可衡量预测框和真值之间的距离。常用来计算,多个检测框可能有相同大小的损失,但IoU可能差异很大,为此需引入IoU损失。其定义为:

其中,B为预测框,Bgt为目标框。

若两框无交集,则IoU = 0,此时因损失为0,没有梯度回传,学习训练失败。因此提出GioU:

其中,C为两个框的最小闭包区域面积。GIoU, 可显著提高YOLO的定位精度。

当目标框完全包裹预测框时,IoU和GIoU的值 相等,此时GIoU退化为IoU,即GIoU严重依赖IoU,因此在两个垂直方向,误差大,难收敛。由此提出DioU:

无序列表

其中,b和bgt表示B和Bgt的中心点,ρ(.)是欧氏距离,C是覆盖这两个框的最小封闭框的对角线长度。 DIoU的惩罚项直接最小化两个中心点之间的距离,对包含两个框在水平方向和垂直方向上的情况,可加速模型回归。

目标框损失应考虑3个重要的几何因素:重叠面积、中心点距离和长宽比。而DIoU未考虑到检测框的长宽比。长宽比更接近的边框应有更低的损失,因此提出了CioU:

其中,α是一个正的度量参数,同时v用来度量宽高比的一致性。通过这种方式,尤其是在非重叠情况下,重叠区域因子在回归上具有更高的优先级。

技术路线图如下所示:

具体关于YOLOV8的技术细节可参考源码与论文:
ultralytics/ultralytics: Ultralytics YOLO 🚀

4.市场分析和经济效益预测

4.1市场分析

“智运通”系统专注于大件货物运输,这是一个具有独特挑战的细分市场。大件货物因其体积庞大、重量超常,需要专用设备(如重型起重机)和特殊运输程序,传统方法往往导致高成本、效率低下和安全风险。

“智运通”系统的目标客户包括:港口当局:如乳山港,负责管理港口基础设施和运营;物流公司:专注于大件货物运输的公司,如Jumbo Shipping和SAL Heavy Lift(JSI Alliance);航运公司:如Boskalis,运营重型起重船,处理复杂项目(如海上风电场设备运输)

“智运通”系统通过以下特点获得竞争优势:(1)大件货物专属优化:针对大件货物的三维重建、目标检测和占用感知技术,解决了传统方法在处理超大货物时的效率和安全问题。(2)高保真仿真:基于Unity3D的虚拟仿真模块,支持运输方案的可视化验证,降低试错成本。(3)模块化架构:通过标准接口实现数据互通,具有高度可扩展性,适应不同港口规模和需求。

市场定位:“智运通”系统定位于处理大件货物的港口,特别是在能源(如海上风电设备)、建筑(如桥梁构件)和制造业(如重型机械)领域。这些行业对高效、安全的物流解决方案需求强烈。系统已在乳山港成功应用,证明了其在中小型港口的可行性。未来,系统可扩展至大型港口(如上海港、宁波舟山港)以及国际市场(如东南亚和欧洲的港口),进一步扩大市场份额。

4.2经济效益预测

(1)运营效率提升:通过优化设备调度和运输路径,减少起重机和运输车辆的闲置时间。

事故成本降低:

(2)大件货物运输中的事故(如货物掉落、设备损坏)可能导致直接损失(如设备维修)和间接损失(如延误、法律责任)。

(3)试错成本减少:

虚拟仿真模块允许港口在不实际移动货物的情况下测试运输方案,避免代价高昂的错误。例如,传统方法可能因路径规划错误导致数万美元的延误成本,系统可通过模拟优化方案,显著降低此类损失。
 

项目展示:

视频地址:

项目视频


 

更多推荐