中文标题:AEC工程图纸布局检测与信息提取的深度学习方法基准测试
中文摘要:构建AEC专用数据集并基准测试五种深度学习模型,RF-DETR与Qwen3-VL表现最优,为自动信息提取奠定基础。
SWITi:使用滑动窗口内部平铺量化和减少平铺伪影
SWITi通过滑动窗口平均降低后验预测平铺伪影,引入无参考指标FRT/ASV,在荧光显微镜数据中提升重建保真度与分辨率。
缓解零样本视频时刻检索中的模态与语言风格差距
基于自相似性规避模态和语言风格差距,结合MLLM推理,实现零样本视频时刻检索最先进性能。
基于大视觉语言模型的上下文结构化视频异常检测
提出CSI-VAD,通过分解视频为环境、物体、时间三种上下文进行无训练异常检测,效果优于直接整体推理。
CoGoal3D: 基于3D感知融合与精化的协作式3D目标检测
提出两阶段3D协作检测框架CoGoal3D,通过3D感知融合缓解空间错位,并用点重构精化,在三个数据集上[email protected]提升超10%,达SOTA。
IMMoE:基于视图专家混合融合的不完整多视图异常检测
提出IMMoE,通过多视图专家融合和局部异常增强编码器,处理缺失视图异常检测,在RIMAD上像素级和图像级指标分别提升11.8%和2.8%。
Mage-Flow:一种高效的原始分辨率图像生成与编辑基础模型
Mage-Flow是4B参数的高效图像生成编辑模型,协同设计实现快速训练与推理,1024^2图像生成仅需0.59秒。
对比式在线策略蒸馏
COPD通过对比指令生成token级优势信号,促使学生模型学习更简洁高效的推理,减少推理长度且不损性能。
FilmWorld:通过动态电影世界建模实现小说到电影的智能体生成
提出FilmWorld智能体系统,分构建与演化两阶段将小说转化为长视频,显著提升叙事保真度与跨场景一致性。
Gaze-DETR:基于优先级地图自上而下引导的红外弱小无人机检测方法
提出Gaze-DETR,通过预测优先级图引导定位前特征增强,在红外弱小无人机检测上取得高精度。
现在你看到了仇恨:面向隐藏仇恨性幻象的自适应视图检索
提出自适应视图检索框架,通过检索-校准恢复隐藏仇恨含义,检测准确率达93.2%,大幅超越现有方法。
Delineate Anything v2:一种面向农田地块边界的全球基础模型
提出Delineate Anything v2,基于73M实例数据集,在100国基准上性能提升103.3%,可5.4小时完成乌克兰全国勾画。
使用混合几何注意力推进异构医学数据的多模态融合
提出CURE框架,通过HyFuse层高效融合异构医学数据,性能提升3.97%,计算成本降低87.8%。
IGGT4D:流式4D实例关联几何Transformer
在线处理视频流,统一几何与实例,构建大规模4D数据集,超越流式基线。
面向几何基础的3D基础模型的潜在黎曼流匹配
在VGGT潜在空间用黎曼流匹配于四超球面乘积流形,实现有效3D几何生成,性能优异。
文本模板Token是扩散Transformer中的隐式语义寄存器
发现结构模板Token作为隐式语义寄存器维持对象身份,提示语义间接注入;据此设计剪枝规则可减20%计算量。
点梯调优:面向3D点云理解的参数高效层次适应
PLT通过层次局部-全局融合和动态提示生成,仅用极少量参数在点云理解上达到最优性能。
ABot-World-0:在单张台式GPU上实现无限交互世界推演
提出实时长程交互视频世界模型,单GPU实现720P@16FPS流式推演,通过双向蒸馏与长程对齐保持连贯性。
解剖感知的CT心包分割三维网格精化
提出解剖感知3D网格精化框架,利用解剖和几何力迭代优化CT心包分割,提升精度,尤其对弱分割。
GATE-3D: 面向开放集三维形状检索的几何感知测试时自适应重排序
提出几何感知测试时自适应重排序,选择性融入几何信息提升3D形状检索,mAP@10提高2.00点,几何假阳性降低10.8%。
FlexiAvatar:任意身体可见度下的统一三维高斯人体化身
仅优化可见身体区域以消除未观察肢体伪影,借助扩散补全不可见区域,PSNR平均提升约3%。
CR-Refiner:面向编辑条件三维场景检索的以对象为中心的最优传输重排序器
提出CR-Refiner,基于最优传输和LLM的免训练重排序器,提升编辑条件3D检索,并发布新基准3D-CER。
GLID: 门控局部本征维度修复人脸伪造检测器的盲点
GLID通过冻结视觉Transformer的局部本征维度几何信号,无需训练数据即可提升跨生成器检测性能,平均AUC达0.805。
OmniReasoner:通过原生工具实现长音频-视频推理
OmniReasoner让模型先低成本预览,再按需高保真检查,提升长音视频推理准确性与时间定位。
掩码视觉动作:统一世界建模
提出掩码视觉动作的像素控制接口,15小时微调实现视觉保真与可控,用于策略评估、规划与逆向建模。
外观指针——扩散变换器的多模态区域控制
提出外观指针,实现扩散变换器的多模态区域控制,无需重新训练,性能达先进水平。
ExpertVerse: 面向知识密集型视觉合成中专家级推理的通用基准
构建ExpertVerse基准,评估生成模型知识密集型推理,训练KnowThinker并优化,揭示推理缺陷。
置信门控的纯视觉航向对齐用于无人机-无人车协同系统
提出置信门控框架,用面积和航向变化作代理,有界混合回退改善低置信时命令行为。
PathAgentBench:在全切片病理图像上评估证据探寻型视觉语言模型的基准
介绍PathAgentBench基准,评估四种能力,发现模型从全切片图像直接获取证据仍有显著差距。
无需训练,飞行更优:无人机导航的测试时缩放视觉语言模型
测试时缩放通过迭代细化与自修正,无需训练即提升无人机导航VLMs的规划准确性与安全性,达到SOTA。
潜在空间中的ERank作为图像复杂性和丰富度度量
ERank通过深度特征通道协方差的有效秩无标签度量图像丰富度,与人类复杂度高度相关(r=0.72),用于数据选择提升超分辨率与OCR性能。
InstructMixup:指令引导的显著补丁编辑以实现鲁棒数据增强
InstructMixup在单样本内用指令引导编辑显著补丁并混合,注入分形结构,实现鲁棒数据增强,性能超越多种方法。
高效学习图像压缩的波前并行化
提出无训练推理加速算法,波前并行优化自回归模型推理,加速超13倍且保持率失真性能。
Sarus:基于同态加密的隐私保护多供应商感知融合
Sarus框架利用同态加密实现多供应商感知融合的隐私保护,在加密域聚合检测结果,线性扩展且提升覆盖。
NGPS:基于深度卫星图像匹配与多速率传感器融合的无GPS空中地理定位与2.5D重建
提出NGPS框架,通过深度图像匹配与多传感器融合实现无人机无GPS绝对定位,位置RMSE仅2.94m,较单目VIO提升3.5倍,实时运行。
ROMS-IMLE:极简主义竞争性单步生成建模方法
提出极简单步生成模型,摒弃迭代去噪,用IMLE和卷积网络快速生成高质量样本,FID达2.56。
EAR-Net:从多视图图像实现端到端绝对旋转估计
提出端到端EAR-Net,通过共极置信图与可微旋转平均模块估计绝对旋转,精度速度大幅领先现有方法。
从距离到轨迹:无人机实时符号距离函数建图与距离加速运动规划
提出OREN-SDF建图和Bubble*规划,实现无人机实时避障,速度提升数倍。
基于结构化场景知识与可验证推理-动作一致性的自动驾驶认知双过程规划
提出认知双过程规划框架,以结构化链式思维表示场景知识,自动生成监督,路由快速/慢速推理并用规则验证一致性,实现80.14%精度与17.39%延迟降低。
PoseIDON:利用基础模型特征进行六自由度姿态估计的海底沉积物掩埋测绘
提出PoseIDON方法,结合基础模型与多视角摄影测量,实现海底物体掩埋深度估算,误差约10厘米,支持非侵入性环境评估。
使用扩散模型去噪蒙特卡洛渲染
扩散模型成功去噪蒙特卡洛渲染,可基于自然渲染信息条件化,性能达SOTA,生成具真实感的重建(直阴影、弯高光、无飞蚊)。
IBoxCLA: 通过改进的Box-dice和对比潜在锚点实现鲁棒框监督息肉分割
IBoxCLA解耦位置/尺寸与形状学习,结合改进Box-dice和对比潜在锚点,实现鲁棒框监督息肉分割,mDice/mIoU提升6.5%/7.5%。
AIM-CoT:主动信息驱动多模态思维链用于视觉-语言推理
提出AIM-CoT框架,通过主动信息驱动和动态触发,提升多模态思维链的视觉推理性能。
Great X:面向6G的弥合Sim2Real差距的统一多模态模拟器
Great-X是虚幻引擎实现的统一多模态模拟器,提供像素级同步数据,有效弥合Sim2Real差距,性能优于现有方案。
阅读还是忽略?视觉-语言模型中排版攻击鲁棒性与文本识别的统一基准
提出RIO-VQA任务与RIO-Bench,揭示防御中目标识别与文本阅读的权衡,提供数据驱动基线改善两者。
用于细节敏感且成本高效的U-Net变体解码器的SUPER模块
SUPER模块以小波域频率抑制替代空间上采样,在提升细节精度的同时大幅降低解码器计算成本。
3D疼痛:生成可控合成面部用于自动疼痛评估
提出3DPain合成数据集及ViTPain模型,通过可控面部生成与身份感知注意力,解决疼痛评估中的数据稀缺与偏差问题。
连续上下文:基于指令图像编辑的连续强度控制
提出通过标量强度实现编辑效果从无到有的连续控制,无需特定属性训练。
FedS2R:面向自动驾驶合成到真实语义分割的单次联邦域泛化
提出首个单次联邦域泛化框架FedS2R,通过数据增强与知识蒸馏实现合成到真实语义分割,全局模型性能接近集中式训练。
玻璃表面检测:利用闪光/无闪图像中的反射动态
提出NFGlassNet,利用闪光/无闪图像的反射动态,含反射对比挖掘与注意力模块,玻璃检测性能超越现有方法。