利用大型重建模型重建交互中的人与物体
提出MILO框架,利用大型重建模型从单图重建3D人-物交互,凭借几何结构先验简化流程,精度优于现有方法。
StreamAV-Bench:流式音视频生成的综合基准
首个流式音视频生成基准,含渐进与交互双轨,评测13系统,发现时序漂移与交互瓶颈。
利用无人机非精确异步离散GPS轨迹的相机标定
针对GPS轨迹不精确、异步离散,用迭代最小二乘估计相机姿态,推荐轨迹使标定精度达测量误差14%。
Dose-PlanNet:基于物理的深度学习放疗剂量预测
物理引导的3D深度学习预测前列腺放疗剂量,靶区覆盖相当,危机器官保护改善,多数计划达标,加速工作流。
超越试验场:基于LiDAR的辅助车道变更系统独立公共道路测试
基于LiDAR在法国A31高速独立测试辅助车道变更系统,对比UNECE R79,发现部分操作不满足安全距离要求。
UrbanGround:从局部感知到真实尺度城市中的空间能动性
提出UrbanGround城市沙盒,测试多模态大模型。局部感知尚可,但长程导航错误累积,无法持续目标导向行为。
检索头遇见视觉:揭示VLM如何定位与提取视觉信息
发现视觉检索头(约2%注意力头)负责将文本定位到图像区域,屏蔽它们使定位准确率骤降80%,且跨任务、跨模型通用。
TrapVLA:诱使视觉-语言-动作模型陷入配置故障模式
提出配置故障诱捕后门攻击:VLA模型受文本触发执行特定失败行为,TrapVLA学习动作残差实现。
RTNav:迈向实时零样本目标导航
提出RTNav实时零样本目标导航,考虑推理延迟与异步步进,HM3D成功率+11%,SCT+5.1点
面向鲁棒音视频语音识别的对比解码注意力引导可靠性缩放
提出可靠性感知的对比解码缩放,依据注意力动态和预测差异自适应调节强度,在LRS3上提升干净与低信噪比下的AVSR性能。
4DSynth:面向动态具身模拟的可控程序化世界合成
提出4DSynth,从文本/掩码/照片生成可编辑4D环境,支持动画、轨迹和物理仿真;生成的导航基准显示现有VLM任务失败率高。
Knowledge Distillation Driven Semantic NOMA with GAN Refinement for 6G Robotic Vehicle Networks
面向大规模全切片图像嵌入提取的解耦I/O主导流水线
解耦I/O流水线分离数据移动与计算,实现大规模全切片图像嵌入高效提取,存储主导,视为数据密集问题。
实验室物体沉浸式可视化的三维重建方法比较评估
比较四种三维重建法制作实验室全息模型,神经辐射场最佳,能处理透明/反射/低纹理物体,支持沉浸式教学。
CLAP:跨具身视频世界模型是零样本物理模拟器
CLAP跨具身视频世界模型,统一动作空间,零样本物理模拟,性能领先。
How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space
时间锚定的语言生成:迈向实时视觉-语言模型
提出时间锚定语言生成任务与TRACE指标,构建时间同步交错模型VLM-TSI,实现实时视觉语言生成。
基于基础模型迁移的锂离子正极裂纹数据高效量化
基础模型迁移实现锂离子正极裂纹的高效量化,稀疏标注即可获得群体级统计,单张图像评估退化。
ANTShapes:基于事件的神经形态物体分类基准数据集
用ANTShapes创建四个事件视觉数据集,经卷积脉冲网络基准测试,确认其适用性。
超越离散样本:高信息密度回放用于高效终身行人重识别
高信息密度回放:历史数据压缩为固定预算记忆,用复杂度分配、度量凝练与跨模态适应,提升终身行人重识别泛化并降本。
GSM8K-V:视觉语言模型能否在视觉情境中解决小学数学应用题?
提出GSM8K-V视觉数学基准;最强模型仅59%,人类91%;主要瓶颈是隐含视觉推理错误。
高频优先:改进图像隐式神经表示的两阶段方法
高频优先两阶段训练,用软掩码加权细节像素,后全图训练,提升隐式神经表示重建质量,缓解频谱偏差。
面向城市语义分割的低投入训练数据生成框架
利用扩散模型和伪标签适配目标域,将低成本语义图转为高保真图像,提升城市分割精度达8个百分点。
DOD-SA:单模态标注下的红外-可见光解耦目标检测
提出一种仅用单模态标注的红外-可见光解耦检测框架,通过协同师生网络与渐进训练降低标注成本。
EgoSurg:基于环境相机的手术室工作流第一人称回放的任意视点合成
EgoSurg利用环境相机重建手术室动态场景,合成任意角色视角,无创且支持安全回顾与培训。
ReSplat:循环高斯泼溅学习
提出循环高斯泼溅模型,利用渲染误差作反馈迭代优化高斯,无需梯度,适应多视图多分辨率,高效且SOTA。
多变量扩散Transformer解耦注意力用于高保真掩码-文本协同人脸生成
提出MDiTFace扩散Transformer,统一处理掩码与文本,用解耦注意力分离动态/静态路径,缓存复用静态特征,降低掩码计算开销94%以上,提升人脸保真度与条件一致性。
基于注视的身份认证:影响认证性能的因素
研究基于注视的身份认证关键因素,基于8849名受试者数据,分析信号质量、校准及滤波对认证性能的影响。
FLAT:用于MRI重建的展开网络的流对齐训练
提出FLAT方法,将展开网络与流匹配轨迹对齐,提升级联稳定性与重建质量。
三维与二维圆心精确测量及其在激光雷达-相机外参标定中的应用
提出基于共形几何代数与RANSAC的三维圆心估计及弦长方差二维圆心估计,提升激光雷达-相机外参标定精度。
融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人田间验证
提出H2MAF,融合决策级CNN与多模态大模型,在真实田间取得约99%准确率,但依赖校准。
商业果园早期解剖结构绿果分类的轻量级多模态视觉-语言框架
基于TinyCLIP的轻量级框架分类苹果幼果解剖结构,宏F1达0.93,支持边缘部署。
融合局部地理环境特征与空间上下文提升滑坡易发性制图
提出LGSCF融合策略,结合局部地理环境与空间上下文,提升滑坡易发性制图精度。
降低AI驱动检测门槛:自动化结构缺陷检测的无代码工作流
提出无代码工具YOLOEZ,集成标注、训练与推理,性能优于传统方法,降低AI结构检测门槛。
SHIFT-LLM:深度剪枝大语言模型中的分布偏移校正
训练后无需微调,用线性残差适配器校正深度剪枝引起的分布偏移,闭式最小二乘校准,零梯度,最多提升15.7个准确率点。
RefLAM:基于参考文本的历史阿拉伯语手稿行标注流水线
RefLAM流水线将手稿图像与转录转为可验证行级标注,满分100可证明正确,提速75倍,发布AraMS-28k数据集。
针对LLaVA中物体幻觉背后的注意力头
针对LLaVA物体幻觉,锁定32个注意力头干预,CHAIRs由0.37降至0.23,证实头部选择有效。
音视频同步度量指标到底在衡量什么?
联合审计音视频同步指标发现:各指标侧重不同,互不一致;建议用可靠性卡报告,而非单一分数。
看得更多,检测更少?遏制多视角异常检测中的信息泄漏
多视角融合引发信息泄漏,损害重建检测;GLAD框架以受限融合+注意力机制,实现多视角异常检测SOTA。
采集偏移下,冻结的血液学基础模型可信吗?
冻结血液学基础模型域内饱和,跨域准确率与校准崩坏,需审计准确率、校准、暴露及类先验鲁棒性。
CoRE:驾驶视频中弱监督由粗到细的风险证据学习
驾驶风险随时间演变且有场景实体支撑,但监督仅限粗粒度视频级标签。
Lightweight Machine Learning-Driven Monocular Sidewalk Path Extraction for Embedded Micromobility Navigation
OpenCVL:面向细粒度跨视角定位的开放多样大规模数据集
提出OpenCVL,61.7万组跨视角图像对覆盖欧洲4国41城,融合高精传感器及野外图像,纠正噪声标注,提升细粒度定位性能。
WAVE:反转引导层级实现从粗到细的引导深度超分辨率
WAVE利用多级小波变换反转粗到细引导层级,分离高低频并语义门控,提升深度超分辨率,尤其高倍率。
MulVec:面向免训练零样本组合图像检索的细粒度角色感知匹配
提出角色感知方法MulVec,将查询分解为全局与局部角色向量,分角色匹配后加权排序,无需训练即可提升零样本组合检索精度。
V-Link:在动作DiT中恢复视觉-语言-动作模型丢失的视觉表征
V-Link通过空间与语义查询恢复丢失视觉表征并注入动作DiT,大幅提升机器人操作成功率。
PointRL:从可验证标注证据中学习点级视觉-语言定位
PointRL用可验证标注作为隐藏证据,通过强化学习训练点级定位,奖励评估覆盖率与数量一致性,在PointArena提升9.5%。
并非所有注意力头都有助于关键视觉标记的选择:头感知剪枝更重要
关键视觉标记的选择能力集中在少数注意力头;据此提出头感知剪枝,先按相似度剪冗余再剪,性能效率兼得。
医学视觉语言模型在放射学中学到了什么?分布偏移下的迁移、对齐与源代理泄漏
医学VLM在分布偏移下出现盲点:迁移低、配对检索低、源代理泄漏;自监督初始化优于监督,对抗适应不稳定,需压力测试。
GraftSR:凭借同实例引导,为真实世界图像超分辨率嫁接真实纹理
提出GraftSR:同实例参考引导嫁接真实纹理,双掩码机制解耦注入,构建数据集,达SOTA,LPIPS降20.2%。