UAV3DCrop:重复多角度无人机作物调查中的三维重建基准测试
构建重复多角度无人机作物三维重建基准,揭示现有方法在表观、几何与冠层高度上各有优劣,且多模型尺度不准。
面向多模态卫星影像稀疏森林高度估计的深度证据回归
用深度证据回归从多模态影像估计稀疏森林高度,引入掩膜损失,精度与U-Net相当并提供校准的不确定性。
InsertFuse:多类别参考引导图像插入的统一框架
提出统一框架,解耦专家学习并蒸馏整合,结合几何条件化,实现多类别参考引导图像插入,性能领先。
破坏注意力:基于逃逸的对抗攻击针对检测Transformer编码器注意力
首次直接优化编码器注意力目标,以不可感知扰动大幅降低DETR与DINO检测性能,优于现有攻击4倍,且多种目标均有效。
超越《星月夜》:面向艺术家风格文本到图像生成的捷径感知控制状态规划
针对模型对艺术家名字走捷径问题,提出Atelier框架,将模糊意图转为显式控制状态,规避捷径,显著提升风格保真与结构保留。
PAST:面向高效扩散模型的提示自适应采样终止
提出PAST,用内在奖励补偿稀疏外部奖励,依据去噪进度和提示难度自适应终止训练,提升RL微调效率与质量。
抑制与多样化:精炼鲁棒路径以提升损坏鲁棒性
首探计算路径显式刻画内部鲁棒性,发现特征逐层衰减,提出非侵入式S&D方法动态选择并多样化鲁棒路径,零测试开销,多任务稳定提升。
WaveFreqAnchor:基于波结构锚定与频率校正扩散的无训练人脸复原
提出一种无训练人脸复原框架,以波结构锚定保持身份,用频率校正恢复细节,性能优于现有方法。
AnyTrack:统一任意模态的视觉目标跟踪
提出统一框架AnyTrack,支持任意模态组合,应对模态缺失,提升泛化,实现多模态跟踪最优性能。
CoDAT:低成本时序建模的协作双注意力Transformer,用于高效边缘动作识别
CoDAT以协作双注意力与无参时序建模,在边缘设备上实现高效动作识别,速度提升数倍且精度保持。
UniCycleFlow:基于共享修正流的双向无配对图像翻译
提出共享修正流框架,用单一速度场实现双向无配对翻译,对抗匹配域边界,多正则约束,7/10任务FID最优。
GraphVerse:面向多模态大语言模型的全面视觉图推理基准
提出GraphVerse基准,通过图像编辑策略与过程敏感评分,全面评估多模态大模型的视觉图推理能力。
探索还是收敛?扩散模型的阶段引导逐步优化
SGPO阶段化优化:早期脱混沌,中期平衡,后期收敛,生成质量+26.7%,收敛速度+36.7%。
HazeSpikeMamba:耦合脉冲启发与状态空间特征用于自监督真实世界去雾
提出HazeSpikeMamba,结合脉冲耦合局部与状态空间全局特征,用冻结退化网络在无标签真实雾图上自监督适应,提升去雾指标。
GOPI:面向生成的单视角RGB-D室内场景家具插入三维姿态推断
提出GOPI两阶段法:迭代推断几何合理3D位姿,并投影约束引导图像生成,提升家具插入一致性。
ECAD:超越以实体为中心的对象性,扩展类无关检测
提出面向非实体元素的类无关检测扩展,构建基准与检测器并验证有效性。
突破基础:面向全合一图像复原的退化感知可变形标记化
FIT:退化感知可变形标记化贯穿全流程,五/三退化SOTA,PSNR 30.72/32.83dB。
DAEP:面向医学视频语料时间答案定位的难度感知证据规划
提出DAEP方法,利用难度感知证据规划,在视频语料时间答案定位任务中获第一,平均分0.2728。
FedVAR:原型对齐的联邦视频异常识别框架
提出原型对齐的联邦学习框架,利用视觉语言模型缓解视频异常识别中的语义错位,实现细粒度识别,优于现有方法。
ControlRef:基于锚定4D-RoPE的高效布局引导多实例生成
ControlRef通过UILC掩码与锚定4D-RoPE实现精准多实例生成,降低80%延迟与50%内存开销。
用于可泛化深度伪造视频检测的多智能体取证推理
构建十万视频、三十三种伪造方法基准,提出多智能体取证推理,性能超越闭源大模型。
AdvTiles:基于可学习瓦片的物理对抗伪装服装,用于抵御人体检测器
提出可学习瓦片物理对抗伪装框架,联合优化图案与布局,平均攻击成功率86.2%,优于现有方法。
RegionDet:超越目标实例的区域检测基准
提出区域检测基准(8类)。闭集检测器可学,开放词汇检测器因物体中心偏差表现差,边界弱,上下文依赖。
一次剪枝:面向视觉语言模型的免重训练任务无关剪枝
提出PORTA,基于激活变化任务无关剪枝,免重训练,自适应稀疏分配,高效压缩视觉语言模型。
AVCap:利用细节感知奖励强化音视频联合描述
针对音视频联合描述数据稀缺、奖励粗糙等问题,提出高质量数据集AVCap-100K、模型AVCap及基准AVCap-Bench,实现原子级细节评估并达最优性能。
先摘要,后下载:星载视觉语言模型实现带宽高效地球观测
先摘要后下载范式:星载视觉语言模型生成摘要,地面提问验证,仅关键信息下载全分辨率影像,省带宽、提时效。
RibAssist 3D:基于CT投影的双平面肋骨骨折检测、定位与选择性三维定位
双平面投影可精确重建肋骨骨折三维点,但对应匹配是瓶颈;选择性输出几何准确,假阳性低。
MaskFlow:精确、一致且无缝的区域图像编辑
提出MaskFlow训练框架,将掩码融入概率路径,实现精确区域编辑与背景保持,Soft-Poisson去缝模块平滑过渡,并构建MEData数据集,效果优于现有方法。
MuST-VAD:面向视频异常检测的相互结构化学习
提出互学习框架,检测器与LVLM双向更新,UCF-Crime上AP42.46%,超SOTA4.13点。
在文本中去偏,相信你的眼睛:面向视觉反常识推理的文本锚定跨模态迁移
视觉推理瓶颈在语言解码器偏向常识先验,文本锚定后训练可去偏,无需视觉数据即可提升反常识推理。
Vernata:激光雷达点表示的自监督学习
提出多模态多教师蒸馏框架Vernata,用于LiDAR点云自监督,含稀疏视图增强、记忆库与跨模态蒸馏,性能显著超越Sonata基线。
双空间模态一致性学习用于通用跨模态重识别
提出DSMCL框架,联合空间与频域一致性学习,解决跨模态ReID频域差异与泛化问题,显著提升多基线性能。
恶劣天气去除的退化感知跨模态补偿提示学习
提出退化感知跨模态提示补偿网络,融合视觉语言先验,对齐语义与结构特征,提升恶劣天气恢复效果。
单一模态不够时:基于航拍RGB-热成像视频的马鹿性别与生命阶段多模态分类
融合RGB与热成像多模态,用DINOv3特征分类马鹿性别与年龄,准确率96%,优于单传感器。
Scenix:基于可执行场景程序的稀疏视图3D场景重建
Scenix用可执行程序从稀疏视图重建可编辑3D场景,含感知实例化与闭环空间优化。
生成式嵌入基准:稠密嵌入中留存多少信息?
新基准GEB用生成式读取检验嵌入可恢复信息量,发现现有多模态嵌入存在信息瓶颈,分离性评估无法揭示。
用于即插即用扩散图像恢复的局部认知不确定性引导主动采样
提出局部认知不确定性引导的主动采样,用于扩散图像恢复,增强细节并加速收敛,即插即用。
先理解后检测:面向全域红外小目标检测的视觉-语言学习
提出“先理解后检测”范式,用语言监督学习跨域红外表示,构建多模态数据集,实现全域红外小目标检测。
HRDiT:基于现成扩散Transformer模型的免训练高分辨率图像生成
提出免训练方法,适配现成DiT模型生成高分辨率图像,解决空间无序与耗时问题。
KnifeHunter:面向执法场景细粒度刀具图像检索的结构化局部表示学习
提出KnifeHunter系统与CoRe-Net模型,含5.4万图像数据集,在执法测试中达99.2%首位命中率,实现细粒度刀具检索。
稳定曲线,不稳定条目:视频大语言模型中的条目级缩放异质性
聚合曲线掩盖条目级异质性;无单一视觉预算适用于所有条目;条目级预言机增益与回归并存,置信级联可降成本保精度。
YOLO-PEFT:面向YOLO系列的参数高效微调
提出YOLO-PEFT结构感知框架,将适配器布局建模为可审计约束规划;在YOLO11/12上优于全量微调,显存省43.9%但耗时增1.72倍;未知架构拒绝仍待验证。
计算病理学中测试时适应的解释稳定性:大规模基准
测试时适应解释稳定性与精度弱相关;冻结骨干最稳,持续法漂移大,CNN更敏感;应作为独立评估轴。
随机皮层自重构的跨人群迁移
随机皮层自重构模型从UKB迁移至中国人群,微调SUNet最佳,AUC达0.848,跨人群泛化稳健。
RoRA:面向角色的区域分配用于多模态大语言模型视觉标记剪枝
提出训练无关视觉标记剪枝框架,按角色区域分配,优于基线,高压缩下保持精度并显著提速。
CANIS:通过图像-语义桥的生成辅助3D规范化
提出CANIS框架,利用图像到3D生成模型的语义先验,经图像-语义桥实现无训练3D规范化,提升下游任务。
超越流畅性:脊柱MRI报告生成的临床基准与异常增强基线
现有指标难反映诊断正确性,提出用半监督U-Net++生成椎间盘异常热图增强VLM输入,提升解剖敏感性与临床可解释性。
几何感知的支气管镜相机定位
提出GABL框架融合术前几何先验与术中视频实现高精度实时支气管镜定位误差降低速度提升4倍
多假设光流估计用于匹配模糊下的视频帧插值
针对匹配模糊区域,提出多假设光流框架,保留Top-K候选对应,经可靠性路由选择,提升帧插值感知质量。
InstanceSplat:面向场景理解的实例感知前馈3D高斯泼溅
提出统一前馈3DGS框架,从无位姿多视图图像联合重建与实例感知理解,性能SOTA。