LaST-SR:拉普拉斯启发的稳态-瞬态复频分解用于单图像超分辨率
提出复频分解模块,联合全局傅里叶与局部复频分支,并设计稳态-瞬态协同聚合,在五个基准上取得最优超分性能。
KSG-Net:面向海上三维船舶检测的关键稀疏与全局上下文学习
用关键稀疏多尺度聚合与全局上下文学习,提升海上三维船舶检测,尤其改善小稀疏船和大船,性能优于现有方法。
DPA:解耦产品无关异常表示用于零样本异常生成
提出DPA,用源产品真实异常迁移生成目标异常,解耦产品无关表示,生成逼真异常,提升零样本/少样本检测性能。
面向无源缺失模态适应的测试时Logit提示
提出测试时逻辑提示法,无需源数据,针对缺失模态,用不确定性调整与一致性正则,少量参数即提升性能。
SelfLift:通过自恢复分辨率过渡加速少步扩散
提出自恢复渐进分辨率方法,用生成模型自身信号修复过渡误差,显著降低少步扩散端到端延迟。
GeoStore:在大场景中寻找小店面——采用全局到局部非对称匹配的细粒度POI定位基准
提出首个细粒度POI定位基准GeoStore,揭示全局描述符局限;提出GLAM非对称匹配,性能更优。
TAME:面向文本-视频检索的时间感知混合专家模型
提出时间感知混合专家模型TAME,结合帧级专家路由、帧时间令牌与跨时间交互,提升文本-视频检索性能。
面向文本中心图像取证的证据引导检测、定位与解释
针对AIGC文本篡改取证,提出证据引导的检测-定位-解释系统,级联证据流提升定位与报告一致性,获ACMMM2026挑战赛第二名。
LeakageBench:文档图像中个人信息脱敏的文档级泄漏风险评估
现有PII基准多基于文本,忽略文档图像脱敏风险。LeakageBench含500张文档图像及11954个标注,评估显示工具提升定位但页面级泄漏仍高达0.968。
疾病负担重于肤色:解析皮肤病学AI泛化差距
疾病分布偏移比肤色更影响泛化;癌症模型遇新病种准确率大降;每类约十例标注即可恢复大部分性能。
渲染在环:面向交互式网页开发的执行驱动智能体
执行驱动智能体以渲染在环方式,从运行时交互反馈迭代编辑代码,同时提升交互正确性与视觉保真度。
计算病理学中全模态切片表示学习的协同信息解耦
提出协同信息解耦框架,基于部分信息分解抑制冗余并最大化跨模态协同,病理少样本任务表现优异。
点监督变化检测的渐进式伪标签优化
两阶段渐进伪标签优化:分割模型生成筛选双时相掩膜,师生自训练迭代优化,在三个数据集胜过弱监督。
世界一致性解码:面向世界动作模型的自我验证式测试时规划
提出世界一致性解码,用内部生成信号筛选未来假设并借执行反馈训练预测器,不更新模型即提升任务成功率。
通用视觉语言模型用于多光谱与SAR图像理解的轻量级适配
将多光谱与SAR数据渲染为多视图,用LoRA适配通用VLM,即可实现高性能,无需训练新模型。
CC-4DGS:面向存储高效的动态高斯溅射的计算变形与点云压缩
采用计算变形场与点云压缩,动态高斯溅射存储降至二十至三十兆,画质与实时渲染不变。
SAUF-Net:基于不确定性反馈的结构-外观表征学习用于半监督医学图像分割
提出SAUF-Net,通过解耦结构与外观表征、融合交换一致性及不确定性反馈,在半监督医学图像分割中优于现有方法,尤其低标注场景。
多结构超低场儿科脑MRI分割的非对称配对标注学习
AURA基于nnU-Net非对称监督融合高低场标注,集成Dice达0.7988,HD95为1.8892。
FuDU:面向工业缺陷检测流式主动学习的模糊双维度不确定性框架
提出模糊双维度不确定性框架,融合图像级与框级不确定性,用于流式主动学习,提升工业缺陷检测可靠性。
InfraPatch:针对红外自适应视觉语言模型的跨任务目标灰度补丁攻击
InfraPatch用5%局部灰度补丁对红外视觉语言模型实施跨任务目标攻击,成功率86%-100%,揭示其脆弱性。
本地化语义控制文生图基准T2LSC-Bench
现有文生图基准忽视目标文本语义泄漏问题。新基准T2LSC-Bench评估六模型7160图,发现准确渲染文本不代表语义被局部约束,泄漏率可升至18.1%,抗泄漏提示可将其减半。
用于联合k-q弥散磁共振重建的扩散编码高斯场
提出空间角度高斯场,用共享三维原语的连续q条件响应,自监督欠采样k空间优化,提升缺失方向弥散重建。
信号还是噪声?审计医学与航空影像中旋转引发的显著性漂移
旋转导致的显著图漂移来自分类器丢弃的空间信息;多视角逆旋平均可提升等变性,无需重训即得一致解释。
基于自回归有序笔画实例预测的手写轨迹恢复
提出两阶段框架,先自回归恢复有序笔画实例,再重建连续笔内运动;优于现有基线,并泛化至未见汉字及英、泰米尔文。
RouteGraph-Mona:用于矿物图像分类的混淆感知路由微调
提出RouteGraph-Mona,用自适应路由替代静态聚合,结合类锚与混淆加权间隔,提升矿物图像分类精度。
MAOL:面向细粒度工业缺陷严重度分级的形态感知有序学习
提出形态感知有序学习MAOL,用自适应阈值与预测感知训练应对两阶段噪声,细粒度缺陷分级性能优,挑战赛第三。
若它移动,雷达便知晓:物理感知的雷达Transformer用于类别无关运动目标检测
提出全稀疏雷达检测器PART,仅110万参数,利用多普勒物理特性实现类别无关运动目标检测,nuScenes上CA-AP达0.8827,对罕见目标召回0.9203。
VoRTeC:驾驭基础流实现一步式实时视频压缩
提出基于基础流模型的视频压缩框架,实现一步解码与高保真重建,大幅降低比特率并显著提升解码速度。
TempoGround:基于视觉语言模型的状态感知流式视觉定位
提出状态感知的流式视觉定位框架,利用跨帧关联和强化学习,解决身份漂移与不一致,大幅提升二维与三维定位精度。
基于GenAI图像编辑的域偏移鲁棒目标检测
生成式图像编辑可模拟域偏移,添加伪装增强训练,显著提升目标检测对树叶、网及多光谱伪装的鲁棒性。
面向驾驶VLA的跨本体零样本迁移
提出鸟瞰强制辅助任务,将路面物体布局注入VLA,少量摄像机组时提升内外分布表现,但随本体数量增加收益下降。
ORB-SVM:一种基于MRI扫描高效检测脑肿瘤的创新混合框架
利用ORB特征提取与SVM分类,实现约99.5%数据缩减,在Br35H上准确率达97.5%,资源高效。
YesTrack:基于多模态大语言模型“是/否”验证的指代多目标跟踪
提出新方法,将指代多目标跟踪转为判别式任务,用多模态大模型做是/否验证,加时序约束,高效超越现有方法。
结构化先验引导的物理一致性扩散修复用于交通标志增强
提出物理一致的结构化先验扩散修复,融合语义、外观、几何先验,显著提升交通标志重建与罕见类检测。
GlyphAnchor:基于位置锚定字形先验的视觉文本渲染增强
提出GlyphAnchor,以位置锚定字形补丁条件增强扩散Transformer文本渲染,经分阶段微调和文本感知后训练,提升文本保真度并保持图像质量。
LookStep:语言前瞻与事件驱动记忆的高效视觉语言导航
LookStep以语言前瞻与事件驱动记忆实现高效VLN,VLN-CE上49.7%成功率超越现有方法。
无线胶囊内镜图像的基于Transformer的无监督超分辨率方法UnCapsTSR
提出无监督Transformer生成对抗网络,提升无线胶囊内镜图像分辨率,无需真实低-高分辨率对,引入新指标EndoQM,较现有方法提升40%-80%。
视觉目标检测中的信息密度不均衡
信息密度不均衡可解释目标检测类别偏差:信息密度与精度负相关;据此改进三种损失函数,能降低偏差并提升整体性能。
CA-OPD:面向结构化视觉预测的置信度感知同策略蒸馏
提出置信度感知同策略蒸馏,用教师置信度选择性纠正不可靠预测,并让监督与干预对齐,显著提升结构化视觉预测。
ProSR:语义原型引导的离散建模,用于物理一致的SAR超分辨率
语义原型引导的离散超分:在量化潜空间保留散射脉冲特性,自监督解耦高频细节,基准图像质量与物理一致性更优。
适配基础模型用于月球表面高度估计
提出微调DAV2模型,利用SPG生成DEM数据,显著提升月球表面相对高度估计性能,优于零样本模型。
报告者未言明的诊断:为脑肿瘤MRI报告揭示冻结肿瘤特征
脑瘤报告生成器常沉默误诊,但冻结特征藏有诊断信号;神经融合系统利用它恢复诊断,提速数倍且质量更优。
不确定性引导的恶劣天气复原:基于门控Transformer网络
提出恶劣天气复原网络UAR-Net,用门控Transformer与平衡多尺度连接处理异质退化,不确定性感知+亮度损失达SOTA。
WiFlow:利用WiFi信道状态信息估计光流
提出利用WiFi信道状态信息估计光流的方法WiFlow,创建首个数据集并探索精度与复杂度的权衡。
从特权目标外观中学习跟踪
提出特权外观迁移师生训练框架:以当前、未来帧真值外观监督学生跟踪器,推理时无需特权,多项基准精度提升。
VIPS:基于伪仿真的车路协同规划基准
提出基于伪仿真的车路协同规划基准及稀疏表征框架,融合车辆与基础设施观测,实现可扩展的鲁棒性与误差传播评估。
MARS:多模态大语言模型中隐藏了哪些用于文本-视频检索的检索信号?
提出多层级多槽位嵌入框架MARS,结合难负样本感知槽位特化,在文本-视频检索中取得最优性能。
面向表演者无关身体动作情绪识别的正交集成与经过检验的解释
正交集成十一模型提升表演者无关情绪识别,解释测试证实依赖身体区域运动,与LMA吻合,时间显著性弥散。
概念融合:评测文本到图像模型中的视觉隐喻生成
提出首个视觉隐喻生成基准,用一千五百个样本与多级评测,证实当前最强文生图模型也难以实现跨域映射。
真实场景UGC增强图像的细粒度异常感知:综合数据集与差分融合框架
提出UGC增强图像异常感知任务及UEAP-4k数据集,差分融合方法DFAP-UGC结合动态训练策略,精准检测局部异常。