CSG-Mamba:用于内镜息肉分割的卷积评分门控视觉状态空间网络
提出CSG-Mamba,以卷积评分门控增强状态空间模型,内镜息肉分割优于基线。
概念引导:文本到图像生成的精确、免训练潜在控制
提出概念引导法CoG:利用概念相关层信息加权引导去噪,免训练精确控制,提升图像生成性能。
SCVIB:面向多轮个性化定位的可编辑状态条件视觉实例绑定
提出SCVIB与TT-VG,将多轮个性化定位准确率提升至70.27%,揭示利用已解析支持证据是关键。
自监督视觉同策略蒸馏
提出自监督视觉同策略蒸馏法,用不对称增强视图构建学习信号,无需特权信息,在六个细粒度基准上显著提升性能。
RankT2I:用于发现文本到图像模型中可解释且多样化语义的子模框架
提出RankT2I,一种无需训练、模型无关的框架,用子模目标自动发现可编辑且多样的语义,超越现有方法。
基于骨架的零样本动作预判
提出零样本骨架动作预判任务,构建基准与基线模型,通过互信息最大化实现未见类动作识别。
手术内镜视频中时序视觉语言模型的鲁棒性研究
提出内镜C6基准,评估时序视觉语言模型鲁棒性,发现严重崩溃,轻量微调显著提升。
AppleScab-LT:面向时序病害进展分析的真实田间苹果黑星病纵向数据集
提出苹果黑星病真实田间纵向数据集,重复追踪同一病叶,含21个序列、2101图像,支持时序进展分析。
空间语言消息传递用于病理图像解读
提出空间语言消息传递框架,在语言空间中聚合相邻图块的病理描述,提升肿瘤描述准确率3.3-19.6个百分点,无需微调即可增强通用多模态大模型的空间推理能力。
哨兵一号SAR影像中极地低压的弱监督分割
提出CREST框架,仅用图像级标签生成分割掩码,通过约束扩展与动态引导损失提升极地低压及类似连通目标的分割质量。
CRAFT:基于注意力微调的约束奖励,实现无合成目标的主题个性化
提出CRAFT,仅用1万参考图和注意力奖励微调,无需合成目标,在主题个性化任务上达到SOTA。
基于条件神经最优传输的分子结构预测细胞表型
提出分子条件神经最优传输模型,从分子结构与阴性对照表型预测细胞表型,优于基线,分子编码器是泛化瓶颈。
IRGNN:面向雷达点云目标检测的高效不变式雷达图神经网络
提出不变雷达图神经网络,以不变特征重构点云为图,改进消息传递,检测性能优且计算内存开销低。
GBU-Palm:手掌呈现攻击检测的多模态视频数据集与基准
构建大规模手掌PAD多模态视频数据集,跨6环境,发现环境迁移下性能下降,RGB-NIR融合非恒优于RGB。
TRIAGE:风险控制伪标签准入机制用于标注高效半监督视网膜OCT分类
提出风险控制半监督框架TRIAGE,以患者级风险控制器和不对称代价矩阵生成伪标签,仅用20%标注数据即达89.66%准确率,显著优于现有方法。
基于二维平面图的机电管道(MEP)指标智能检测
用Mask RCNN自动检测2D平面图中的照明符号与文本,高效辅助建筑设计与能耗估算。
我们能否防御针对真实世界危机事件的AI生成视频攻击?对检测器、生成器及社会传播的系统评估
提出RA-Bench基准,评估AI生成视频检测,发现现有检测器难以泛化,社会传播加剧检测难度,需更鲁棒检测器。
MAGneT-3D:单目与域泛化的时序3D检测
提出MAGneT-3D首个域泛化单目时序3D检测,用DRAG与TRIM,零样本跨域NDS提升6.5%
中文标题:TRUE-Colon:揭示实时息肉检测中一致的迁移不对称性
中文摘要:构建TRUE-Colon基准,发现按精选片段训练的模型在全流程中性能骤降,而全流程训练模型在真实数据上更优,提示应转向全流程数据训练与评估。
GhostPoint:通过幻觉遮挡的激光雷达结构进行自监督表示学习
提出GhostPoint新方法,经实例体素膨胀幻觉遮挡特征,增强三维检测,稀疏扫描下性能显著。
风格还是签名?冻结视觉嵌入中风格分类的艺术家分离评估
艺术家分离评估下,风格分类准确率从0.87降至0.77,超现实主义剧降,须以此衡量真实风格理解。
MagnifiQ:面向高分辨率图像修复的补丁感知文本引导渐进式放大
提出渐进式放大修复框架,用卷积替代注意力的扩散模型,结合局部文本提示,高效还原4K细节,质量超越现有方法。
Marionette:预测世界状态,渲染几何,绘制外观
提出木偶世界模型:显式预测三维世界状态,用零参数渲染器计算几何,扩散模型合成外观,实现可控且长期一致。
CPI-Bench:面向真实世界图像编辑的全面、实用与智能基准
提出CPI-Bench基准,覆盖多图编辑、实际应用与高难度推理编辑,可更好区分模型性能,其排名与人类评估高度一致。
解码过去:面向史前手印性别归属的不确定性感知深度学习框架
提出不确定性感知深度学习框架,用于史前手印性别归属并量化置信度,准确率超88%。
UltraArUco:面向移动AR交互的低延迟实时标记追踪轻量级多语言库与框架
超轻量多语言AR标记追踪框架,延迟降低五倍,Wi-Fi分发架构,支持手势识别与钢琴模拟交互。
秘密-隐写差异作为设计轴:基于扩散模型的可逆无载体图像隐写
提出InvCISD可逆扩散框架,降低秘密与隐写图像相似度,提升隐写质量并保持恢复保真度,但现有方法仍可被定向隐写分析检测。
Omni-LiveAvatar:分钟级实时流式音视频联合虚拟形象生成
首个分钟级实时音视频联合虚拟形象生成框架,以渐进式自回归蒸馏实现33倍加速与高质量同步。
面向扫描电子纳米束衍射与叠层成像实验的交互式自动化4D-STEM数据采集与分析流程
开发自动化4D-STEM采集与半自动分析流程,用于铂纳米颗粒,结合衍射和叠层成像,实现取向、形貌及原子尺度应变统计。
基于手持多模态OCT探头与NerveDetNet的无标记深层组织周围神经检测
结合手持OCT探头与NerveDetNet,实现无需切开的深层周围神经无标记检测与深度定位。
基于三平面上下文树学习的实用无损体积医学图像压缩
提出三平面上下文树方法,无需神经网络或训练数据,实现无损体积医学图像压缩,性能媲美深度方法且计算成本低。
新锐度感知指标类别的主观研究
针对深度神经网络去模糊中的锐度损失,提出主观研究及锐度感知IQA指标,有效惩罚过度锐化,新指标优于现有PSNR变体,锐度感知损失更受偏好。
从树冠候选到邻里筛查:集成光学GeoAI与空间建模的城市冠层评估——以加州戴维斯为例
利用光学GeoAI与空间建模,对加州戴维斯进行城市冠层制图与验证,生成可复制的筛查层。
VLM与LLM驱动的多智能体PET图像去噪系统
VLM和LLM驱动的多智能体PET去噪框架,动态评估图像质量,自主选模型,闭环反馈,低剂量下优于基线
AlignFace:人类对齐的可解释概念关系人脸相似性度量
提出人脸相似性度量AlignFace,融合认知原理,解释性强且与人类感知对齐,超基线。
将视觉-语言-动作模型演化为具备即时工具使用的智能体
提出ART:融合VLA与工具使用,降低动作复杂度,提升泛化、降低数据依赖,任务成功率提高20%。
通过并行计算加速大规模LiDAR建图的束调整
提出首个全并行激光雷达束调整框架,含自适应加载、自底向上体素化及并行优化,提速达10倍且精度不变。
MMUSV-Sim:面向多无人艇协同感知的仿真与数据生成平台
基于UE5/AirSim的多无人艇协同感知仿真平台,生成多模态数据,验证波浪与标注一致性,早期融合[email protected]达72.74。
可解释令牌的线性几何:针对未学习扩散模型的越狱攻击与防御
发现被擦除概念以可解释线性子空间存留,据此提出高效越狱攻击与防御。
战场声学无人机检测:应对噪声、域偏移与弱标签
针对战场噪声与硬件域偏移,提出PCEN、注意力池化及域感知训练,F1从55.4%提升至78.6%。
PRM-as-a-Judge 1.5:机器人过程评估工具包
将测试视频转为进度曲线,提出三个细粒度指标评估具身模型,发布评测套件,推动透明可复现的机器人过程评估。
J-RAS:基于对比检索增强联合优化的医学图像分割相互适应
J-RAS通过对比检索增强联合优化,使分割与检索模型相互适应,提升分割精度与泛化能力。
UMPIRE-Net:用于加速磁共振成像的展开幅度-相位正则化网络
提出UMPIRE-Net,将幅度与相位分别正则化,用于加速MRI重建,比复数值基线图像更清晰、伪影更少。
CoCA:基于强化学习的文生图扩散模型微调中零成本步骤级奖励
动态分配密集步骤奖励,基于图像余弦相似度变化,免额外网络,采样效率提升1.25-2倍。
HierDAMap:面向通用域自适应鸟瞰图映射的分层视角先验
提出层级视角先验的通用鸟瞰图域适应框架,经三种组件约束跨域一致性,并引入数据增强。
基于扩散过程关键步骤建模的概念遗忘
提出关键步骤概念遗忘(KSCU),优化限制于概念专属活跃区域,兼顾消除与保留,降低计算,实现SOTA。
追踪逃跑:探索分析平原斑马(Equus quagga)逃跑反应的计算框架
无人机视频分析斑马逃跑,评估三种方法并用最优法提取轨迹,发现逃跑时对齐增强、停前间距增大、中心协调紧密。
重新定义视觉域泛化:基于FusionDetect的假图像检测双轴框架
提出双轴泛化基准与融合检测方法,结合双重冻结模型特征,实现跨生成器与视觉域检测,精度与鲁棒性领先。
XtraLight-MedMamba用于肿瘤性管状腺瘤分类
提出超轻量状态空间模型XtraLight-MedMamba,仅3.2万参数,以97.18%准确率分类管状腺瘤,优于高复杂度Transformer和Mamba模型。
视觉与语言何处相遇?利用对比注意力理解与优化多模态大模型的视觉融合
发现视觉融合集中于特定层并存在晚期回顾现象,提出无训练对比注意力框架,提升多模态推理。