显式优于隐式:通过复数结构张量表示增强CNN用于眼周识别
复数结构张量提供显式方向先验,使CNN眼周识别准确率提升,EER降低5-26%。
筛查性乳腺X线摄影AI中的数据集来源特征与捷径学习:一项跨数据集案例研究
简单合并异常富集外部数据引入域偏移,抵消额外正例收益,导致AI性能下降,需域感知策略。
SLAPBench:四指SLAP指纹验证的多模态大语言模型基准
首个四指SLAP指纹验证MLLM基准显示提示方式控制模型崩溃,模型能力决定判别性能。
针对人脸识别的有意电磁干扰攻击
揭示生物传感器物理-数字管道漏洞,用常见射频设备实施电磁干扰,评估人脸识别鲁棒性,提供新基准数据集。
基于LLM驱动的跨语言手写OCR自动机器学习:利用GPT-5、GPT-4o和Claude Sonnet 4的闭环神经架构搜索
LLM自主搜索神经架构,跨语言手写OCR准确率超93%,最佳98.1%,推理延迟41-44ms。
基于物理感知掩码扩散的城市鱼眼灾害检测洪水模拟
提出PhysFlood,用扩散模型从单张鱼眼图像合成逼真洪水,可自由控制水位等变量,实现高精度模拟。
从校正立体视觉中几何蒸馏:利用极线线索进行单目深度估计
提出EpiDistill,通过校正立体令牌蒸馏极线注意力,将多视图尺度先验转移至单目模型,显著提升零样本度量深度估计。
改进的VBGS:实时连续变分贝叶斯高斯溅射
通过空间截断变分推理和改进重分配,实现实时连续重建,延迟从84秒降至0.05秒,提速1680倍。
E3DGS:颜色即几何嵌入下的三维高斯泼溅统一几何-光度等变性
统一颜色-几何嵌入实现SE(3)等变高斯泼溅,无需张量积,提升鲁棒性与数据效率。
视觉地点识别是否所有令牌都必要?面向高效推理的令牌缩减实证研究
本研究首次系统评估令牌缩减在视觉地点识别中的应用,可减少29%计算量、提升44%吞吐量,准确率仅降不足1%。
询问两次,观察两次:提示回声解决视觉语言模型中的问题优先悖论
问题重复放在图像两侧,分别引导感知与读取,无需训练即可解决悖论,提升性能。
测试时自适应何时有助于零样本CT视觉语言模型?
测试时自适应在保留深度结构且基础表示可迁移时有效;CARVE通过基数感知多视图适应提升零样本多标签CT预测。
基于注意力机制的MLLM选择器实现测试时长视频的高效帧选择
利用注意力分数无需训练选择关键帧,动态分配预算,性能提升6.4分且泛化性强。
CSS-BA:门控引导的列空间搜索束调整
针对低视差和近旋转场景中传统方法不稳定的问题,提出门控引导列空间搜索,约束更新方向,提升稳定性和精度。
BCG-Former: 基于波段上下文门控的帕累托高效高光谱图像分类
BCG-Former轻量混合模型通过波段上下文门控等创新,以极少参数(0.10-0.23M)实现高精度(91.51%-99.49%)与亚毫秒延迟,达到帕累托最优。
基于深度学习的局灶性皮质发育不良分割的MRI表示基准测试
nnU-Net框架下,四通道多模态MRI表示(含比率衍生)分割FCD的Dice达0.376,较传统组合提升5%,凸显MRI表示设计关键。
WREN: 基于Retinex理论的双U-Net结构低光图像增强
提出WREN网络,双U-Net分解反射与光照图,Transformer增强光照,尺度不变损失,实现低光增强SOTA。
医学大型视觉-语言模型的模型合并:基准与赢家通吃方法
提出医学LVLM模型合并基准MergeMedBench及赢家通吃方法,仅保留关键参数,优于现有方法。
DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse
基于区域锚定的视觉-语言学习用于检测引导的乳腺X线病变分类
提出区域锚定视觉-语言学习,病灶-文本对比预训练与检测联合优化,提升乳腺病变分类,跨数据集性能优异。
PE-Field 4D: 以视频生成模型为画布
提出几何感知交叉注意力机制,通过投影位置编码控制视角,提升视频生成的空间可控性。
StructGen: 通过结构化上下文建模消除多参考图像生成的歧义
StructGen用结构化字典格式编码多参考图像,消除歧义并提升生成一致性与语义对齐。
中文标题
提出三种分层集成用于斑马鱼表型分类,ConvNeXt最佳,专用分层集成F1平衡最好。
Event3R: 基于时空特征聚合的事件相机异步到全局三维重建
提出Event3R,利用时空特征聚合从事件流重建全局三维点云,自监督预训练增强时间学习,实现鲁棒全局一致重建。
GeoChrono:遥感中长期时序理解的基准评测与重新思考
提出ChronoBench多维基准评估遥感长期时序理解,发现长期记忆是瓶颈;GeoChrono模型性能超商业模型20%,高效压缩视觉token。
GoStop:基于强化学习的事件特征跟踪自适应时间聚合
用强化学习自适应控制事件累积,提升动态运动下跟踪鲁棒性与效率。
高效难度感知动态路由的扩散模型真实世界图像超分辨率方法
针对现有方法忽略图像恢复难度及细节丢失问题,提出按难度分配不同容量网络的动态路由,实现高效超分辨率。
通过动作单元和动作检测指导的文本到运动逐笔时间控制
引入动作单元实现逐笔时间控制,适配器与检测梯度修正,显著提升笔画定位准确率和运动质量。
IoUPD:针对多模态大语言模型视觉定位的IoU感知特权蒸馏
提出IoUPD,利用真实框作为训练时的特权指导,通过IoU感知蒸馏提升坐标生成模型的定位质量。
通过隐式文化对齐奖励模型消除文本到图像评估中的偏见
基于轻量MLLM的隐式文化对齐奖励模型,准确率达80.54%,速度提升10倍,实现高效文化感知评估。
通过偏好丰富样本挖掘与队列合并的个性化图像美学评估
提出PRAC方法,挖掘偏好样本并合并用户群体,实现个性化图像美学评估,优于现有方法。
第三届身份证和护照伪造检测竞赛
Incode两赛道夺魁,展现均衡一致性,63+团队参赛,成领先基准。
SlotMem:面向叙事长视频生成的角色可寻址内部记忆
提出SlotMem角色可寻址记忆框架,通过语义探针和编码器实现长视频角色一致性,性能优于基线。
MDND:非可微分细化引导的无监督学习用于形状对应
MDND融合可微与不可微分支,以内部不可微细化结果引导无监督学习,在非等距形状对应中取得新最佳效果。
HybridSim:用于毫米波人体感知的物理-学习混合数字孪生
HybridSim物理-学习混合模拟器,分解传播路径,高效合成雷达信号,用于站点特定数据增强提升人体感知。
测试时噪声引导的自适应实现逼真自回归视频生成
提出TANGO方法,通过预测噪声分布匹配避免生成中断,视频质量提升,FVD降低28.3%。
基于交叉注意力和门控融合的多模态矛盾与犹豫识别
提出交叉注意力与门控融合的多模态框架,融合文本、音频、视频,验证集Macro F1达0.7394,较单模态提升11%。
Examining the Associations between Visual and Non-Visual Elements and Cyclists' Route Choices for Various Trip Purposes
基于事件的多模态自我运动估计中学习表示的几何结构
多模态网络嵌入位于低维流形,注意力自适应,恢复经典可观测性。
EgoExoMoCap: 分布式自我-他人人体动作捕捉
提出分布式框架,联合自我与他人多模态信号,仅需智能眼镜实现鲁棒动作捕捉。
用于实际测试时传导的具有动态收缩的冯·米塞斯-费希尔混合模型
提出MOON模型,动态调整收缩强度处理类别不平衡,抑制不可靠分配,无需训练,高效提升性能。
硬件触发式路边多激光雷达与多相机测量系统的时间同步实现精确数据对齐
提出开源硬件触发同步电路,实现路侧多传感器精确时间对齐,成本低、可扩展。
DPNeXt:一种轻量级多尺度特征融合框架,用于高效基于ViT的多任务密集预测
提出DPNeXt轻量解码器,用双深度可分离瓶颈融合特征,MTBG策略减少负迁移,参数量减少78.6%,在多个数据集达SOTA。
Orbis 2:用于驾驶的分层世界模型
提出分层驾驶世界模型,两阶段训练(扩散预训练+教师微调),实现高保真与稳定预测,达到SOTA。
通过区域感知手写描述符工程进行手写与印刷文本分割
轻量级框架用RHD描述符分割文本,准确率略降但推理加速8倍,适合边缘设备。
HETA++:基于混合显式平移平均的全局运动恢复结构
混合显式平移平均框架结合相对平移与特征轨迹,通过角度约束与光束法平差,实现高效高精度的全局运动恢复结构。
向量量化的分布匹配:一个统一的理论与实证框架
提出分布匹配框架,通过对齐特征与码向量分布,统一解决向量量化的训练不稳定和码本崩溃问题。
CanonicalPhys:基于规范空间先验的姿态鲁棒远程光电容积描记术
通过可微分单应性固定面部锚点,恢复三个先验,降低姿态引起的rPPG误差,提升鲁棒性。
超越展开:面向密集红外小目标的60倍快速单阶段解混
首个轻量单阶段框架,60倍加速解混紧密红外小目标,精度相当。
以简驭繁:大规模遥感VLM的简单配方
通用VLM通过大规模多任务训练即可在遥感基准上超越专用架构,数据规模比架构创新更关键。