AVE-Compass:面向音视频编辑能力的全面评估
提出AVE-Compass基准,通过145个视频和196个指令全面评估音视频编辑能力。
关键点引导的最优传输:模型、算法及应用
提出KPG-RL模型,利用关键点引导最优传输匹配,应用于域适应、单细胞对齐和图像翻译,实验有效。
利用语义地图实现城市场景跨视角定位
利用VLM提取语义地标并匹配,通过轻量级匹配器实现城市场景定位,泛化性强。
CORF-GS: 基于光学-射频耦合高斯泼溅的实时无线辐射场重建
提出实时无线辐射场重建框架,利用光学-射频联合高斯表示与优化,实现高质量高速度重建。
HiFi-UMI:仅从高保真UMI数据学习可部署操作策略
通过高保真UMI数据实现零机器人后训练直接部署,成功率85%,预训练降低误差41%,开源2000小时数据集。
A2D2:奥迪自动驾驶数据集
A2D2数据集含图像、点云、语义分割及3D框标注,360度覆盖,助力自动驾驶研究。
基于CNN的心电图图像分类中的捷径学习与聪明汉斯效应分析
通过构造六种特征集,发现CNN模型可能依赖非临床伪影而非波形形态,存在捷径学习与聪明汉斯效应。
内蕴与三角剖分无关的注意力:一种简单而强大的网格学习方法
本文提出内蕴且三角剖分无关的注意力机制,简单强大,在多网格学习任务上超越现有最优。
SAM-MI:一种掩膜注入框架,用于增强基于SAM的开放词汇语义分割
提出SAM-MI框架,通过稀疏点提示加速掩膜生成,浅层聚合缓解过分割,解耦注入提升精度,速度提升1.6倍。
Leveraging ChatGPT's Multimodal Vision Capabilities to Rank Satellite Images by Poverty Level: Advancing Tools for Social Science Research
FFNet:基于MetaMixer的高效卷积混合器设计
通过FFNification将自注意力转为高效卷积混合器,FFNet仅用简单操作超越复杂方法,验证查询-键-值框架重要性。
DopQ-ViT:面向分布友好与异常值感知的视觉Transformer训练后量化方法
提出TanQ和MOSF,解决后Softmax幂律分布不匹配与异常值影响,提升ViT量化性能。
COCO-OLAC:面向遮挡全景分割与图像理解的基准数据集
提出COCO-OLAC数据集,评估遮挡影响,用对比学习提升遮挡下全景分割性能。
Mondrian:基于压缩打包推理的设备端高性能视频分析
提出Mondrian边缘系统,通过压缩打包推理选择必要像素并最大化并行处理,比基线准确率提高15-19.7%,吞吐量提升6.65倍。
针对移动物体的3D高斯泼溅用于高保真街景重建
提出自适应透明度机制消除移动物体,迭代优化高斯点分布,实现高质量动态街景实时重建。
HOLODECK 2.0:视觉语言引导的3D世界生成与编辑
视觉语言引导的3D场景生成框架,支持交互式编辑,生成高质量多样化风格场景,语义一致,效果优于基线。
SurgSLOT:通过语义长期追踪实现手术视频中的任意目标分割
提出SurgSLOT,基于时序语义与长期记忆实现手术视频任意目标分割,性能超越微调SAM5个百分点,支持零样本迁移。
公平的面孔:审视面部表情识别数据集和模型中的偏见
评估FER数据集和模型偏差,提出新指标,发现种族偏差显著,残差CNN偏差最低,Transformer最高,高精度不保证公平。
MegaSlide-DiT:以内存为中心的适配与可变形局部注意力实现高效视频扩散
提出MegaSlide-DiT,在单GPU上通过主机内存存储权重和3D可变形滑动注意力,高效适配105B视频扩散模型。
RMS@CC-MMD 2026: 基于几何交互与多视图共识的多模态厌女检测
提出GeoMVC,用几何交互层和多视图共识检测多模态厌女,在马拉雅拉姆语(0.892)和中文(0.895)分区获第2、3名,揭示本地化转写与文化讽刺挑战。
DINOv3-MIL: 基于KiTS23基础模型补丁令牌的肾脏多标签肿瘤与囊肿检测
在KiTS23上,门控注意力MIL取得肿瘤/囊肿检测最高AUROC(0.74/0.80),注意力富集7.5–9.8倍,原型头囊肿检测失效(0.51),揭示可解释性-性能权衡。
MIME:多模态交互运动编码器
MIME专为两人交互运动设计,采用流共注意力和课程对比训练,在检索上提升12.8% R@1,并改善生成语义对齐。
FogDrive:面向分级雾天感知的多模态合成驾驶数据集
多模态合成雾天数据集,含660场景与多传感器,三种雾度,支持3D融合及2D复原基准,已开源。
基于分割辅助诊断Transformer的组织病理谱引导的前列腺分层
提出LSDT模型,用零样本分割提供解剖先验,多模态融合实现前列腺四类分类,准确率0.633。
EditCLEVR:面向对象中心表示的组合忠实性的配对场景干预基准
EditCLEVR通过配对场景干预测试对象表示在语义编辑下的正确性,引入SGIA等指标,发现现有模型在组合外分布下存在退化。
托卡马克偏滤器中中性粒子发射断层扫描的可见光成像诊断:一种高效的基于Transformer的代理模型
提出Delta-InvFormer,利用视频帧差分自注意力预测等离子体光强分布,在EAST上实现快速高精度重建。
LowAux-RDNet:用于单图像反射去除的低通残差监督与场景平衡真实训练
提出低通残差辅助目标与场景平衡真实训练,统一评测基准,在五个数据集上取得最优平均PSNR、SSIM等指标。
StepX-Edge: 通过架构-训练-部署协同设计的端侧UI视觉语言模型
0.9B端侧UI视觉语言模型StepX-Edge,三层协同设计平衡精度效率,超越2B模型,量化后在骁龙8Gen5上高效运行。
针对嵌入式汽车系统的优化RetinaNet架构实时语义分割
提出Opt-RetinaSeg,通过轻量架构与三阶段优化,在嵌入式平台上实现73.9% mIoU与70.4 FPS,模型缩小4倍,精度损失小于3%。
通过分类引导的大型视觉-语言模型进行文档视觉信息提取
提出分类引导LVLM框架,结合上下文学习动态提示,零样本下F1达86.43%,超越监督基线18个百分点,提升文档提取鲁棒性。
面向儿童的AIGC视频风险审查:基准与知识支持的迭代推理框架
构建儿童AIGC视频风险审查基准CAVSR及知识增强框架QVRS-E,显著提升风险识别能力。
TOM-GS:通过静态3D高斯的时域不透明度调制实现可编辑视频表示
TOM-GS利用静态3D高斯的时域不透明度调制,避免复杂形变,实现高保真可编辑视频表示。
视觉令牌压缩增强多模态大语言模型的鲁棒性
通过剪枝偏离语言特征的视觉令牌,防御越狱攻击提升13.29%并缓解幻觉,增强模型鲁棒性。
DAMamba-UNet3D:一种参数高效的Mamba状态空间U-Net,具备动态自适应扫描用于3D医学图像分割
DAMamba-UNet3D用动态自适应扫描实现参数高效3D分割,仅5.3M参数即达SegMamba(70M)水平,大模型超越0.5pt。
γ-Bridge: 一种视数参数化扩散桥
提出视数参数化扩散桥,通过乘性Gamma噪声连接,实现单视训练、零样本多传感器SAR去斑。
面向精神分裂症认知康复的交互式视觉语言平台
提出基于视觉语言模型自动验证精神分裂症患者认知康复动作,通过分析玩具车操作视频实现客观评估。
一种新型对抗样本:测量人类与模型差距及其与OOD检测的关系
研究大扰动对抗样本,人类识别率降至49%但模型保持100%,OOD检测存在盲点,防御无效。
scMIR: 一种用于单细胞光学显微镜图像表示的视觉-语言基础模型
提出scMIR模型,融合自监督图像重建与文本引导对齐,统一编码形态与语义,在多种任务中优于现有方法。
PCA:面向快速视频大语言模型的持久感知压缩与聚合
提出PCA方法,通过动态下采样和运动增强,无训练压缩视频冗余,加速VLLM推理1.8-2.5倍。
结构保持主导基于深度学习的激光散斑材料分类中的数据增强
散斑分类中,数据增强效果由结构保持而非扰动幅度决定,需物理感知设计。
Cortex:使用冻结视觉特征的紧凑型Quake行为克隆
Cortex使用冻结视觉特征的紧凑行为克隆,在Quake中未完成关卡但能到达关键区域并击杀,视觉token密度提升战斗与生存能力。
可信赖的医学分割:临床图像退化下的不确定性感知U-Net评估
在八种临床退化下评估不确定性感知U-Net,发现不确定性跟踪分割错误,可标记失败(AUROC 0.843),作为放射学安全层。
CrossSpine:基于解剖先验的多尺度交叉序列注意力自动化Pfirrmann分级
提出CrossSpine框架,交叉序列注意力融合多尺度MRI特征,结合解剖先验,使Pfirrmann分级Macro F1提升超125%。
打开模型的"眼睛":视频与上下文感知的多模态后通道预测
提出多模态对齐框架CAMA-BC,利用视频和上下文提升后通道预测,尤其善于识别共情等复杂信号。
面向室内环境的免标定三维多相机人物追踪
提出免标定三维多相机追踪框架,利用深度模型推断几何结构,无需标定矩阵,HOTA达53.13%。
中文标题:用于EEG运动想象分类的生成增强:一种带循环一致性解码器精炼的类条件VAE
中文摘要:提出类条件VAE生成运动想象EEG增强数据,但分类增益小且依赖分类器。
用于30米晴空地表温度无间隙重建的快速傅里叶卷积生成对抗网络
提出快速傅里叶卷积GAN,结合SAR数据重建30米Landsat云污染像元,生成无间隙晴空LST,RMSE稳定在0.8-1.8K。
评估领域差异:视频胶囊内窥镜中域偏移下的模型选择不稳定性
胶囊内镜模型选择在域偏移下不稳定,单一数据集排名无法预测其他目标,应关注跨目标排序稳定性而非峰值性能。
超越错误-丢弃特性:迈向稳定可靠的人脸图像质量评估
揭示EDC协议局限,提出RCE等新指标,实现更稳定可靠的人脸图像质量评估。
凝视锚定社交网络:通过联合建模解码隐性关系
提出ANCHOR范式,联合建模凝视与隐性社会关系,通过关系注意力和优化协同,从静态图像中解码社会层级,性能领先。