Cortex:使用冻结视觉特征的紧凑型Quake行为克隆
Cortex使用冻结视觉特征的紧凑行为克隆,在Quake中未完成关卡但能到达关键区域并击杀,视觉token密度提升战斗与生存能力。
可信赖的医学分割:临床图像退化下的不确定性感知U-Net评估
在八种临床退化下评估不确定性感知U-Net,发现不确定性跟踪分割错误,可标记失败(AUROC 0.843),作为放射学安全层。
CrossSpine:基于解剖先验的多尺度交叉序列注意力自动化Pfirrmann分级
提出CrossSpine框架,交叉序列注意力融合多尺度MRI特征,结合解剖先验,使Pfirrmann分级Macro F1提升超125%。
打开模型的"眼睛":视频与上下文感知的多模态后通道预测
提出多模态对齐框架CAMA-BC,利用视频和上下文提升后通道预测,尤其善于识别共情等复杂信号。
面向室内环境的免标定三维多相机人物追踪
提出免标定三维多相机追踪框架,利用深度模型推断几何结构,无需标定矩阵,HOTA达53.13%。
中文标题:用于EEG运动想象分类的生成增强:一种带循环一致性解码器精炼的类条件VAE
中文摘要:提出类条件VAE生成运动想象EEG增强数据,但分类增益小且依赖分类器。
用于30米晴空地表温度无间隙重建的快速傅里叶卷积生成对抗网络
提出快速傅里叶卷积GAN,结合SAR数据重建30米Landsat云污染像元,生成无间隙晴空LST,RMSE稳定在0.8-1.8K。
评估领域差异:视频胶囊内窥镜中域偏移下的模型选择不稳定性
胶囊内镜模型选择在域偏移下不稳定,单一数据集排名无法预测其他目标,应关注跨目标排序稳定性而非峰值性能。
超越错误-丢弃特性:迈向稳定可靠的人脸图像质量评估
揭示EDC协议局限,提出RCE等新指标,实现更稳定可靠的人脸图像质量评估。
凝视锚定社交网络:通过联合建模解码隐性关系
提出ANCHOR范式,联合建模凝视与隐性社会关系,通过关系注意力和优化协同,从静态图像中解码社会层级,性能领先。
弱监督乳腺摄影中评估重建保真度的诊断差距框架
提出诊断差距框架,通过决策和解释保持度评估弱监督乳腺摄影重建保真度,揭示诊断信号损失取决于保真度而非重建本身。
基于fMRI的人类视觉感知实时重建
实时fMRI通过云平台快速解码视觉感知,揭示离线与实时性能差异,为脑机接口应用奠定基础。
廉价探针预测3D-CT视觉-语言模型中的昂贵训练
用廉价探针排序候选,与昂贵微调高度一致(r≈0.95),可快速筛选编码器和压缩方案。
混合语义与频谱集成实现鲁棒合成图像来源归因
融合语义与数学取证双分支框架,在55%退化测试集上达95.6%准确率,无需GPU即可高效部署。
AI生成的图像挑战高风险场景中的视觉信任
SafeIMG基准测试显示,现有检测器在安全场景中准确率低(VLM 49.5%,专用检测器33.1%),解释覆盖率不足30%,远低于人类81.7%。
ID-V2V: 保持身份的视频重风格化
ID-V2V通过解耦身份保持与编辑传播,利用重照明和法线图约束,无需配对数据实现身份保持视频重风格化。
推进全天气条件下建筑物损伤制图至实例级别:2026年Bright挑战赛的结果与见解
该挑战赛通过光学-SAR图像实现实例级损伤制图,最好成绩mAP 0.18,显示跨事件泛化与稳定区分损伤等级是最大挑战。
基于损失稳定、归一化与子空间注意力的术后胶质瘤分割
提出归一化、对比学习与子空间注意力模块,解决域偏移下损失不稳定问题,WL Dice达0.94。
OmniMate:面向交互式虚拟形象的开端实时流式音视频生成
OmniMate框架通过进度控制器与多参考条件模块,实现低延迟音视频流式生成,保持长时跨模态一致性,支持沉浸式多轮交互。
Controlling Embedding Spaces with Text-Conditioned Transformations
Spatial-IQ: 通过层次化能力测试解构空间智能
提出Spatial-IQ框架,将3D堆叠计数分解为9个层次子任务,揭示顶级模型捷径行为,层次CoT训练提升性能。
AdaKAN:用于医学图像分割的双分支自适应Kolmogorov-Arnold网络
提出双分支自适应KAN(AdaKAN),融合卷积与高效KAN块,U形架构捕获多尺度特征,实现SOTA医学图像分割。
通过微调增强病理基础模型的鲁棒性
新微调方法提升病理基础模型鲁棒性,10个模型平均鲁棒性提升23%,性能提升43%。
复杂田间视频中小型传粉昆虫检测
RF-DETR Large在1344像素达0.405 mAP50:95;提高分辨率优于增加复杂度;主要瓶颈为蜜蜂与食蚜蝇区分。
HALLELUAI:一种面向超逼真图像到视频大规模生成的幻觉感知AI系统
HALLELUAI通过审核与再生模块,实现图像到视频的超逼真规模化生成,确保视觉真实与品牌安全。
叠穿虚拟试穿
提出叠穿虚拟试穿方法,分解通用先验与叠穿知识,凭借自动数据生成和微调实现最优效果。
打破合成-真实领域捷径:面向免训练生成式回放的类增量学习
提出DREAM方法,通过子空间校正与正交投影消除领域捷径,实现免训练生成式回放类增量学习,性能达最优。
mmSimPrior:学习仿真先验用于数据高效且可泛化至现实世界的基于雷达的人体运动重建
提出mmSimPrior仿真预训练框架,通过因子化先验与域随机化,仅用24对真实数据即可显著提升雷达人体运动重建精度。
少即是多:基于DeepGlobe的轻量级CNN卫星土地覆盖分割受控基准
轻量MobileNetV2在DeepGlobe分割中准确率最高,优于更深模型,证明轻量迁移学习适用于资源受限遥感。
高分辨率多模态大模型中高效视觉令牌剪枝的结构化冗余建模
提出SFPruner,通过结构化冗余建模实现单次前向传播的令牌剪枝,选择时间从112.4ms降至2.5ms,大幅提速且保持高性能。
OmniScope: 面向全模态大语言模型的模态解耦式令牌压缩
OmniScope以查询为语义锚,分模态估计相关性并压缩令牌,无训练,25%保留时加速3.53倍、显存降15%,准确率仅降0.35点。
相似性并非逻辑:双编码器视觉语言模型的因子推理
双编码器视觉语言模型无法处理组合约束,提出无训练因子推理方法LCSE,准确率提升至85.5%。
SHReg:基于球谐函数的严格旋转等变点云配准
SHReg基于球谐函数实现严格旋转等变配准,联合学习不变与等变特征,提升大旋转鲁棒性,优于现有方法。
从纵向光谱CT提取病灶动力学的逆贝叶斯推断
提出逆贝叶斯框架从纵向光谱CT提取病灶动力学,分解三项,在NSCLC中发现肺病灶竞争、肝病灶协同耦合机制。
DishSeg24k:大规模食物分割基准与随机专家解码
提出大规模食物分割基准DishSeg24k(2.4万图、278类)及FEAST方法(MDP+RL-MoE),mIoU提升3.21%,达最新最优。
Fashion-3DLR:一种利用成对时尚元素实现可控3D服装生成的智能设计方法
提出Fashion-3DLR框架,融合二维设计元素生成可控3D服装,支持物理仿真与虚拟试穿,性能超越现有方法。
DispatchRAG:基于真实事故协议从交通事故视频生成紧急调度决策
DispatchRAG基于日本真实事故协议,结合RAG检索与LLM推理,增强VLM从视频评估事故严重性并生成应急调度,性能超越基线模型。
视觉-语言导航的双脑最小充分表示
提出基于最小充分性原则的BrainNav框架,通过逻辑锚点、最小约束对齐和压缩世界模型,提升VLN-CE导航性能。
反事实运动可靠性学习用于鲁棒无人机跟踪
提出CMRTrack框架,通过反事实目标擦除历史分支学习可靠运动,提升红外无人机跟踪鲁棒性。
超出长度场景文本识别:双轴诊断与免训练修复
诊断长文本识别失败主因是编码器宽度,提出免训练切片对齐方法,在长文本基准上达43%准确率,匹配并超越现有最优。
UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
基于重建的无参考图像描述评估框架
提出基于重建的无参考图像描述评估原理,通过下游任务评估语义等价性,实现免参考评分。
BoneAgeTW2:基于Tanner-Whitehouse 2方法、深度学习及分布曲线临床报告生成的自动化骨骼成熟度评估
首个开源TW2骨龄评估系统,用YOLOv8检测20块手骨,EfficientNet-B3分期,自动生成含分布曲线的临床PDF报告。
SARATR-X-v2:面向SAR基础模型的尺度感知结构预训练
提出满足物理稳定与语义尺度兼容的预训练目标,通过多尺度结构提取与可学习融合实现SOTA性能及抗扰动能力。
WaveZip:小波驱动的视频令牌时空解耦压缩方法
WaveZip利用小波变换解耦时空冗余,在10倍压缩下保持99.6%性能,无需训练即可集成到现有大视觉语言模型。
CLIP心知肚明却无法表达:从冻结中间特征恢复否定语义
提出PeakPatch方法,从CLIP中间层恢复否定信号,仅增3.5%参数,COCO MCQ提升35.1%。
门总是关闭的:论向冻结视觉语言模型注入辅助信号
发现VLM门控抑制现象,用双曲几何损失正则化LoRA,推理保留几何路径可保关系准确率并提属性。
基于树语法分析的加权Banzhaf交互解释BiomedCLIP
提出ParseFIxLIP,利用树语法解析与加权Banzhaf交互,解决分词碎片化,提供语义连贯的医学VLM解释。
面向上半身人-物交互的实时以人为中心的世界建模
提出实时以人为中心上半身交互世界模型,融合连续隐式控制与离散交互状态,实现25FPS细粒度运动与手物协调。
基于Prompt-S6与语义感知知识引导的多模态目标重识别
提出PRISM框架,利用Prompt-S6和语义感知知识,通过语义剪枝与渐进融合实现三模态对齐并抑制背景干扰,降低复杂度。