采用混合融合的视觉与表格Mamba多模态医学数据方法
提出基于Mamba的混合融合方法处理多模态癌症数据,召回率提升且可解释性强,平衡准确率略低于Transformer。
一张图像足矣:基于文本世界模型的智能单次图像生成用于长尾空间感知
提出WMGen-v1框架,用单张图像生成多样化长尾空间数据,使检测器性能接近真实数据。
随迹而行:基于点追踪的视频合成与运动控制
提出统一模型,利用多参考图像和点轨迹实现视频合成与运动控制,通过空间感知点轨迹嵌入和混合训练提升效果。
Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays
GroundShot: 基于实体锚定的镜头调度实现视觉一致的多镜头长视频生成
GroundShot通过实体记忆与镜头调度,无需训练即可提升多镜头视频一致性,并引入GroundBench基准评估。
面向停车位占用识别:一种自监督方法
提出无标签自监督两阶段训练法,停车位识别准确率达97.8%,实现可扩展低成本监控
FOCA:面向未来的条件机制实现数据高效的视觉-语言-动作适应
FOCA框架通过未来导向条件机制,结合显式预测与隐式对齐,实现少样本VLA适应新SOTA,成功率最高提升26%。
随机符号距离过程
提出随机符号距离过程,将体渲染建模为概率表面渲染,基于贝叶斯滤波推导首次通过概率,提升表面重建与不确定性量化。
TriMotion:面向视频生成的模态无关相机控制
TriMotion提出模态无关框架,映射多模态输入到共享空间,生成准确跟随相机轨迹的高质量视频。
基于语言模型的细粒度人体运动理解
提出LLM模型以带时间戳的骨骼姿态序列表示运动,利用多样监督实现SOTA,仅用2D输入即超越以往3D方法。
NeoLoc-68:新生儿临床环境中的端到端68点面部关键点定位
提出首个端到端68点新生儿面部关键点检测模型,结合多数据集与YOLO架构,在公开和临床数据上达SOTA性能,NME低至5.37。
从不确定性到稳定性与保真度:利用Fisher信息引导稀疏视角3D高斯溅射
利用Fisher信息主动选择支持视图并自适应调整移除概率,有效缓解过拟合,提升稀疏视角3D高斯溅射的稳定性与渲染保真度。
UNITY:用于扩散模型中自适应条件控制的注意力流网络
UNITY通过两阶段训练与可变形注意力流网络,实现高效复合条件扩散图像生成,兼顾保真度与内存效率。
PROTON: 基于原型的医学视觉语言模型测试时在线分布外检测
PROTON通过在线原型库自适应融合距离与MCM评分,提升医学VLM的OOD检测,对协变量偏移提升23.9 AUROC。
BELDE:构建面向欧洲的大规模地球观测土地覆盖数据集
欧洲大规模RGB土地覆盖数据集BELDE(108万对,7类10米),基线F1达83%,跨域性能下降,为地理域偏移提供基准。
GIM-ENDO:用于胃肠化生形态与病理的多模态内镜图像与视频数据集
GIM-ENDO数据集提供多模态内镜图像视频及病理标注,填补胃肠化生AI检测公开数据空白。
CogniRoute:全模态模型中社会证据的路由学习
引入模式引导的MoE与路由感知强化学习,CogniRoute在社交视频问答中显著提升跨模态协调与时间推理性能。
ELDiff:证据学习与文本到图像扩散的融合
ELDiff利用证据学习增强多对象文本到图像扩散的语义一致性,解决分割偏差和语义冲突,无需额外推理。
自监督双频相位分解用于单次复合条纹投影轮廓测量术
提出无需标签的自监督双频相位细化方法,利用高低频梯度关系及软边缘一致性损失,实现精确单次3D重建。
Robusto-2:利马与纽约市自动驾驶中人类与VLM的基准测试
人类与VLM在跨区域自动驾驶问答中表现存在差异,但人类回答与地理无关。
稀疏点引导的监督与自监督学习融合模型的海藻分割
提出两阶段海藻分割模型,监督引导自监督学习并融合掩膜优化,mIoU提升0.068。
CheXpercept:评估胸部X光片中专家级病灶感知的基准
CheXpercept多级感知基准模拟放射科医生流程,测试14个VLM仅粗粒度表现好,医学VLM无感知优势。
MS-rPPG:用于驾驶员监控系统中远程光电容积描记法的多光谱状态空间模型
MS-rPPG多光谱框架结合RGB与近红外,通过CSLM和MS-Mamba提升驾驶员心率估计鲁棒性和精度。
神经架构分布:随机分割的新范式
首次提出以架构分布作为随机源,通过采样离散架构生成多样掩膜,结合集合级监督训练,实现最优性能。
ShuffleFlow: 面向贝叶斯逆成像的可扩展后验推断
ShuffleFlow通过像素重排、神经场和条件归一化流,实现高效生成高样本数后验的可扩展推断。
SARIF:基于分割一切的鲁棒图像取证
SARIF利用SAM模型,通过反馈引导和双编码器设计,自动分割伪造区域,跨数据集鲁棒性强。
面向受限数据图像生成与增强的以对象为中心的数据集资源
发布三个对象中心数据集(行人、交通标志、盆栽),标准化256x256裁剪与标注,支持受限数据图像生成与增强。
ChronoLock:保护视频免受未经授权的文本到视频个性化
ChronoLock首次通过干扰时间去噪轨迹,主动阻止视频被用于未经授权的文本到视频个性化,实验证明有效。
MammoExpert:在乳腺X线摄影诊断中评估思维链推理的基准
首个含思维链推理注释的乳腺X线数据集,提升诊断准确率与可解释性。
Odoriko:一种体态感知的多模态人体运动扩散框架
提出首个体态感知统一多模态运动生成框架,生成与主体形态一致的运动并支持形态恢复。
ConnectomeBench2: 自动化连接组校对的统一基准
发布多物种连接组校对基准,Vision Transformer达人类水平,校准与分布距离预测有效,主动学习减少标注成本。
SEED:简单ViT与演化框架用于可解释文本伪造检测
SEED系统结合ViT检测定位与MLLM生成可解释取证报告,获挑战赛第三名。
用于空间转录组学的对比与自适应多模态掩码自编码器
提出跨模态掩码自编码器,利用少量基因锚点结合对比学习,精准预测全切片基因表达,性能超越现有方法。
通过稀疏自编码器提取与分析视觉语言模型中的多模态概念
提出基于稀疏自编码器的框架,从视觉语言模型中提取多模态概念,视觉概念质量提升45%,并实现多模态识别。
基于FastGAN合成数据生成、Transformer分类和可解释AI的少样本高光谱蚜虫检测
FastGAN增强高光谱数据,Vision Transformer模型蚜虫检测准确率最高,有效提升分类鲁棒性。
HERO: 假设驱动的组学证据检索用于多任务乳腺癌分析
提出假设驱动的组学检索方法,通过路径-形态先验和TF-IDF检索,在乳腺癌多任务预测中达到新最优。
BadDreamer: 针对自动驾驶视频世界模型的可迁移后门攻击
BadDreamer可迁移后门攻击毒化视频世界模型未来动力学,使模型在有触发器时幻觉道路清空,并迁移至下游动作规划导致不安全路径预测。
MEDLAYXPLAIN: 医学视觉语言模型中专家-患者差距的基准测试
新基准MedLayXPlain揭示医学视觉语言模型难以弥合专家与患者间的沟通鸿沟,患者易懂描述生成能力不足。
基于YOLOv8和ResNet18的实时行人属性识别
YOLOv8n+ResNet18两阶段框架实现实时行人属性识别,性别准确率99.89%,年龄MAE 4.23年,多属性准确率89.96%,稀有属性仍挑战。
ACE-GS:以精确、紧凑、高效的3D高斯泼溅突破权衡瓶颈
ACE-GS提出渐进优化框架,通过精准原语管理与频率补偿,3-5分钟超快收敛,PSNR提升0.89dB,实现高保真渲染。
上下文感知自回归扩散模型用于逐词汇手语生成
提出GARD逐词汇扩散模型,通过语义与运动上下文条件建模,并引入跨词汇过渡引导与全局协调,显著提升手语生成的自然度与准确性。
基于概念驱动逻辑推理的可解释骨架癫痫发作检测神经符号框架
提出首个神经符号框架实现可解释视频癫痫检测,通过概念预测与逻辑推理达成高灵敏度低误报并具备三级可解释性
基于对比对齐与伪标签精炼的模拟到真实物体姿态估计无监督域适应
CAPLR通过跨域配对、对比对齐和伪标签精炼,实现无监督域适应,在物体姿态估计中达到最优性能。
NoduLoCC2026:基于胸部X光图像的肺结节定位与分类竞赛
NoduLoCC2026挑战赛,分类最佳平衡准确率0.72、AUC-ROC 0.79;定位更困难,53%正确预测结节数,中位距离12.83mm。
FLM-Occ:基于前馈似然最大化的高效室内占用预测
提出前馈似然最大化(FLM)框架,将占用预测转为体素分布估计,仅用32个基元即达最优性能,速度快3.7倍。
中文标题:一种测试时演员-评论家方法用于新闻图像生成
中文摘要:提出ACIG方法,在测试时基于Actor-Critic循环优化生成提示,获2026挑战最佳结果。
中文标题:基于贝叶斯反演2D基础模型的轻量级3D特征预训练
中文摘要:提出Casper3D轻量框架,将多视图2D嵌入转换为3D语义,性能比简单池化更稳定。
SCOPE: 尺度一致的单遍三维几何估计
SCOPE从长单目视频单遍估计3D几何,创新视角/外观不变学习与频率调制,点图误差降低24.2%,时序误差降低34.9%。
LEViL:基于VLM生成伪标签空间的零样本蒸馏实现标签高效视频学习
提出无标注预训练与目标标签集感知微调框架,利用VLM伪标签空间零样本蒸馏,在有限标签下优于半监督方法。
WildBox:非洲稀树草原野生动物航空单目三维检测数据集与基准
WildBox含23.7万3D框标注7种动物,零样本3D检测失效,微调后AP3D达13.17,深度误差是主要瓶颈。