EgoProceVQA:一种基于自我技能探索智能体的自我中心程序理解新任务
提出自我中心程序理解任务EgoProceVQA及自技能探索框架EgoProceAgent,在多个任务上达到开源模型最佳性能。
RainDancer: 面向雨滴的脉冲动态的RGB-事件视频去雨方法
RainDancer提出先分解再交互框架,分离雨和背景,用脉冲神经网络捕捉雨运动,实现高性能视频去雨。
面向增强医学多模态大语言模型中的3D空间推理
提出逐片合成及思维链数据集,微调2D MLLM增强3D空间推理,无需3D预训练即媲美原生3D架构。
基于深度学习对胰腺癌可切除性的多模态评估
提出多模态深度学习框架,融合CT和临床信息,实现胰腺癌NCCN三分类可切除性评估。
烘焙至成:超快速空间纹理图集溅射法
将高频纹理烘焙至纹理图集,稀疏优化后速度提升5倍,实现实时4K 60fps渲染。
基于器官条件模式标记的CT理解细粒度视觉-语言预训练
提出OCP-CT框架,通过器官条件模式令牌对齐实现细粒度预训练,在CT基准上AUROC达84.5%和69.9%,分别提升6.7和0.8个百分点。
释放多模态大语言模型,实现野外无需训练的HOI检测
AgentHOI无需训练,利用上下文感知多轮推理与多面定位,在真实HOI检测中达最优。
面向多任务情感行为分析的任务特定特征融合方法
针对多任务情感分析,提出任务自适应融合冻结视觉特征策略,有效提升性能。
Cyclone:基于循环一致性从非配对驾驶数据中进行天气编辑的扩散模型
提出Cyclone框架,基于潜在扩散与循环一致性,无需配对数据即可生成逼真天气,显著提升自动驾驶感知鲁棒性。
SIVA-RL:多模态强化学习的敏感性-不变性视觉对齐
SIVA-RL利用样本级干预与奖励下降路由,实现敏感性与不变性对齐,显著提升多模态推理性能。
阈值化交叉注意力:用于低光照图像增强中可靠的亮度-色度融合
针对交叉注意力层依赖问题,提出TCA-Net,用自适应置信度阈值替代固定Top-K,实现可靠亮度-色度融合,提升低光照图像增强保真度与颜色质量。
一种处理多模态心脏PET/MRI数据的新型无监督机器学习策略
新无监督聚类法处理心脏PET/MRI数据,准确识别心肌异常区域,自动报告与医生评估一致。
Peak-End-Net: 一种受峰终定律启发的可泛化视频美学评估框架
受峰终定律启发,融合图像美学先验与时序编码,轻量高效实现视频美学评估SOTA。
基于原子动作的音乐到舞蹈生成
提出原子动作框架,两阶段生成结构连贯、可控的舞蹈,显著提升韵律对齐与自然度。
PlumeQuant: 考虑不确定性的甲烷羽流掩膜与排放速率估算一致性评估
提出不确定性感知的甲烷羽流产品一致性评估方法,揭示标量不唯一约束边界。
CF-Net:面向矛盾/犹豫识别的说话人归一化与确定性加权冲突融合
提出CF-Net,通过冲突融合、说话人归一化和确定性加权损失识别矛盾/犹豫,验证集F1达0.7155。
筛选对视觉识别有效
提出VisionScreen,将筛选机制扩展到视觉识别,独立评估补丁相关性并排除无关补丁,性能优于ViT。
面向多域低资源OCR的多专家路由:以满文为例
针对满文多风格低资源OCR,多专家路由实现页面分类99.3%准确率,字符错误率低至0.30%。
用于自动化显微镜尿液分析的视频到全聚焦图像重建算法
提出录制手动调焦视频重建全聚焦图像,结合深度学习实现自动化尿液分析,简化多图像采集流程。
M⁴World:一个用于交互式物体操控和分钟级流式生成的多视图多模态驾驶世界模型
M⁴World支持物体级交互操控与分钟级稳定流式生成,通过多阶段训练和高效后训练实现长尾控制,达成高质量、精准可控的驾驶仿真。
VideoRAE:通过表示自编码器驯服视频基础模型进行生成建模
VideoRAE利用冻结视频基础模型的表示,轻量压缩为生成友好的潜在变量,实现高效重建与5倍加速收敛。
从像素到状态:将交互式世界模型重新视为游戏引擎
论文以游戏引擎循环为视角,从四个维度分析交互世界模型,并提供《黑神话:悟空》90小时数据集推动状态感知建模。
中文标题:医学图像采集与重建中的高效计算
中文摘要:CT、MRI等通过逆问题重建图像,高效计算是临床实用的关键。
EgoHTR:以自我为中心的地形穿越4D人体演示
构建EgoHTR数据集,含55个4D人体穿越序列,训练感知行走策略,实现机器人复杂地形部署。
基于表征锚定与语言-动作对齐的泛化VLA微调
锚定预训练表征并对齐语言与动作,提升微调VLA泛化性与成功率。
使用率编码脉冲神经网络与离散STDP学习的视觉地点识别
采用离散STDP脉冲神经网络的视觉地点识别新方法,通过闭式神经元分配、状态重置和速度补偿滑动窗口,在Nordland数据集上实现100%的R@100P。
Kepler-Encoder-v0.1:面向机器人的多模态嵌入模型
Kepler-Encoder融合状态与视觉训练,使纯视觉潜在恢复力和状态,超越基线且跨机器人通用。
前瞻性临床适应症、事后报告泄漏与多图像胸片分类中的融合设计:一项基于患者聚类的评估
前瞻性适应症与报告标签高度相关,置换感知融合竞争力强,事后报告文本存在循环偏差。
逆向LLaVA:通过文本到视觉映射重新思考多模态对齐
逆向LLaVA反转映射方向,无需对齐预训练即可高效推理,启示对齐非必要。
使用点嵌入变换器的多视角手部重建
POEM模型将静态基点嵌入多视角立体空间来融合特征,结合多数据集随机训练,实现高泛化的手部网格重建。
面向处理物体位姿不确定性的模块化料箱抓取框架
提出模块化料箱抓取框架,联合处理位姿不确定性与抓取误差,通过位姿分布估计与融合提高效率。
完全AI生成图像检测:定义、最新进展与挑战
系统综述完全AI生成图像检测,聚焦数据集构建与伪影提取,分析泛化性与鲁棒性,展望未来方向。
PersGuard:通过模型后门防止文本到图像扩散模型中的恶意个性化
PersGuard基于模型后门,在微调中动态保留或移除后门,有效防止未授权个性化,优于现有扰动防御。
高效LiDAR反射率压缩:基于扫描序列化的方法
SerLiC通过扫描序列化实现LiDAR反射率压缩,体积缩减超2倍,参数极少且速度快。
递归式ArUco标记:一种用于无人机着陆平台的可扩展基准标记设计
提出递归ArUco标记,通过改进比特采样实现任意深度递归,支持部分遮挡且具有唯一标识,允许多无人机同时精准着陆。
TCAM-Diff:三平面感知交叉注意力医学扩散模型
提出TCAM-Diff模型,通过三平面表示和交叉注意力扩散,降低内存需求,高效生成高质量3D医学图像。
基于视觉Transformer的EVAP模型利用Sentinel-2与Formosat-5影像进行灾后区域分割
利用ViT和弱监督扩展标签训练,提升灾区分割的平滑性与可靠性。
用于降水临近预报的时空Transformer
提出Satformer,将临近预报转化为分类问题并采用频率加权损失,在降水预测挑战中获第一。
皮质-SSM:一种用于脑电信号运动想象解码的深度状态空间模型
提出Cortical-SSM深度状态空间模型,集成捕获脑电时空频依赖,优于基线,实现可解释鲁棒的运动想象解码。
BenthiCat: 一个促进底栖分类与栖息地绘图的光声数据集
发布百万级多模态底栖数据集,含36000标注样本,用于分类与栖息地绘图,促进跨模态学习与基准建立。
ClusIR:聚类引导的通用图像恢复框架
提出ClusIR,通过可学习聚类建模退化语义,实现跨空间和频率域的自适应恢复,在多种退化下性能优异。
视觉Transformer的注意力多层融合
提出注意力层融合(ALF),动态融合视觉Transformer所有层表示,在20个数据集上显著提升线性探测效果。
GeCo:通过运动与结构评估视频生成中的几何一致性
GeCo通过融合运动与深度先验检测视频生成中的几何变形与遮挡伪影,作为无训练指导损失减少伪影。
追踪并描述任意运动:基于轨迹条件生成的开放词汇时空描述
提出TCAM框架,无需查询即可追踪并描述视频中任意运动,生成时序定位与轨迹指向的开放词汇字幕。
超越描述:具身智能体细粒度动作的认知基准测试
CFG-Bench评估细粒度动作认知,发现MLLMs物理交互指令与高阶推理困难,微调可提升具身基准性能。
SOTIF条件下大型视觉语言模型的2D目标检测比较评估
LVLM在自然退化下召回率超YOLOv5 25%,接近RT-DETRv4,但几何精度较弱,适合作为安全验证器。
当视觉压倒语言:评估与缓解VLA中的反事实失败
VLA模型因数据集偏差产生反事实失败,提出CAG双分支推理法,无需额外数据即可显著提升语言遵循准确率与任务成功率。
评估显微镜像素和物体分类的视觉基础模型
研究评估多种视觉基础模型,证实其比手工特征显著提升显微镜像素与物体分类性能,并建立基准。
用于楔形文字泥板元数据分类的新型网络结构
提出卷积启发点云网络,逐步降采样并整合邻域与全局信息,分类性能优于Point-BERT。
用于土地利用场景分类的视觉Transformer与卷积神经网络
比较CNN与ViT在遥感土地利用分类性能,发现CNN小样本稳健,ViT复杂场景更优但需更多资源。