多模态智能体的任务聚焦记忆机制
提出TaskMem框架,通过强化学习两阶段训练让记忆聚焦任务相关内容,在流媒体基准上提升VQA准确率约6-7%。
使用混合复数网络(HybridCVNet)的PolSAR图像分类
混合复数网络HybridCVNet融合CV-CNN与CV-ViT,PolSAR分类精度达97.39%(Flevoland),Kappa 0.972(旧金山)。
用于乳腺X线报告生成的跨模态临床知识整合
提出MammoRG框架,模拟临床流程整合先验知识,生成报告并开发解析工具,显著提升诊断相关F1分数。
重新定义实例匹配:全景分割评估中面向部分感知匹配的统一框架
提出基于顶点计数的四种匹配策略,重新定义PQ框架,支持部分感知评估,开源工具实现。
iVGR:通过强化学习将视觉基础推理内化到多模态大语言模型
提出iVGR框架,通过强化学习将视觉定位能力内化到文本推理,避免显式基础干扰,显著提升细粒度任务性能。
通过重建来记忆:视频流上的测试时训练进行域增量学习
提出允许并利用灾难性遗忘的域增量学习,通过在线测试时训练匹配LoRA适配器恢复域记忆,适用于视频流。
NTR:面向端到端驾驶场景令牌瓶颈的神经令牌重建
NTR通过自蒸馏掩码重建约束场景令牌瓶颈,提升视觉表示紧凑性与规划性能,实现SOTA。
Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning
QVGGT:训练后量化的视觉几何基础Transformer
提出QVGGT量化框架,通过混合精度、token补偿和尺度搜索,实现VGGT近无损W4A16量化,内存减3-4.9倍,速度升2.8倍,使边缘设备高保真3D感知可行。
FOCUS: 通过视觉支持约束与策略优化实现上下文目标定位
提出无类别监督的两阶段训练框架,结合GRPO优化定位误差,7B模型性能超越72B,实现鲁棒实例级定位。
无条件扩散模型中低层感知编辑的指导
提出无需训练框架,提取退化概念向量,结合瓶颈修补与无分类器指导,引导采样远离退化流形以改善图像。
面向安全人机协作的视觉语言模型碰撞感知探究
TouchSafeBench基准评估VLM碰撞感知,模型Macro-F1低于50%,表明视觉流畅不代表物理责任感,需绑定视角、形态和几何。
BIAS-ID:分析AI生成图像检测器中变换偏差的框架
提出BIAS-ID框架量化AI生成图像检测器的变换偏差,评估显示多个先进方法受偏差严重影响。
SpatialAct:探究VLM智能体在三维场景中的空间推理到行动能力
SpatialAct基准揭示VLM存在推理-行动鸿沟:孤立推理尚可,多轮交互中空间信念与行动可靠性不足,远逊人类。
任意场景检测:一种基于经验感知推理的智能体目标检测框架
提出DetAS智能体框架,利用多模态大模型动态组合恢复与检测模块,通过经验推理提升适应性,平均F1提升28.36%。
轻量交互:交互式视频世界模型的免训练推理加速
轻量交互框架利用自适应计算和缓存加速,实现交互式视频模型2.59倍免训练加速,保持视觉质量。
用于自动驾驶点云语义分割的普通ViT
提出VaViT,用普通ViT通过优化分词器、轻量解码器和数据增强,实现点云语义分割SOTA性能。
语言训练深度伪造检测器的正则化力量
利用语言正则化与双编码器架构,通过两阶段训练提升深度伪造检测的泛化与可解释性,大幅超越现有方法。
从局部几何到全局伪标签:协变量偏移下鲁棒的正-无标记学习
提出SPUNA方法,利用局部流形结构在PU学习中检测协变量偏移,性能媲美全监督。
基于修正流变换器的概率降水临近预报
提出FREUD模型,基于修正流变换器实现概率降水临近预报,在SEVIR基准上取得最优,有效捕获极端事件不确定性。
早期算术教育中文本到图像模型生成视觉表示的基准测试与增强
研究引入方程到视觉生成任务,构建基准测试,发现T2I模型计数和关系错误多,增强策略部分改善,但需更强数值关系基础。
粗引导分层表面采样的拓扑一致多视角三维头部重建
提出SHELLS框架,通过粗引导分层采样解耦特征与网格,显存降88%,加速3.5倍,合成数据训练即可泛化真实场景。
潜在几何和弦用于查询高效决策型对抗攻击
提出LGC方法,结合曲率感知几何搜索与残差对抗生成,实现高保真攻击,SSIM>0.99,LPIPS<0.01。
超越分类:面向持续多模态检索的动态适配器路由
提出动态适配器路由(DAR),通过原型路由和模型合并,在持续多模态检索中表现优异且泛化性强。
TALON:面向6自由度航天器姿态估计的令牌对齐轻量级适配器
TALON在冻结ViT中注入<5%参数的时空适配器与令牌对齐损失,SPADES误差降50%,SwissCube精度提21.8%,零样本跨域误差降4.7倍。
HiERO-StepG在Ego4D步骤定位挑战中:层次化活动理解实现零样本步骤定位
基于弱监督层次表示学习,零样本步骤定位挑战中排名第二,无需程序特定标注。
超越少数样本:面向少样本非典型布局到图像生成的解耦语义与基元
提出解耦语义与基元的框架,通过语义锚定和基元注入,在5-shot非典型布局图像生成中显著提升视觉保真度与对齐性。
ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准
ERGeoBench评估多模态大模型在具身地理定位中的感知、空间、常识与定位推理,发现细粒度与空间一致性仍是挑战。
DriveMA:基于可验证元动作的驾驶视觉-语言-动作模型
提出DriveMA框架,用可验证元动作桥接语言-动作差距,结合强化学习,在驾驶规划上达到新SOTA。
DecMem:迈向分钟级一致世界生成的解耦记忆
提出DecMem解耦记忆架构,解决长程外推的计算效率与注意力分散问题,实现分钟级高保真一致视频生成。
VisionPulse:面向高效多模态推理的动态视觉稀疏性
VisionPulse在推理中逐步剪枝视觉token,每步仅保留5%关键token,缩短推理轨迹11.2%,精度几乎不变。
用于荧光显微镜中稳健的线粒体实例分割的SAM
通过合成荧光显微数据微调SAM,解决数据稀缺与领域偏移,提升精度与平均Dice分数。
TokTalk:基于音频-LLM令牌的富有表现力的实时面部动画
TokTalk直接利用音频LLM令牌实时生成3D面部动画,延迟低、表现力强,质量优于现有方案。
从细粒度视觉差异中学习:通过上下文视觉对比优化减轻多模态幻觉
提出IC-VCO,以共享多图像上下文与硬负样本编辑,缓解多模态幻觉,性能最优。
跨相机双合成参考的复印检测模式认证
提出跨相机双合成参考框架,结合注册捕获与数字模板,提升复印检测模式认证的鲁棒性和性能。
FSM-Net:一种用于真实场景去模糊的高效频率-空间网络
提出FSM-Net,融合频率注意力和交叉门控视觉模块,以4.94M参数实现33.144dB PSNR,高效真实去模糊。
YARD:用于大型视觉语言模型中高效缓解幻觉的Y架构寄存器解码
YARD通过Y架构中间层分支,用寄存器令牌替换视觉令牌,避免极端对比和二次推理,高效缓解LVLM幻觉。
三角形溅射SLAM
提出基于可微三角形的密集RGB-D SLAM系统,在线渲染三角形汤实现跟踪建图,支持实时网格编辑与碰撞检测,3D几何精度优于基线。
Astra:一种适用于三维CT的通用报告生成基础模型
Astra是通用CT报告生成基础模型,通过风格协调和强化学习实现高诊断准确率,显著提升临床效率。
嵌入模型如何绑定概念?
研究发现CLIP绑定函数复杂致泛化差,但通过足够数据训练transformer可实现系统泛化。
特征优化的自适应三维场景重建视觉
提出自适应特征优化前端,通过评分分配预算,提升重建完整度并降低误差。
在视频以对象为中心的学习中无需显式正则化内化时间一致性
提出隐式时间一致性内化方法,通过通道分解与跨时重构排除显式损失,提升视频对象发现与识别性能。
用上下文提示调优个性化你的大型视觉-语言模型
提出ICPT,用轻量投影模块及几何正则化实现多概念精准个性化,达SOTA精度。
SVI-Bench:面向战略视频智能的动态微世界
SVI-Bench以团队体育构建动态微世界基准,评估从感知到战略的视频智能,模型战略任务准确率仅5%。
利用术前CT自动预测术后胰瘘
提出基于术前CT的深度学习流程,自动分割胰腺并预测术后胰瘘风险,辅助手术决策。
SMART:面向足球姿态估计的SMPLest-X网格适配与RAFT跟踪
SMART结合SMPLest-X微调与RAFT光流跟踪,在FIFA挑战中将分数从1.053降至0.647(改善38.6%),测试集0.593。
RayDer:来自真实世界视频的可扩展自监督新视角合成
RayDer提出统一前馈Transformer,利用动态视频监督,实现自监督新视角合成的高效缩放,零样本性能媲美监督方法。
增强仓库设施中计算机视觉模型的泛化能力:以垂直物料搬运系统异常检测为例
实验室优化相机布局与模型选择,泛化至仓库异常检测,简化部署并节省标注与重训练资源。
VolFill:基于体积流匹配的单视图非模态三维场景重建
VolFill结合3D VAE与扩散Transformer,从单图像重建完整场景几何,性能显著超越现有基线。
模糊输入下视觉-语言模型对女性表征的抑制
模型在模糊输入下内部编码女性但输出男性,提出LALS指标揭示性别表征解耦与信号不对称抑制。