Towards Consistent Video Geometry Estimation
GenEraser:通过平衡文本-掩码引导与解耦定位器-保持器实现可泛化的视频对象移除
GenEraser提出文本-掩码平衡引导与解耦定位-保持架构,消除视频对象及物理效果,实现域外场景高保真泛化移除,性能提升2.16/1.44 dB。
未来强制:面向自回归视频生成的未来感知免训练KV缓存策略
利用历史查询分布估计未来重要性,无需训练地合并冗余令牌,提升长视频一致性。
FakeVLM-R1: 基于思维链内化物理定律的合成图像检测
融合GRPO与批判性思维链,内化物理定律实现双向推理,达SOTA并消除对真实图像的过拒偏差。
利用2D预训练先验提升零样本3D风格迁移
用2D预训练解码器弥补3D数据稀缺,实现多视图一致的高质量零样本风格迁移。
原生音视频对齐用于生成
提出NAVA框架,通过原生对齐与融合MMDiT实现高同步音视频生成及可控音色。
对话智能体评估:理解情感检测中的文化、情境与环境
针对非洲黑人社会开发情感预测模型,结合语音与图像识别七种情绪及讽刺,准确率85%-96%,提升对话AI可信度。
几何至关重要:用于学习语义对应的3D基础先验
提出利用3D先验自动获取实例几何,渲染特征过滤对应,训练轻量适配器提升语义对应,减少监督。
xModel-KD:基于LiDAR的3D场景感知中的跨模态知识蒸馏
提出跨模态知识蒸馏框架xModel-KD,通过对比学习融合2D纹理与3D几何,实现数据高效3D点云分割,mIoU提升2%。
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
提出GASP框架,注入几何先验,双目标训练大幅提升对应匹配精度,显著增强3D空间推理,无需VQA数据。
OmniCD:多模态语义引导的遥感图像变化检测基础框架
提出多模态语义引导的OmniCD框架,集成场景检索与风格解耦,引入30万+图像文本数据集,实现遥感变化检测SOTA性能。
SGMD:面向少步视频扩散蒸馏的得分梯度匹配蒸馏
提出SGMD方法,直接优化假分数并引入双势能,解决跟踪与运动保守问题,实现3倍加速与更优运动动态。
AnomalyAgent:用于零样本/少样本异常检测的无训练智能体模型
提出AnomalyAgent,利用多模态大模型推理能力进行零/少样本异常检测,无需训练,性能优于现有方法。
视频对象中心学习中的循环一致性
针对视频对象中心学习,提出隐式循环一致性,避免特征坍塌,优于显式方法。
PARCEL:面向高效视觉-语言理解的池锚定重采样与条件弹性查询
PARCEL通过池锚定重采样与条件弹性查询优化视觉令牌压缩,在多个预算下提升性能效率,优于现有方法。
LiveSVG:通过视频生成实现零样本SVG动画
LiveSVG利用视频扩散模型,无需骨架即可生成高质量SVG动画,显著优于现有方法。
中文标题:为何远处看起来在上方:探究视觉-语言模型中的空间表征
中文摘要:视觉语言模型混淆垂直位置与距离,反映自然图像透视偏差,随数据扩展加剧,降低空间推理鲁棒性。
IP-Adapter就是一切:迈向免微调的扩散模型说话人脸生成
提出免微调扩散框架,利用Stable Diffusion和IP-Adapter,三组件提升唇同步与视觉质量,超越现有方法。
DéjàView:循环变换器用于多视图三维重建
DéjàView用单个循环块递归迭代K步进行多视图3D重建,参数少性能优,验证显式迭代是更强的归纳偏置。
基于主动RGB-NIR成像的环境鲁棒逆渲染
利用近红外闪光照明,三阶段逆渲染准确重建几何和反射率,在多环境光照下性能领先。
PhyGenHOI: 物理感知的四维动态人-物交互生成
提出PhyGenHOI框架,耦合运动扩散与物质点法,生成物理一致的四维人-物交互。
Stable-Layers:基于VLM评分强化学习的图像分层分解模型微调
提出Stable-Layers框架,用VLM反馈强化学习微调图像分层分解,通过两阶段评分解决奖励信号压缩,效果更优。
BullingerDB:用于手写文本识别和作者检索的数据集
基于布林格书信的大规模多语言历史手写数据集,含796位作者,文本识别CER达9.1%,作者检索mAP为78.3%。
SAM3D-Phys:迈向真实世界中的多物体交互式模拟
SAM3D-Phys从重建场景恢复完整物体几何,通过物理优化与纹理蒸馏保持场景一致性,实现多物体交互模拟。
GenClaw:代码驱动的代理图像生成
GenClaw通过代码驱动的分阶段流程,将黑盒图像生成转变为可控、可解释的类人创作过程。
基于稳健评分准则的强化学习
提出RLR^3方法,将任务级验证扩展至准则级,通过最小暴露与层级聚合,在15项基准上平均提升4.7分。
minWM:一个用于实时交互式视频世界模型的全栈开源框架
minWM通过因果强制蒸馏等方法,将视频扩散模型转化为低延迟、相机可控的交互式世界模型。
VideoFDB:评估对话代理的全双工视觉-语音能力
首个全双工音视频对话基准,发现系统普遍忽视视觉流、仅用于显式问答,无法实现自然对话中的流式视听融合。
LoMo:局部模态替换实现更深层视觉-语言融合
LoMo通过将文本片段渲染为图像来解决模态替换性能下降问题,提升跨模态融合,在LLaVA和Qwen上分别提升2.67和2.82点。
超越运动基元:基于头戴式IMU的行为活动识别
提出超越运动基元的行为识别方法,构建16万样本数据集,设计703K参数HiT-HAR模型,实现五类行为识别,优于现有方法。
假设世界:面向具身场景中通用世界模型的因果基准
新基准测试表明,视频生成模型因果推理能力差,最高仅52%,细微干预仅14%。
AdaMerge:面向视觉Transformer免训练加速的显著性感知自适应令牌合并
AdaMerge首次整合显著性加权与自适应层缩减,免训练优化令牌合并,提升ViT加速的精度-FLOPs边界。
基于表征条件的扩散模型用于引导式训练数据生成
表征条件扩散模型生成合成图像,显著提升分类性能,超越真实数据。
基于扩散的乌克兰手写文本生成与跨域风格迁移
构建乌克兰手写数据集,重新训练扩散模型,实现跨域风格迁移,生成风格一致的乌克兰手写文本。
Melanoscope AI移动皮肤镜临床决策支持系统的临床验证
176例验证:恶性病变零假阴性,特异性88.3%,支持筛查。
微调视觉语言模型以理解当前损伤并借助质量卫士代理进行优先级评分
微调VLM识别桥梁损伤并自动优先级评分,2k训练样本已达近最优,质量卫士过滤低质输出。
中文标题:融合异构注意力结构的Transformer模型通用解释方法
中文摘要:提出Transformer异构注意力结构通用解释方法,实验分析代表性模型语义与逻辑机制。
从情感到复杂行为:第十届ABAW研讨会与竞赛推动多模态人本AI
第十届ABAW研讨会和竞赛推动真实环境下情感与复杂行为分析,涵盖连续情感、离散表情及暴力检测等挑战,促进多模态人本AI基准与创新。
D²Turb:面向单帧大气湍流缓解的深度感知模拟与解耦学习
提出D²Turb框架,引入深度感知合成与解耦学习,分解为纹理去模糊和几何校正两阶段,实现SOTA性能。
异步遥感时间序列融合用于去云与任意时相重建
提出AGFlow模型,实现异步S1/S2融合去云、时间序列重建及任意时相查询,性能优于现有方法。
结构重于像素:学习变长视觉程序
提出STROP架构,学习变长视觉程序,通过特征质量引导码本,无需像素重建。
分割模型能否理解世界?迈向基于视觉思维链的主动功能推理
SegWorld通过视觉思维链主动推理场景,在意图级指令下显著提升分割性能。
多模态大语言模型在农业图像解读与生成任务中的幻觉行为
研究发现多模态LLM在农业图像解读与生成中普遍存在生物不一致等幻觉,准确率有限,需提升可靠性。
ForestHG-Trace:大规模森林场景下可追溯的长时域生态推理
提出ForestHG-Trace框架,用生态超图表示森林场景,结合LLM与确定性工具实现可追溯推理,提升长时域生态问答准确性。
并非所有NVFP4 QAT方法都相同:架构与规模如何影响异常分割的模型质量
架构选择最关键,注意力模型对量化配方鲁棒,CNN在大规模下退化;Swin Transformer最优。
张量记忆:用于长程变换器的固定大小循环状态
提出固定大小3D记忆张量模块,实现恒长状态与空间偏置,解决长视频理解难题。
面向产品评分预测的有界计算多模态回归
用轻量MLP替换语言模型头并固定输入,实现有界计算多模态回归,在资源受限下取得强基线结果。
马氏距离PatchCore:协方差感知且支持流式处理的工业异常检测
用马氏距离和流式训练改进PatchCore,降低内存占用并提升工业异常检测性能。
AndroidDaily:面向真实闭源应用的可验证移动GUI智能体基准
提出含350个日常任务的基准及GRADE自动评估方法,实现闭源应用可验证评测,最强模型成功率62%,揭示能力差距。
联邦学习中的解耦训练与局部强化微调
提出FedDTL框架,解耦图像与文本编码器,通过局部监督强化两阶段微调,平衡全局适应与泛化。