基于时序分割与语义抽象的自我中心与外部视角程序理解框架
多模态工作视频经边界分割与事件卡片抽象,增量构建工作环境模型,实现隐私约束下紧凑可审计的检索。
STATERA:利用冻结时序管片实现零样本仿真到现实运动学的隐藏质量估计
冻结时序管片适配V-JEPA,单目视频零样本估计隐藏质心,仿真到现实迁移最优。
空间升维用于稠密预测
提出空间升维:将输入提升到高维空间并由3D网络处理,稠密预测性能更优,参数量与推理成本大幅下降。
涌现式物体绑定具有有限空间视界
预训练ViT冻结块嵌入可解码同物体信号,但绑定随距离指数衰减至非零下限,呈现有限空间视界。
编码却脱节:在激活补丁零结果下分解视觉语言模型失败
三种视觉语言模型中层虽编码答案却因果失活,补丁零翻转;错误分为感知失败、编码脱节、先验覆盖,且可学习。
目标检测中的域泛化与合成数据:赋能者、探针与鸿沟
目标检测域泛化研究稀缺;合成数据既是赋能者与探针,又存在合成到真实鸿沟,未来需兼顾定位与分类。
可达性不等于泛化:理解装配动作识别中的动–名分解
系统分析三数据集上的动–名分解:泛化主要靠共现插值,失败集中于大词表成分,共享编码器致成分纠缠。
看见城市,还是识别地点?VLM城市感知中街景影像较现有城市数据的增量贡献
街景影像的增量价值取决于视觉可读性与本地数据覆盖;部分属性上现有数据已匹敌甚至优于图像。
DSSR-3D:3D高斯中视角相关指代的解耦推理
DSSR-3D以解耦推理实现3D高斯视角相关指代分割,免重训练,并提出ViewRef-GS基准。
基于双对齐测试时自适应的鲁棒在线航空发动机叶片缺陷检测
ABDD测试时自适应框架,对齐全局风格与局部缺陷,用不确定性伪框过滤,提升域偏移下叶片缺陷检测鲁棒性。
EgoRefine:面向异步协同感知的自车参考预测对齐与轨迹条件可靠性感知融合
提出自车参考预测对齐与轨迹条件可靠性融合,缓解异步协同感知特征错位,提升3D检测精度。
DramaAgent:智能体驱动的故事视频生成
提出分层智能体框架,将长视频生成分解为故事规划、角色保持、分场合成与反思修复,提升长篇连贯与音画同步。
评估受控雾退化下反无人机检测的鲁棒性:雾感知训练与晴空性能权衡
首个按雾浓度分级的基准发现,反无人机检测性能随雾非线性骤降,雾感知训练提升全等级但牺牲少量晴空精度。
低接地分数并不意味着评判器未接地:识别多模态监督中的可感知性混杂因素
视觉接地分数受图像编辑可感知性限制,易误判为无依据;可用审计三量识别误报,并辅以未编辑图像检测上界。
GPEC:用于心脏视频描述生成的高效预LLM高斯过程嵌入校正
GPEC在大语言模型前校正视觉嵌入,提升心脏超声视频描述质量与内容对齐,推理开销低于0.05秒。
解码灾害:基于视觉语言模型与众源影像的多任务地理空间推理灾害制图
提出GRDisaster框架,融合视觉语言模型与众源影像,实现跨视角地理定位与可解释灾害严重度评估。
查询无关的可变码率视觉令牌编码
查询无关的可变码率视觉令牌编码:保留全部令牌,按率失真优化分配比特,无需文本,同预算下优于均匀编码。
超越像素重建:面向低资源满文历史文献的检索引导字形感知修复
提出检索引导的字形感知修复框架,为低资源满文历史文献引入字形级结构先验,提升修复质量与字形保真度。
面向磁共振成像分割的多分辨率特征融合U-Net
提出MRFF模块嵌入U-Net各层,提升MRI分割精度,两个基准数据集上优于先进模型。
LENS-GRF:用于痤疮严重程度分级与多评估者临床Oracle分析的带门控残差融合的置换不变病变证据网络
提出LENS-GRF,融合置换不变病变集合与门控残差进行痤疮分级,ACNE04准确率达95.89%。
PACT:从视频中端到端学习人体姿态、接触与力
PACT端到端联合学习,从单目视频估计人体姿态、接触与力,结合物理监督与数据标注,性能达最优且泛化。
从图像潜空间到模糊规则:胃肠道基础模型的可解释性分析
提出原型模糊规则框架,无需微调即可解释胃肠基础模型特征,精度媲美黑箱方法,并可分析合成医学图像。
LEGO-OPD:面向多模态在线策略蒸馏的因子化教师组合
因子化组合语言专家先验与视觉专家似然为单一教师分布,自适应校准视觉监督强度,兼顾视觉定位与语言推理。
格式塔:大型多模态交互模型
提出格式塔大模型,通过多模态交互金字塔、统一离散扩散与交互分区架构,增强跨模态整合。
Memorizon:超越上下文窗口训练世界模型
样本可覆盖任意长跨度却只评最后k块,按相机共视检索有界潜变量库,重访一致性显著提升。
分数稳固,基准泄漏:量化公共脑肿瘤 MRI 分类中的数据集污染
公共脑肿瘤MRI基准存在重复、患者及来源泄漏等数据污染;去重后性能仍稳,准确率难证基准完整。
PixelDense:将稠密预测作为像素扩散的表征对齐
PixelDense将SAM2、深度等稠密预测作为像素扩散对齐目标,分流语义与几何梯度,提升生成与编辑。
PhysVista:通过感知-推理-评估闭环对视觉语言模型中的物理智能进行基准测试
提出基准PhysVista,以感知—推理—评估闭环评测视觉语言模型物理智能,覆盖真实与生成视频,揭示其物理理解存在显著差距。
Vmem-φ:基于膜电位统计的脉冲神经网络低计算量分布外检测
膜电位统计助力SNN低算力OOD检测,提出Gen1-C基准与MDD,高严重度AUROC>0.88。
FORTE:面向长视频问答的自适应评分与精确关键帧选择
免训练FORTE自适应评分并精确选关键帧,兼顾相关性与时间覆盖,长视频问答平均准确率最高。
离散标注,连续偏好:重新思考面向准确且可泛化美学图像裁剪的监督
提出连续偏好场CPF,从离散标注恢复密集偏好,训练CPIC实现精准可泛化美学裁剪,并重校准基准CPICD。
VisionQ:面向计算机视觉定性分析的“VLM作为评判者”分类体系、数据集与基准
首个基于同行评审论文对比图的准则条件视觉判别基准,含分类体系、数据与评估协议,最强VLM评判者准确率仅63.1%。
HAWK:重新思考推测解码中的多模态草稿生成
HAWK融合目标层表示与压缩视觉隐状态,建模草稿后目标变化,提升多模态推测解码接受率与加速比。
利用视觉语言模型进行增强现实中感知质量评估与自主内容调整
基于视觉语言模型构建AR内容自动评估与调整框架,预测与主观评分相关达0.87,超九成用户认可。
什么构建了场景?亮度主导3D高斯泼溅中的几何形成
3DGS几何形成由亮度主导:仅亮度监督接近RGB重建,色度可在几何冻结后重拟合,色度单独监督较差。
仅对齐 x:对齐预测,而非表征
表示对齐收益难迁移至像素干净图像预测,JAx对齐跨噪声预测,提升FID与收敛,无需外部编码器。
SemanTok:可预测的语义令牌,实现高效自回归视频生成
SemanTok 让冻结 DINO 特征可由各 token 前缀单独重建,实现高语义对齐与视频保真,小模型媲美 3.4 倍大模型。
FedMAD:面向遥感图像分类的联邦学习调制感知定向聚合
提出FedMAD个性化联邦学习框架,分离全局与客户端参数,并设计调制感知定向聚合,抑制异构数据下的冲突更新。
《Soundwich:分层可控音频的视频生成》
Soundwich将冻结的音视频生成模型改造为生成多条与视频同步、可独立编辑的音频分轨的免训练框架。
基于推理与反思的个性化图像生成
提出首个基于用户历史的个性化图像生成基准,含场景与创意两任务,并推出推理-反思循环方法PEARL,指标平均提升15%。
手语机器翻译
综述手语机器翻译进展与挑战:数据集与评测不足,需捕捉三维同步结构,强调伦理及与聋人社群协作。
VTV-FM:通过变分终端速度闭合的流匹配
提出二阶流匹配框架VTV-FM,以最小化加速度能量推导缺失的终端速度,实现闭式闭合,提升传输几何与生成质量。
视频生成模型:后训练与对齐综述
首篇视频生成后训练与对齐综述,提出隐式/显式对齐框架,归纳四类方法、数据基准及开放挑战。
视频证据索引:从视频预览中学习该看哪里,面向 Token 预算受限的长视频问答
提出视频证据索引,用低分辨率预览构建高分辨率证据集,联合证据定位与预算规划,自蒸馏提升长视频问答。
为过多 Token 买单?基于简单启发式的有效且经济高效多模态 LLM 标注
系统评估短视频VLM标注启发式:准确率≠推断效度,单模态文本可能足够,2×8图像网格约15%成本达全视频理解。
VLM低层视觉表征中的几何相似性
提出GeoSim四层框架,分析24项低层视觉任务中AR与DiT表征的几何相似性,揭示共性组织原则及跨任务/模型局限。
Lang3DSeg:基于点变换器的无标注开放词汇3D分割
Lang3DSeg首次以点变换器为骨干,实现无标注开放词汇室外LiDAR分割,修正投影深度歧义,两大基准均达最优。
先对齐,后推理:面向配音的多模态唇同步评判器
提出无参考ATR多模态唇同步评判器:对齐唇动帧与文本音素后推理内容与时序,七语种及配音任务AUC显著提升。
SmoothOperator:通过调制标签平滑增强细粒度开放集识别表征
提出SmoothOP,按样本显著度动态调制标签平滑,提升细粒度开放集识别表征,最高增益4.7%。
CtrlWAM:意图与预见对齐的可控世界动作模型
提出CtrlWAM,用模拟器执行扰动动作并配加噪视觉,对齐意图与预见,提升世界动作模型可控性。