MotionSync:非因果精化因果跟踪器,赋能标签高效3D感知
MotionSync在因果跟踪器上加非因果细化,25%标签即达96.9%全监督mAP,并可自训练改进。
TRINITY:个人风格视频高光检测的多视角基准
提出TRINITY基准,将视频高光分解为事件、情感、自然三维度,多分支架构并行预测,显著优于基线。
CineForge:面向长时程视频生成的自我改进智能体
CineForge通过跨故事策略演进实现自我进化,将视频生成指标从4.024提至4.380,并减少37%审查调用。
大型视觉语言模型中的护栏无关社会偏见评估
提出去耦评估法规避护栏拒答,揭示LVLM在人物无关任务滥用人口统计信息,闭源偏见较低。
SPLG-Mamba:面向光学遥感图像显著性目标检测的结构保持局部-全局Mamba网络
提出SPLG-Mamba,集成平滑细节重校准、局部-全局Mamba和门控跨尺度融合,在三个数据集上取得最优且结构更完整。
NepScript Genesis:用于手写天城文数字合成的神经架构搜索
提出NAS框架自动生成手写天城文数字,FID降76.19%,数据增强提升分类准确率5.5个百分点。
低资源语言能互相借鉴什么?
提出PSMC框架,融合跨语言专家,提升低资源OCR识别率,在10种印度文字上平均提高2%。
重新审视长时程流式三维重建中的局部上下文
提出ABot-Recon,仅缓存11帧KV特征预测局部点图与位姿,组合恢复全局,减少漂移,长序列基准精度显著提升。
ShiftSplit-AD:在基础特征视觉异常检测中分离域偏移与缺陷
将残差分解为低秩与行稀疏,仅用稀疏分量评分;能提升域偏移下性能,但会损伤干净样本检测,存在权衡。
VidParse:专业级在线解析第一人称操作流程
无需训练,基于图约束与时序相似性在线解析第一人称视频步骤,精度提升10倍。
FVeinSyn:合成指静脉图像生成器
提出指静脉合成数据生成框架,解耦血管拓扑与成像,生成五十万样本,跨八个数据集,平均精度提升27.43%
基于概率事件的量子感知
提出概率事件计算原语,用递归贝叶斯推断处理单光子流,实现极暗环境下的实时感知,比现有快4个数量级。
报告监督
R-Super利用影像报告监督肿瘤分割,弥补掩膜不足,显著提升检测与分割性能。
基于YOLO与RT-DETR的边缘深度感知坑洞检测
提出深度感知坑洞检测框架,对比五种模型,YOLOv8nSeg在精度与深度估计上最优,边缘推理最快达3.6ms。
ABCD:阿尔法合成块坐标下降——大规模辐射场的恒定显存训练
提出ABCD,以块坐标下降训练辐射场,仅激活一个块,预渲染其余为前后景,显存恒定,质量近于3DGS。
代码即世界:智能体发现可执行世界表示以进行物理推理
提出代码即世界范式,用可执行代码表示物理世界,智能体循环发现验证,为视觉语言模型提供物理推理监督,性能最优。
从透视到鱼眼深度估计与开放词汇分割
提出可学习参数DEX,将鱼眼图像潜在特征对齐透视图像,提升深度估计与分割性能,并支持相机标定。
铁:增强通用虚拟代理的意图对齐与回溯式双重学习框架
提出Iron双重学习框架,用逐步循环一致奖励对齐动作与意图,并回溯利用失败轨迹,提升GUI代理训练效率与性能。
关系知识蒸馏使深度网络表示接近人类,可在无监督下对齐
关系蒸馏使DNN表示接近人类,实现无监督细粒度对齐,改进源于更类人的全局结构。
StreamEMS:基于自进化记忆机制的视觉语言模型流式视频理解
提出StreamEMS,通过语义与先验进化模块重构记忆表征,提升流式视频理解,在OVO-Bench等数据集上优于现有方法。
交互表征究竟在测量什么?弱监督暴力检测中的事件前可分离性
暴力检测中,姿态交互表征未优于粗粒度几何;评分受事件前来源痕迹(标题卡、水印)影响,掩盖表征差异。
CommerceVibe:通过双反馈强化学习将电商创意设计为可执行视觉代码
将电商创意表示为可执行视觉代码,利用规则与视觉语言模型双反馈强化学习,显著提升生成质量与可编辑性。
DensityKV:面向长视频生成的密度引导KV缓存压缩
提出密度KV方法,无需训练,用密度引导管理KV缓存,减少冗余积累,提升长视频一致性与稳定性,存储有界。
时间思维树:推理引导的视觉线索搜索用于长视频理解
提出时序思维树框架,先全局定位再局部细查,自适应搜索视觉线索,提升长视频理解性能。
神经纹理压缩的线程高效解码
共享解码器与渐进冻结训练,结合纹理聚类,降低线程发散25%-52%,速度提升8.48倍且画质不变。
uScenes:面向水下机器人感知的多模态RGB和3D声纳数据集
uScenes多模态数据集:同步3D声纳点云与RGB,110场景9.5万观测,用于水下传感融合与三维理解。
PCBnet:面向原理图图像的SPICE网表数据集与自动构建方法
提出大规模PCB原理图数据集及自动化网表构建流程,检测识别精度高,为AI PCB设计提供基准。
不确定性感知多器官超声分类中架构复杂性的受控审计
受控审计显示,简化模型(Simple-CE+TS)在标定与选择性风险上优于完整EDL,且无可靠增益。
面向通用视频理解的免训练时间抽象
免训练STITCH将视频切成语义时间块,复用于边界检测、片段检索和帧选择,少帧时更佳。
GAAT:多模态无人机感知的几何感知对齐Transformer
提出几何感知对齐变换器GAAT,通过同步视图变换学习几何先验,实现稀疏融合,在六项无人机感知任务上最优。
ZipMVS:压缩成本体积的多视图立体匹配
提出深度假设策略压缩成本体积,大幅降低GPU内存占用并保持重建精度,在DTU和Tanks and Temples上取得竞争性平衡。
A-PAIR:空地跨视角指代行人检测的基准与身份一致定位框架
提出A-PAIR基准与ICRG框架,解决空地跨视角指代行人检测身份一致性,配对F1升至22.28%。
基于GAN的车联网图像传输语义通信
提出基于GAN的车联网图像语义通信,采用语义优先和多尺度重建,实现高保真传输,优于现有方法。
大型视觉-语言模型中缓解幻觉的动态对齐补偿
提出动态对齐补偿,无需训练,检测表征退化与漂移并修正,减少幻觉且保持性能。
面向视频多模态大语言模型的视觉令牌编码
提出视觉令牌编码,借鉴视频编码预测残差压缩令牌,动态分配下用一半令牌保持100.1%性能,免调优即插即用。
3D-USE:从图像级到场景级水下增强
提出3D-USE:介质感知表示与外观一致传递实现场景级水下增强,无需成对数据,提升可见性与跨视图一致。
CF-YOLO:面向伪装工业微缺陷检测的上下文感知特征精炼
提出CF-YOLO,含上下文感知聚合与特征精炼模块,突破伪装微缺陷检测,自建数据集上较YOLOv11提升2.2% mAP,兼顾实时性。
任务状态适配与原型记忆用于多任务密集预测
提出MemMTL框架,用任务状态原型记忆和稀疏路由适配多任务密集预测,需重生成实验数据。
扩展Sim(3)配准:基于扩展Sim(3)配准的2D-3D对应点剪枝
提出Ex-Sim(3)-Reg,将2D-3D对应剪枝建模为扩展Sim(3)配准,显式处理深度噪声,在多个数据集上配准召回率提升达24.7%。
属性标记算术:视觉自回归模型的解耦与连续语义控制
提出属性标记算术(ATA),仅用单张参考图学习语义方向,即可在自回归潜空间实现解耦、连续的属性控制,无需重训。
VersaGauss:基于3D高斯的通用多相动力学生成框架
提出VersaGauss,基于3D高斯从少量图像生成多相动态场景,优化粒子分布,支持多种材料交互。
Cyc3D:评估图像到3D生成中的循环结构稳定性与资产可用性
Cyc3D基准:从跨视图一致性与表征质量评估图生3D,闭环重渲染测漂移;最优方法循环稳定性仍低于48。
令牌预算蒸馏:将全令牌语义迁移至压缩视频视觉语言模型
令牌预算蒸馏通过双路径师生蒸馏,在压缩视频令牌下保留全令牌语义,实现高效微调。
赋能地方农业:基于深度学习的孟加拉芒果品种识别网络系统
提出深度学习芒果识别系统,EfficientNetB0达97.36%测试准确率,并集成至Web应用,助力孟加拉农业。
Manifold4D:在点云渲染流形上去噪的视频重拍方法
该方法将渲染注入初始噪声而非条件流,仅用一次,提升轨迹控制与保真度,降低旋转和平移误差。
视觉-语言模型源完全自由适应中的双流语义引导与原型锚点校准
提出DSSG-PAC,双流语义引导与原型锚点校准,解决无源VLM适应语义漂移,性能最优且提速近两成。
EXPOSE:使用稀疏自编码器从病理视觉基础模型中生成可解释且域鲁棒的嵌入
提出可解释稀疏自编码器框架,抑制域特定特征,提升病理模型跨域鲁棒性。
NumBench:诊断文本到图像模型中的计数失败
提出NumBench基准(64万提示、1600类,数量1-100),发现计数随数量增加急剧下降,超50个物体时所有方法均表现弱。
Cut-ViT:基于Gram锚定子空间一致性的任务特定模型剪枝
提出Cut-ViT,通过Gram锚定子空间对齐实现高效任务特定剪枝,多数据集达最优,仅用20.9%时间。
WALDO:杂乱场景中的单样本示例条件目标检测
提出WALDO:用冻结V-JEPA特征做单样本条件检测,优于DINO,但实例识别仍弱。