KGEdit:面向无训练精确视频生成与编辑的歧义感知知识图谱
提出KGEdit框架,通过歧义感知知识图谱和结构语义注入实现精确视频生成与编辑,优于现有方法。
通过逆动力学学习缓解视觉-语言-动作模型中的状态混叠
提出逆动力学学习直接监督视觉编码器,缓解状态混叠,提升机器人操控性能。
RadioFormer3D:低空空域中基于生成模型的弱监督三维无线电地图估计
RadioFormer3D通过弱监督和生成建模实现低空3D无线电地图估计,在未标记高度上重建更优,精度与效率平衡。
GiPL:面向跨域小样本目标检测的生成式增强迭代伪标签
提出双分支框架,通过迭代伪标签自训练与生成式数据增强,充分挖掘支持集并抑制过拟合,显著提升跨域小样本检测性能。
TAE:面向夜间无人机跟踪的目标感知增强器
TAE提出目标感知低光增强框架,利用跟踪框弱监督实现区域自适应增强,并构建夜间跟踪基准DarkSOT,显著提升性能。
从通用视觉到可靠的可通行性估计:适应非结构化室外环境的视觉基础模型
提出ViTA框架,通过可学习提示与几何蒸馏,融合语义与几何信息,实现高精度可通行性估计并大幅降低误报。
从3D高斯泼溅中学习表示
本工作比较了多种几何深度学习架构对3D高斯泼溅场景分类的效果,揭示了架构差异和高斯属性对表示质量的影响。
DefSynUS:基于形变感知CT-超声域自适应的患者特异性实时肝内血管识别
提出形变感知CT-超声域自适应方法,无需术前超声即可实时识别肝内血管,单例临床可行,仍需多患者验证。
优化潜变量表示实现星上建筑物损伤鲁棒评估
星上AI系统编码预灾图像为潜变量,与灾后图对比,实现稳健建筑物损伤评估并减少下传数据。
BitC-3DGS: 基于比特压缩的高容量3D高斯泼溅水印
BitC-3DGS通过比特压缩将多比特编码为单一语义token,实现128位高容量水印,恢复精度与64位方法相当。
ReactBench:多模态幻觉原因驱动的系统评估基准
ReactBench通过多任务和思维链分析,系统揭示多模态大模型四种幻觉原因,提供可解释评估基准。
SuperVoxelGPT:用于自回归形状生成的自适应有序3D标记化
提出自适应有序超体素标记化框架,序列长度降至12.8%,速度提升10倍,生成质量达最优。
通过原型反馈学习上下文条件化的谓词语义
AlignG通过原型反馈学习图像相关的谓词语义,防止语义漂移,提升场景图生成性能。
Brain-IT-VQA: 从大脑信号到答案
提出Brain-IT-VQA及NSD-VQA,从fMRI解码视觉问答,性能显著提升,并分析脑区贡献。
基于双级竞争的无遗忘知识分配用于类增量学习
提出无遗忘分配与双级竞争方法,优化适配器利用,解决类增量学习中的遗忘问题。
AgentCVR:基于脚本模拟强化学习的主动式多智能体跨视频推理
提出AgentCVR多智能体框架,用脚本模拟强化学习训练,在跨视频推理中超越单次基线,性能媲美闭源系统。
DiffSpot:视觉语言模型能否察觉网页界面中的细微视觉差异?
DiffSpot基准测试显示,视觉语言模型对网页界面细微差异识别能力有限,最佳模型召回率仅40.7%。
CogniVerse:以认知反思与几何推理革新多模态检索增强生成
CogniVerse通过认知反思减少噪声、黎曼流形对齐跨模态、最优传输损失平衡局部全局,显著提升准确性与连贯性。
MARTIAN:基于HiRISE轨道数据的火星空中影像渲染框架
开源Blender框架,利用HiRISE数据合成火星航拍视图,解决标注数据稀缺问题,支撑视觉导航。
OccamToken:无需训练且预算自适应的令牌剪枝实现高效VLM推理
OccamToken通过注册锚定相对证据测试,无需训练实现动态阈值剪枝,大幅压缩视觉令牌并保持高精度。
改进CLIP适配:通过打破尾部对齐实现源域无关的跨域小样本学习
打破尾部对齐可避免过拟合,提升CLIP在跨域小样本场景的性能,提出ATHA方法。
几何引导的基础特征建模实现可泛化的物体形状变形学习
提出几何引导特征建模与多视图自适应聚合,实现跨视角与类别的3D形状泛化变形重建。
SLAD:面向任务特定蒸馏的共享LoRA适配器
SLAD通过共享LoRA适配器增强师生特征对齐,实现更快且性能更优的任务特定蒸馏。
无监督语义分割促进模型理解
提出无监督语义分割可视化协议,揭示模型位置偏差与边界伪影,区分位置效应与局部性偏差。
SAFE-Pruner:面向高效视觉-语言-动作操控的语义注意力引导的未来感知令牌剪枝
利用未来层注意力线索进行令牌剪枝,加速VLA推理1.89倍,成功率损失低于1.7%。
高效、无需验证的面向大规模人脸识别数据集的内在质量估计
提出内在质量(IQ)指标,结合邻域一致性与有效秩,无需训练即可快速评估人脸数据集潜力。
GeoMag:基于状态空间模型的几何感知视频运动放大
提出GeoMag,利用状态空间模型实现几何感知视频运动放大,线性复杂度,结合新数据集,提升视觉一致性和效率。
S2MDF:一种用于无交叉多对象符号距离场的即插即用层
提出硬约束模块S2MDF,消除多对象SDF交叉至数值精度,保持重建质量,轻量即插即用。
面向语义分割中单次前向逐像素分布外检测的能量感知NECO
提出混合NECO与Energy分数的单次前向OOD检测器,AUROC达0.8539,优于基线且高效。
Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language
低倍率SEM可能足够:用于氧化锆增韧氧化铝多尺度断裂原因分类的可解释深度学习
可解释视觉变压器自动分类陶瓷植入物断裂原因,低倍率性能堪比高倍,辅助质量保证。
DVSM:纯解码器视角合成模型的正确做法
纯解码器KV-cache隐式场景表示,参数更少且优于编码器-解码器;共享权重对齐特征,结合先验与分阶段训练,新视角合成达SOTA,密集视图下甚至超越3DGS。
参数高效子空间解耦ViT用于缓解组织学评分中的多任务负迁移
提出子空间解耦多任务ViT,用轻量适配器与正交约束减少任务干扰,提升泛化性并降低计算成本。
超越人口统计学的公平性:在医学成像中优化基于外观的隐藏队列的性能
提出LHCF训练范式,聚类外观发现隐藏队列优化公平性,无需人口标签即可实现最优公平。
用于时间动作定位的掩码扩散视觉-语言模型
提出掩码扩散视觉语言模型用于时间动作定位,通过双向注意力与边界感知掩码实现联合细化,提升时序推理和边界定位精度。
密集城市非正规住区建筑与道路识别:一个数据集与基准
推出DenseUIS数据集,首个针对密集城中村的高分辨率遥感数据集,评估现有模型发现局限,为复杂非正规环境精细制图提供基准。
DGSG-Mind:用于长期场景理解与定位的动态3D高斯场景图
提出DGSG-Mind动态3D高斯场景图系统,实现鲁棒跨模态融合与长期理解,零样本3DVG及语义分割最优。
通过屏障调节的自适应闭合形式引导缓解视觉语言模型幻觉
提出BRACS框架,监测视觉基础,仅在地基恶化时自适应闭式校正,有效降低幻觉并提升效率。
少步高效,性能更优:面向视频时刻检索的高效跨模态片段修剪方法
提出SpotVMR,高效修剪查询相关片段,作为即插即用模块提升检索效率与性能。
DocRetriever:一个即插即用的多模态文档检索框架及综合基准
DocRetriever框架通过布局感知稀疏编码和推理增强排序,提升多模态文档检索精度与泛化性,并构建新基准MultiDocR。
EVL-ECG:基于多层面异构知识蒸馏的高效心电图解读
EVL-ECG通过多层面异构知识蒸馏实现高效心电图解读,AUC提升2.4%,适合资源受限环境。
训练智能体而非专家:学习驾驭异构专家进行多轮视觉推理
提出VisHarness视觉智能体,解耦高层推理与低层执行,轻量训练驾驭异构专家,在多轮视觉推理中超越通用模型。
篮球场景中基于网格感知的对极匹配的多视角多人3D姿态估计
提出无训练框架MAEM,利用单目人体网格与两阶段对极匹配,实现篮球场景鲁棒3D姿态估计,无需域内训练。
SwInception——局部注意力与卷积的结合
提出SwInception架构,在Swin Transformer的FFN中引入Inception卷积块,增强归纳偏置,提升医学图像分割性能。
CityGen:面向跨城市自动驾驶的结构引导城市风格合成
CityGen通过高精地图与视觉提示实现零标签城市适应,提升跨城市自动驾驶鲁棒性。
基因对齐的患者表征提升血液学诊断
通过两阶段对齐白细胞图像与基因数据,提升血液学诊断性能,优于现有模型并提供检索能力。
EarlyTom:早期令牌压缩实现快速视频理解
EarlyTom在视觉编码器内部进行早期令牌压缩,减少TTFT达2.65倍,FLOPs降低61%,精度不变。
FRUC:基于未标定协作驾驶视图的前馈式动态场景重建
提出FRUC框架,以未标定多车视图前馈重建动态场景,通过因果遮挡场和残差去噪鲁棒补全盲区,渲染质量与效率达SOTA。
VisualThink-VLA:面向高效低延迟视觉-语言-动作策略的视觉中间推理
提出视觉中间推理框架,通过紧凑视觉证据接口和选择性路由,将VLA策略延迟降至亚秒级。
基于稀疏观测的大规模深度补全模型
采用泊松初始化与点图头,无需相机内参,从稀疏观测生成度量精确的密集深度与3D点图,性能优异且泛化性强。