WilLaGS:用于野外鲁棒高斯溅射的潜条件三维外观场
β-VAE学习全局外观流形,三维外观场模拟局部光照,师生掩码去瞬态,实现野外鲁棒实时重建。
聚焦关键:用于低视力辅助的显著性驱动视觉语言模型
提出显著性驱动字幕框架,构建三个显著性数据集,训练Salience-LLaVA按重要性顺序描述物体,并部署至辅助眼镜,提升低视力辅助效果。
在视频中定位任意目标:重新思考高效的生成式时空视频定位
提出并行管解码,将时空定位分解为时间块与并行空间块,大幅降低延迟并提升精度,优于自回归方法。
RASA:用于跨身份角色动画的解耦空间-运动先验
提出解耦空间映射与运动控制的框架,通过空间校准与运动引导,显著提升跨身份角色动画的动作保真度和视觉质量。
UniLipi:历史印度手稿的统一多文字OCR
UniLipi统一识别13种印度手稿文字,适应低资源与复杂版面,可作预训练模型,并预测文字属性。
使用视觉基础模型的可解释糖尿病视网膜病变分类
利用视觉基础模型分类糖网病,低秩适配高效,外部曲线下面积达0.92,解释图匹配临床病灶。
中文标题
面向地球观测变化检测的AI方法综合可信基准评测。摘要:统一协议评测10种模型、10个数据集,兼顾精度与效率;预训练提升性能,经典架构更优。
GeoFF3D:面向大规模无人机测绘的坐标锚定前馈重建
GeoFF3D结合坐标锚定与分层框架,实现重力对齐的大规模无人机测绘重建,精度领先且2000图仅需5分钟。
3DGS压缩的非均匀量化
提出面向3DGS的非均匀量化,基于重要性加权量化与合并,实现最先进压缩性能,兼容点云,助力MPEG标准。
Synth-JDoc:合成具有多样布局和嵌入图像的日语文档图像数据集,用于OCR
针对日语竖排文本识别弱,合成多样布局与嵌入图像的文档并加噪声,有效提升模型OCR能力。
条件视觉证据效用:冻结视觉-语言编码器中的状态相关排名反转
视觉证据在观察部分线索后价值会变,静态排名失效。冻结模型在组合搜索中呈稳定状态相关反转,更新排序在跨评估器下仍有决策价值。
面向3D作物结构恢复与表型性状提取的去噪感知时序点云补全
提出SynthCrop4D合成数据集及去噪+时序补全两阶段框架,显著提升作物点云重建质量并实现表型提取。
抽象画视觉语言理解数据集
提出最大抽象画数据集Abstract4D,含12万图像及多维标注,用于分析艺术语义结构及评估AI分类、检索、生成能力。
AIM:锚定身份特征,再匹配实现多模态大语言模型遗忘
提出AIM方法,在无保留图像时锚定身份特征并匹配视觉编码器,实现身份遗忘且保持感知能力。
FUSED:用于AI图像修复检测与定位的法证-语义混合专家
FUSED法证-语义混合专家,检测定位AI修复,跨生成器基准最优,未见生成器上定位性能翻倍。
面向多模态光谱医学成像的跨光谱密集对应
提出跨光谱调制协议与合成基准,改善多模态光谱医学成像中严重光谱失配下的密集对应,保持RGB性能。
实时肌骨代理用于儿童脑瘫:一项可信度试点
为脑瘫儿童开发实时肌骨代理,验证准确快速,但肌肉力估算不稳,需解决建模与认知不确定性。
视频错误检测的后训练视觉语言模型
提出MD-VQA协议及后训练方法,使模型识别指令与视频差异,泛化至未见动作,优于基线。
面向AUTOPET V的解剖感知可提示分割与在线交互训练
提出解剖感知可提示分割,器官监督与在线交互训练,在挑战赛全身病变分割中稳定最佳且随提示精进。
GraspHOI:从单张野外图像进行带手指级抓取的全身三维人体-物体重建
该框架首次从单张图像重建全身三维人-物交互,显式优化手指抓取,无需预设物体网格,提升接触合理性与手部精度。
5,500小时驾驶数据能带你走多远?视频扩散模型的缩放定律分析
训练时长比模型规模更能降低损失,但大模型渐近损失更低;据此训练9B模型,创驾驶视频生成新SOTA。
提示引导的胸部CT间质性肺病交互式分割
首次将MedSAM2用于ILD交互式分割,全量微调最优,Dice提升4.7%,框提示最强,套索/涂鸦亦有效。
有损事件压缩:从事件流失真到任务性能
提出两种事件压缩管线及分类失真指标,可预测任务性能下降,替代重复任务评估。
ARC-CT:解剖路由对比视觉语言学习用于三维胸部CT
提出ARC-CT,用器官掩码和标签软对比学习提升胸部CT异常分类,无需手动标注,18项异常AUC达0.86。
LayerRecall:面向视频生成长期一致性的状态条件记忆路由
提出层选择性记忆路由,按需检索历史键值注入敏感层,以跨视野预测匹配监督,保持长视频一致与局部连续。
SignRR:检索并优化真实动作以用于手语生成
提出检索-精炼范式:从真实动作片段初始化,用残差VQ-VAE精炼为全局连贯手语,保留细节,反向翻译达最优。
遥感图像翻译前学习目标先验:跨模态图像翻译的解耦训练范式
提出先学目标先验再条件控制的解耦范式,仅用极少参数和样本实现遥感跨模态翻译SOTA,兼顾真实性与保真度。
视频生成模型作为几何学习器
利用视频生成模型,将几何估计视为下一帧预测,以少量数据实现零样本深度与法线估计,性能媲美SOTA。
超越数据扩展:面向视觉-语言-动作模型的表征中心持续预训练
提出VLAct方法,以表征为中心持续预训练,有限数据下超越数据扩展,两成轨迹胜完整基线,计算开销小。
基于DWT-AlexNet特征融合和深度神经网络的纹理图像分类
提出融合DWT与AlexNet特征的DNN框架,用于纹理图像分类。
气候物理动态匹配
提出ClimPhyDM框架,融合平流物理先验与数据驱动,在ERA5上优于现有模型,误差更低、稳定性强,且支持12GB GPU训练。
污染像素能否识破深度伪造视频?
提出TaintedPixels主动视频防护:注入隐蔽水印,深度伪造后显形,伪造检出率90.72%,扰动极小。
GeBDA:将建筑损伤评估作为文本序列预测
将建筑损伤评估视为文本序列预测用通用视觉语言模型从双时相卫星图像直接生成框和损伤等级效果良好
图像增强作为基于深度学习的图像检索系统的测试生成
综述50种图像增强技术并实证评估,天气模拟和SaSPA不确定性及失败率最高,GAN真实性最低
全面释放多模态攻击者:视觉语言模型的元自适应越狱
提出元自适应多模态越狱,优化攻击策略与权重,对多个模型攻击成功率超八成,比最强基线高24个百分点,可迁移。
这块铜日后会变成什么样?预测表面外观并渲染为PBR材质
预测铜氧化外观,闭式全局颜色外推迁移最佳,学习模型在未见样本上失效。
TQD-Track:面向3D多目标跟踪的时间查询去噪
提出时间查询去噪,用前一帧真值生成查询并传播至当前帧,增强跟踪查询,仅改训练即可提升多目标跟踪性能。
Ada-TokenCom:大模型驱动的速率自适应令牌通信与压缩生成
提出Ada-TokenCom:基于大自回归模型实现令牌级超低码率语义通信,传关键令牌并预测生成其余,经Lyapunov动态优化,优于数字和深度JSCC基线。
医学视觉模型会推理解剖结构吗?探究学习视觉表征中的空间归纳偏置
医学视觉编码器只携带器官常规位置图,缺乏个体内结构比较机制;池化探测低估其表征。
DeicticVLA:在单一VLA中统一基于语言和指示手势的指令模式
DeicticVLA将三种指令统一为文本与指示掩码,实验显示视觉指令在未见场景中成功率更高。
面向实时非视距重建的内存高效GPU流水线
重构两种NLOS算法的GPU执行,内存降至2.5%,提速42倍,支持更大更精细重建。
长话短说:从2万部短片实现故事级视频理解
提出含2万部短片的电影数据集及问答基准,验证长时视频理解,指令微调提升性能。
基于轻量时空相关性的视觉占用网络去闪烁方法
提出插件框架,双交叉注意力融合历史线索,校正占据预测,减少闪烁伪影,开销小。
PRISM:免训练多模态数据选择的自剪枝内在选择方法
PRISM利用隐式重校正消除全局语义漂移,实现免训练数据选择,时间降至30%且性能提升。
中文标题:遮挡下基于生成先验与接触约束的物体重建
中文摘要:利用生成先验与接触信息引导3D生成,克服遮挡歧义,提升物体重建精度。
文本到图像扩散模型中NSFW概念擦除的综合评估与分析
提出全流程工具包,首次系统评估NSFW概念擦除方法,提供洞见与指导。
面向训练后神经网络的层次化特征级反向传播
提出FR-PT框架,通过反向重构标签条件特征实现训练后自适应,85项设置中63项显著优于基线,仅4项不如。
将SAM提升至新高度:利用高程数据从无人机影像分割树冠
研究结合高程数据微调SAM分割无人机树冠,提出BalSAM,效果有前景。
传话游戏:评估统一模型中的语义漂移
提出语义漂移协议,通过跨模态循环评估统一模型多轮语义保留,发现漂移与单次分数无关,暴露现有基准忽略的失败模式。
CompareBench:面向视觉语言模型的视觉比较推理基准
提出包含计数、几何、空间、时间比较的视觉比较基准,评测九种闭源模型,发现其比较推理存在系统缺陷。