BATS:基于边界感知混合分辨率令牌的资源高效体素分割
BATS通过边界感知混合分辨率令牌,在保持高分割精度同时,大幅降低GPU内存和推理成本。
SCALPEL:基于大语言模型编码器学习的医学视觉-语言语义跨模态对齐
提出SCALPEL框架,通过LLM编码器学习与解剖否定感知目标,解决医学VLP各向异性、内存开销和幻觉问题,实现SOTA。
面向中国农村场景的自动驾驶目标检测:真实-合成数据混合与模型评估实验研究
构建农村真实-合成混合数据集,评估13种模型,YOLO11m在1:0.5混合比达最优mAP0.758,揭示长尾物体感知瓶颈。
CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents
Prior Directions: Why GUI Grounding Gets Locked in the Past
ICDAR 2026 原子层沉积/刻蚀(ALD/E)科学图表信息提取竞赛
Sci-ImageMiner竞赛表明,多模态AI在科学图表分类和摘要上表现好,但数据提取与推理不足,凸显领域感知挑战。
从关键点到预测分布:YOLO-Pose模型的事后不确定性
提出YOLO-Pose模型的后验不确定性方法,通过校准双变量分布与评估协议实现关键点可靠性排名,在COCO和飞机着陆中验证有效性。
鲁棒RPC光束法平差:基于季节不变对应关系的多日期卫星影像
提出季节不变特征匹配与全局描述符结合的RPC平差方法,降低多日期卫星影像的几何误差并节省匹配时间。
针对持续指令调优的渐进式多模态对齐
PMA检测多模态分布偏移并渐进扩展专家,缓解投影器遗忘,提升持续指令调优性能。
通过视频表示正则化缓解累积误差
发现复合误差源于表示维度坍塌,提出视频表示正则化稳定潜在表示,大幅提升长视频生成质量。
面向决策关键应用的多模态大语言模型中可解释且资源高效的空间推理
提出ByDeWay-V2,集成空间关系谓词与深度线索,无需训练增强多模态大模型空间推理,轻量高效可解释。
ScratchSim:一种用于表面划痕检测的程序化合成数据流水线
提出程序化合成数据管道,通过微调合成权重或混合训练,显著提升检测性能,减少对真实标注数据的依赖。
DINOv3特征的逐步注意力精炼用于高效前眼节分割
提出基于DINOv3的轻量架构,通过逐步注意力精炼实现高效前眼节分割,在临床数据上达85.55% mIoU且鲁棒性强。
SciFigAlign:基于微调视觉与手稿证据对齐的科学图表评分
提出SciFigAlign模型,微调视觉与手稿证据对齐,大幅提升科学图表评分准确性。
多模态空间推理的视觉信用审计
VCA分离图像支持与关系响应,揭示12.73-26.25%正确决策缺乏视觉信用,分解基准成功为正确性、图像支持与关系一致响应。
SciFigQual-Bench: 基于完整稿件上下文的科学图表质量评估基准
提出SciFigQual-Bench五维度评估科学图像,SFQ-Agent(GPT-5.6-Sol)误差最低、一致性最高。
FreqForcing:通过频谱自锚定实现自回归长视频生成
提出FreqForcing框架,用频谱自锚定解决长视频误差累积,实现5秒到2分钟24倍外推,效果优于现有无训练方法。
Veritas++:面向感知增强的AIGI检测的价值感知在线策略蒸馏
提出Veritas++,以感知为根基,用PoRL强化细节/语义/像素检测,VaOPD自适应蒸馏,实现AIGI检测高效泛化。
基于小视觉语言模型的多任务学习实现有依据的胃肠道内镜视觉问答
通过多任务微调小型VLM,提升胃肠道内镜VQA准确率并改善答案与图像区域的对齐。
SeasonStereo:基于生成式AI的多时相卫星影像鲁棒密集立体匹配
提出SeasonStereo,用生成式AI合成季节变化图像对训练,结合零样本几何先验,无需真实多时相数据或LiDAR标签,实现高精度立体匹配并降低监督成本。
重新思考胸部X射线机器学习中的临床相关性:评估参考如何定义性能
评估参考选择决定模型性能排名,常用标签及指标不可靠,应重视临床有效性。
墨盾:保护写作风格免受未经授权的笔迹模仿
InkShield将扰动限制在笔迹边缘,有效阻止笔迹风格模仿,保持视觉质量与可读性。
Speech2Grasp:人形机器人中基于文本的抓取检测向语音的高效数据迁移
提出Speech2Grasp,用轻量MLP将文本抓取检测高效迁移至语音,机器人实验优于ASR并降低延迟。
StructureGS:面向铰接物体重建的结构感知高斯泼溅
引入结构感知3D高斯泼溅,通过定向包围盒约束空间一致性与结构连通性,实现铰接物体高质量重建。
从不确定性到确定性:无需射线匹配的由粗到精的视觉楼层平面定位
提出无需射线匹配的由粗到精视觉平面定位框架,通过位姿扩散和局部精炼实现高精度鲁棒定位。
ContactFlow:一种跨实体迁移的视频动作条件
ContactFlow通过3D接触点轨迹编码操作,实现从人类演示到不同机器人实体的迁移,用于物理合理的视频生成世界模型。
VidMap:利用时间结构的视频运动恢复结构
VidMap融合SLAM时序约束与SfM全局优化,实现任意视频鲁棒准确的度量重建。
HumanCLAW:视觉语言模型能否通过身体行动?
提出HumanCLAW框架评估VLM身体行动能力,最佳模型成功率仅16.8%,缺陷在于缺乏具身自我意识。
TurboVLA:在RTX 4090上以32Hz运行的实时视觉-语言-动作模型,显存<1GB
TurboVLA提出直接V+L→A映射,0.2B参数、32Hz、<1GB显存,达97.7%成功率,超越传统LLM中心模型。
ScalablePromptus:可扩展且高保真的基于提示的视频流传输
提出ScalablePromptus,通过dropout训练生成有序提示,使接收端从截断提示重建视频,丢包下性能下降减少82%-95%。
神经网络辅助提升步骤改进JPEG 2000完全可扩展有损图像压缩
在JPEG 2000中引入神经网络辅助提升步骤,减少子带冗余,改善重建质量,实现平均17.4%比特率节省。
LISA-3D:通过多视图一致性将语言-图像分割提升至3D
提出LISA-3D,用几何感知LoRA和可微重投影损失,仅更新11.6M参数即提升2D掩码与3D重建。
基于粒子滤波的潜扩散反问题方法
引入粒子滤波框架非线性探索解空间,提升反问题求解性能,在超分辨率等任务上超越SoTA。
面向真实世界的神经辐射场综述
综述NeRF在3D重建中的理论进展、应用挑战及未来方向。
在多模态大语言模型时代深入审视动态场景图生成
从任务设定与模型设计重新审视动态场景图生成,引入五项新评估指标,基于MLLM通过三种设计改变实现SOTA。
OmniAD:通过多模态推理检测与理解工业异常
OmniAD统一检测与理解,结合视觉与文本推理,无需阈值,通过强化学习训练,在MMAD基准上达79.1,超越GPT-4o等模型。
基于孪生网络的面部动作单元识别单帧校准
通过单帧中性表情校准的孪生网络消除面部属性偏差,显著提升AU识别性能。
在未知协变量偏移下通过置信度引导的数据增强改进知识蒸馏
利用扩散模型生成师生分歧最大的困难样本,缓解协变量偏移,提升蒸馏效果。
基于周期性引导与信号重建的超短程rPPG估计
通过周期性引导和信号重建,从2秒超短视频准确测量心率,性能超越现有方法。
生成式触发器优化破解清洁图像后门隐身-效力权衡
GCB框架通过生成式触发器优化,以低于1%精度损失实现清洁图像后门攻击,打破隐身与效力权衡。
PatchDenoiser:面向低剂量CT成像的参数高效多尺度补丁学习与融合降噪器
轻量多尺度补丁降噪,用极少参数与能耗,保留细节并超越CNN/GAN,提升低剂量CT图像质量。
RA-Det:基于鲁棒性不对称性的AI生成图像通用检测
发现鲁棒性不对称:自然图像对扰动稳定,生成图像漂移大;提出RA-Det,跨模型通用,平均性能提升7.81%
Context-measure:面向伪装的情境化度量
提出情境度量基于概率相关框架增强真值上下文关联解决维度与范围缺陷更合人类感知全面超越现有伪装分割指标
Calibri:通过参数高效校准增强扩散变换器
扩散变换器加一个缩放参数即可提升性能;Calibri用进化算法优化约百参数,增强文生图并减少推理步。
深度专家注入:以领域知识锚定视网膜视觉语言模型
提出深度专家注入,锚定视觉证据,弥合感知与推理差距,眼科问答超越专有系统,达到最先进精度。
临床图介导蒸馏用于非配对MRI-CFI高血压预测
临床图介导蒸馏:构建跨队列kNN图,将MRI高血压知识迁移至眼底模型,提升非配对预测。
LiDARDraft:从多种输入生成激光雷达点云
提出新方法,以三维布局为桥梁,统一文本、图像和点云,生成可控激光雷达点云,实现从零仿真。
SMSP:多模态大模型感知视觉错觉的即插即用多尺度感知策略
提出SMSP即插即用策略,抑制高频背景干扰,提升多模态大模型视觉错觉感知,准确率13%→84%
情境中的动觉挖掘:通过文本到运动蒸馏实现少样本动作合成
提出上下文动觉挖掘框架,利用文本嵌入实现少样本动作合成,使识别准确率提升二十三点一个百分点。
穿行画作:基于互联网先验的自我中心世界模型
提出自我中心世界模型,利用互联网先验将视频扩散转为可控预测,结构一致性提升六成五,泛化至画作内导航操作。