利用显著性引导的基元合并的紧凑前馈三维高斯
提出显著性引导的合并流程,将前馈每像素高斯压缩至1/20,保持视觉质量,支持质量效率权衡。
重新思考LLM验证:证据结构、不确定性与选择性精化
提出两阶段框架,仅对模型弃权时进行本体论接地,将弃权用作控制信号,显著提升医学假设验证准确率,无需显式知识图谱。
InterPruner:基于泰勒隐式准则与语言先验调制器的多模态目标检测交互式结构化剪枝
首个面向多模态检测的交互式结构化剪枝,用泰勒隐式准则与语言先验评估通道,剪枝半数通道性能不降反升。
超越固定亮度:迈向全色与正色图像着色
提出亮度无关着色框架,将着色视为全RGB图像编辑,用混合灰度目标适应全色与正色输入,减少伪影。
看哪里?:VLM中视觉编码器的因果追踪
因果追踪发现,高因果视觉标记常在目标区外;模型借外观线索理解结构,视觉定位、使用与推理存在差距。
MIRA:面向智能体诊断的医学图像反思
MIRA框架通过工具搜索与反思验证提升医学视觉诊断,平均64.73,提升基线7.44,降低有害工具判断。
FADE:从被动验证到主动发现的反事实视频理解
FADE框架采用证据优先两阶段训练和渐隐锚强化学习,实现反事实视频主动发现,性能超越GPT-5.6。
MVTrack:基于压缩比特流的超快无外观运动目标跟踪
基于H.264比特流直接追踪运动目标,参数少60倍、算力少40倍、延迟降8.6倍,超越YOLO26n。
E³mo-Bench:基于贝叶斯成对对齐的多模态诱发与表达情感理解可扩展基准
提出E³mo-Bench基准,含12314问答对,评估诱发与表达情感,用贝叶斯对齐提升标注,揭示范式性能失衡。
BPG:领域增量学习中可塑性与泛化性的平衡
提出BPG框架,动态适配器维度与软域混合,平衡可塑性与泛化,域增量SOTA,遗忘低至0.22%。
Evaluating Semantic and Spatial Guidance for Foundation Model Segmentation of Small-Scale PV in Remote Sensing Imagery
通过I/O感知重构实现快速且内存高效的小波卷积
提出I/O感知重构的小波卷积,减少约2.55倍HBM流量,训练加速最高4.35倍,峰值内存减半。
使用隐式神经表示对地理萎缩进展进行建模
利用隐式神经表示建模地理萎缩进展,生成前后时间点的FAF图像与分割,达到最优MAE和DICE。
PolyLayout:层次化VLM引导的布局生成,超越矩形房间
提出混合层次化框架,三阶段生成3D布局:功能聚类、VLM宏路由、规则优化,支持不规则边界,感知真实度高。
顺序至关重要:大型视觉语言模型作为图像序列时序推理的评判者
多模态评估用大型视觉语言模型判断图像时序,受首因/近因位置偏差影响,难以区分连贯叙事与乱序。
GENEA挑战赛2026:在无缝交互数据集上对语音驱动手势生成的大规模解耦评估
第四届GENEA挑战赛评估五个手势生成系统,解耦评测表明系统远逊于数据集,语音对齐、交互响应、语义手势均差。
多视图关系蒸馏:提升视觉-语言模型空间推理
提出MVRD,蒸馏多视图块间余弦相似度,提升视觉-语言模型空间推理,保持语言对齐,超越微调和特征蒸馏。
NullEdit:基于VLM条件重定向的隐蔽图像保护
NullEdit重定向VLM表示抑制编辑,自然无痕,跨提示迁移,EditReward平均降0.813。
GESTO:面向动态场景推理的以人为中心的时空记忆
GESTO结合持久4D场景图与交互/事件层级,自动提取并关联人-物交互,提升动态场景推理。
传感器信息感知的结构光三维成像逐点协方差
提出传感器感知的一阶方法,由相位精度构建逐点3x3协方差,显著提升G-ICP配准精度。
VIDS-Seg:面向小儿心脏超声分割的可靠不确定性量化
提出VIDS-Seg,在成人训练、小儿零样本测试中,以分布偏移感知的不确定性量化提升误差关联,无需重训即可可靠检测儿童亚组中的模型静默失效。
UniProbe:利用多结构内部表示的大型视觉语言模型可学习词元级幻觉检测器
UniProbe用GNN/ViT/GRU融合多结构内部表示,实现词元级幻觉检测,解码时减少55%幻觉
ConfTriage:面向肺结节恶性评估的校准感知LLM分诊框架,含选择性专家转诊
提出校准感知分诊:LLM自然语言分诊肺结节,低置信转专家,F1 88%, AUC .92, 解决76.5%。
基于专家混合的学习图像压缩熵模型
提出基于专家混合的熵模型(MoEE),按需激活参数,在Kodak数据集上比VVC节省16.85%码率。
GS-CPE:基于3D高斯泼溅的统一六自由度相机位姿估计
提出GS-CPE,粗到细估计相机位姿,几何粗估结合3D高斯泼溅精化,室内外基准上精度与泛化达最优。
StreamFlow:面向流式视频理解的动态记忆流
动态记忆流框架,过滤冗余并整合历史,注意力引导检索,提升流式视频理解性能与效率。
用于学习图像压缩的多尺度潜变量
多尺度潜变量分层表示提升熵模型,Kodak上BD-rate较VVC降17.9%,且与现有方法正交。
一旦中毒,任意操控:视觉语言模型中的可编程后门
单次投毒即植入可编程后门,推理时可任选目标描述并生成隐形触发器,实现任意到任意的描述控制。
复杂城市场景下基于证据的可信多模态推理与评估基准
提出AD2-Bench诊断,归因空间模糊与语义不确定,以EGVOR证据原子强化对齐,稳定复杂场景推理。
弦乐四重奏乐谱的光学音乐识别数据集与基准
首个弦乐四重奏多声部OMR数据集,含116首乐谱,基线最低3.6%/5.9%,LSTM更抗扫描退化。
SafeCA:面向文本到视频越狱防御的安全交叉注意力定位与调控
提出安全交叉注意力防御方法,基于特征分析抑制异常与恶意标记,越狱成功率降约20%,开销极小且语义一致。
基于几何知识蒸馏的时间定位组合式相机运动理解
提出时间定位组合式相机运动识别,构建新基准,新方法蒸馏几何知识到轻量标记,推理无需三维模型且精度相当。
CARE:面向可靠医学视觉问答的置信度感知推理
CARE框架通过双阶段管道联合优化医学VQA的准确性与校准,降低幻觉率,实现可靠临床决策。
PEAK:通过k-稀疏自编码器实现精确且持久的概念擦除
利用k稀疏自编码器精确定位并抑制目标概念特征,实现精确持久的概念擦除,抗攻击且保持生成质量。
观看合成视频:通过视觉合成对齐跨模态表示实现零样本视频描述
提出WSV框架,利用文本到视频生成模型合成视频,经抛光器弥合分布差异,再引导GPT-2生成描述,在三个数据集上取得最优性能。
ThinkAfford:以可供性为中心的推理,用于杂乱场景中的细粒度3D定位
提出的方法将高召回可供性区域提议与指令推理解耦,用强化学习对齐,提高杂乱场景细粒度3D定位精度。
让寄存器发挥作用:视觉Transformer中用于令牌剪枝的任务寄存器
提出任务自适应剪枝(TAP),用任务寄存器动态排序令牌与分配预算,提速分割检测且保持分类精度。
HNDiff:雾-噪声扩散用于图像去雾
提出雾噪扩散模型,嵌入大气散射物理先验,按雾度自适应加噪,同时去雾去噪,提升现有去雾网络,达到最优。
AI辅助面部表型检索中的多级证据聚合及其在罕见遗传病优先级排序中的应用
提出推理时多级证据聚合框架,无需重训练即可提升面部表型检索,GMDB上Top-1准确率最高提升14.8%。
R4DSG:长时第一人称视频中面向物体中心问答的相对4D场景图记忆
提出相对四维场景图记忆,用于长视频物体问答,分离稳定锚点与动态物体,显著提升问答准确率。
当视觉信号产生误导:视觉语言模型中属性幻觉的机理研究
提出一种框架,用空图诊断分解视觉与语言先验信号,发现属性幻觉源于视觉误导而非语言先验,分模式校准、弃权或视觉适配,降低幻觉。
HUI360:面向人机交互预判的360度第一视角数据集与基线方法
提出HUI360,迄今最大野外人机交互预判数据集,含百万标注及基线,支持跨数据集评测。
三维加权几何图神经网络用于绵羊面部疼痛评估
提出基于单目深度估计的3D加权几何图神经网络,融合面部地标三维空间与表面特征,实现绵羊疼痛分级评分。
基于深度学习的目标检测模型在非洲真实多作物数据集上的比较评估
比较六种模型于非洲农田真实数据,RT-DETR精度最高,YOLO系列高效,适合实际农业应用。
SAR2Agri:面向农业监测的SAR强度表征学习
首个仅用SAR强度的农业自监督学习,用掩码与课程学习提取物候特征,作物制图IoU84.9%,超越现有基线。
基础模型赋能的高效数据采样(FEEDS):一种面向泛癌、多示踪剂PET/CT数据集的标签高效训练策略
FEEDS用基础模型嵌入选择多样未标注数据,少量标注达全标注,减70%标注负担,泛化多癌种示踪剂。
面向遥感图像分割的以熵为中心的可解释人工智能
提出熵中心可解释AI法用于语义分割及新评估法,实验优于现有方法。
CapProbe:通过全场景密集问答评估详细图像描述
一种基于全场景密集问答的图像描述评估法,分区生成多选问题,逐区核查事实,低成本且评测稳定。
每包必争:面向抗丢包学习图像压缩的信息分散
提出跨通道重分配与交错分组分散信息,缩短依赖链,抗丢包图像压缩性能显著提升。
帧内静态、事件中动态:重新思考事件相机特征作为运动线索
事件相机特征(结构张量特征值、时空密度)实为运动线索,可提升光流估计,数据稀缺时增益最大。