医学图像生成中的分词器与生成器耦合
医学图像生成中,分词器与生成器耦合决定排名,重建指标不可靠;新统计量分离量化器,重调参提升FID。
LoRSA:面向生物医学下游任务的泛化参数高效微调方法
LoRSA提出全局-残差自适应框架,联合稠密与结构化稀疏低秩组件,提升生物医学模型外部域泛化,优于基线。
BRUCE:面向科学视觉-语言推理的损坏升级鲁棒性基准测试
提出BRUCE基准,用两种新指标量化视觉语言模型在图像损坏升级下的推理退化,并解析四种推理失败模式。
视觉-语言接地:双向概念对应
现有接地任务单向,本文提出双向概念对应,模型ConCor-1统一文本与图像分割,对应F1提升显著。
重新思考单次LiDAR扫描的3D分割:SIP基准上的入射感知采样
提出入射感知采样策略,用于单次LiDAR扫描分割,在SIP基准上提升性能,降低对采样分辨率的敏感度。
IRPol-Fuse:低可见度下红外偏振融合的能量-结构协同
提出IRPol-Fuse,能量-结构协同红外偏振融合,兼顾热红外显著性与偏振细节,低可见度下性能优越。
SeqLoc:超越单帧的稀疏特征场景跨视角地理定位
提出CV-FSS基准及SeqLoc序列聚合,含熵调节、地图重定位、峰值平滑,定位召回提升超50%。
DINO-3DRA:利用二维基础模型语义进行三维脑动脉瘤分割
融合二维基础模型特征于三维分割,脑动脉瘤Dice 0.758,超nnU-Net 13%,泛化稳健。
LHSDet:基于视觉问答的高分辨率AI生成图像检测
提出LHSDet,用视觉问答+三重分支融合多模态特征,检测高分辨率AI图像,对扩散和自回归模型均鲁棒。
将CT基础模型蒸馏为可编辑概念瓶颈用于肺结节恶性预测
将CT基础模型映射到八个放射学概念预测肺结节恶性,内部AUROC 0.86,外部0.72-0.73,与结节大小相当,概念保真度中等。
回答我的问题成本几何?云VLM视觉问答系统基准测试
首个云VLM视觉问答预处理基准:评估十二种技术、四个商用模型,发现预处理并非普遍有益,需谨慎选择。
XClipGS:面向医学体数据高斯泼溅的精确半空间裁剪
精确半空间裁剪,分离裁剪与内部监督,无需学习参数。8个体数据PSNR最优,650FPS以上,泄漏减少。
UniScale:任意尺度工业异常生成
提出一种统一框架,通过误差抑制多尺度训练与生成后融合去噪,实现任意尺度工业异常生成,提升小异常与检测性能。
DeCo:通过解耦与重耦合实现零样本工业异常生成
提出DeCo,通过解耦异常结构与源产品并重耦合至目标产品,解决异常信息获取不准和融合失控问题,在MVTec AD和VisA上显著提升检测精度。
将物理先验蒸馏进流式世界模型
提出PhyS,融合物理视频数据、蒸馏与强化学习,解决流式世界模型物理约束违背问题,显著提升基准性能。
SportsGrounder:面向密集体育视频推理的提案辅助交错定位
提出新框架,用视觉专家辅助交错定位,融合框坐标与语义,正则化隐藏状态,优化偏好,提升密集体育视频推理精度。
SCoPE:通过稀疏跨模态先验交换实现免训练的视听事件感知
提出免训练框架SCoPE,通过稀疏跨模态先验交换消除错误共激活,提升视听事件感知性能。
LAD-COD:用于伪装目标检测的语言对齐密集感知
提出语言对齐密集感知LAD-COD,融合语义与层次视觉特征,在CAMO等三数据集上取得全指标最优。
FlexSplat:无需点云对应的灵活前馈3D高斯溅射
FlexSplat实现无位姿多视图三维高斯重建,联合估计相机与深度,紧凑高斯表示媲美有姿态方法。
SegDem: Segmentation helps Demosaicing
伪造同行判断误导多模态大语言模型评审团:来源盲锚定与评审团共识验证
伪造引用致评审团偏差19-26个百分点;共识验证阻断84.9%攻击,削减97.5%净伤害。
LIBAD:面向锂离子电池电极制造的多模态异常检测基准
提出LIBAD基准与DA-Core方法,核心集0.05下FPR95降至54.3%,推理时间减43.9%。
SynVAR:视觉自回归模型中的空间与语义协同对齐
提出SynVAR无训练增强框架,协同空间语义抑制误差传播,含全局引导、感受野约束、高频补偿,提升复杂场景生成。
AdaDINO: 冻结DINO骨干内成对感知适配的高效遥感变化检测
提出AdaDINO框架,在冻结DINO骨干内注入双时相互动,提升变化检测性能,削减62.5%计算量仍达85.29%F1,提速1.41倍。
证据驱动的取证推理用于多模态媒体篡改检测与定位
提出EFR框架通过锚定验证推理链和可验证奖励机制实现证据与结论一致的多模态篡改检测性能领先
EvBS:事件引导的模糊合成用于域自适应运动去模糊
提出事件引导的模糊合成框架,解耦运动与内容,生成多样训练对,提升域自适应去模糊性能。
MRBench:人体运动-文本检索综合基准
提出MRBench基准,含多样运动、平衡类别与多粒度描述,并设计粒度感知模型提升混合粒度检索。
PE-Mamba:用于AI生成图像检测的双向选择性层聚合
提出新框架,利用双向选择性聚合与自适应门控融合,高效检测AI生成图像,性能超越18种现有检测器。
Evidence-RL:迈向证据密集型视觉推理
提出反事实证据解耦(CED),结合答案正确性奖励证据依赖,抑制捷径/无关视觉;无需标注、零开销,九基准优于现有后训练。
ZOMP:面向视觉-语言模型的零阶多模态提示调优
提出零阶多模态提示调优法,仅用前向传播,联合调优视觉与文本提示,低秩重参数化减少搜索维度,在5000次查询预算下优于现有无反向传播方法。
EgoTrack3D:用于第一人称3D物体跟踪的模块化框架
提出EgoTrack3D模块化框架,从第一视角视频重建动态3D场景,跟踪精度提升11%,适应退化条件
优势引导门控:重塑视觉空间智能的开放式推理
提出优势引导门控框架,动态干预并修正推理偏差,显著提升视觉空间理解与推理性能。
AgriField-40K:通过高效持续预训练将视觉模型适配到农业
提出农业数据集AgriField-40K与AgriMAE方法,仅调适配器即媲美全量微调,参数少9倍。
SCTD 3.0:真实海洋勘测中的大规模多场景声纳常见目标检测数据集
构建真实海域大规模多场景声纳目标检测数据集,含万余样本、十类目标,支持多任务基准。
额外视角何时有用?利用额外图像自适应单视图三维重建
提出一种基于额外图像的自适应单视图三维重建框架,含零样本与对比优化策略,提升精度鲁棒性。
神经卫士:感知表示损伤的神经梯度更新
提出神经卫士更新控制法,用梯度缩放等机制控制表示更新,在长尾类增量学习五个设置均超基线,获最佳任务无关精度。
EFFEKT:面向基础模型的高效联邦知识迁移
提出多域联邦框架,轻量客户端代理与服务器基础模型协作,经双向交叉蒸馏训练LoRA适配器,低资源下优于现有方法。
基于全容积多任务潜流匹配的组合式跨模态转换
全容积多任务潜流匹配,解耦解剖先验与映射,超越补丁法,单模型实现多任务及零样本组合泛化。
BAP-MOS:基于老虎机的自适应提示用于边界敏感多器官分割
提出基于老虎机的自适应提示分割框架,提升多器官超声边界精度,显著降低边界误差。
维纳表示滤波用于VLM幻觉抑制
提出免训练维纳滤波编辑表征,利用协方差闭式解抑制VLM物体幻觉,保持流畅性,适合时序与多步去噪。
无监督低光增强中的结构光照学习
无监督低光增强提出RISE,分离相对光照结构与绝对曝光,从亮区估计,双测光曝光参考自适应调整。
忠于本源:具有平滑过渡的连续图像风格化
提出两阶段训练及强度感知样条插值,使DiT模型在保留内容语义的同时,实现连续平滑的风格化强度控制。
SUMI:用于3D点云推理的可扩展统一模型
提出扩散增强细化模块SUMI,融合噪声与粗特征,提升点云补全局部细节和全局一致性,优于基线。
Ego-OSCAR:开源第一人称视角立体捕捉系统
开源低成本头戴式立体惯性采集设备,单价低于200美元,提供约550小时带标注视频、IMU及3D手部重建,降低规模化第一人称数据采集门槛。
VTO:视频异常检测的视觉工具编排
提出基于过程监督强化学习的VTO,用认知评估器提供语义反馈,优化工具编排,视频异常检测准确率提升10.2%。
面向计算高效Transformer适配的电路微调
电路微调(CFT)用电路发现预选模块,免预热,减少2.3-6.6倍FLOPs,零参数,适配ViT。
基于敏感性建模的开放世界语义分割
提出带敏感性解码器的开放世界语义分割框架,利用局部激活不稳定性检测未知,提升异常分割与新型类发现。
自监督视觉表示学习的三个必要原则
提出自监督视觉表示学习需同时满足三个原则:跨视图语义不变性、块级空间预测、表示非退化;缺一不可。
测试时原型适配用于开放词汇语义分割
提出无训练输出级插件TPA,利用未标注部署图像构建DINO原型,辅助分数改善开放词汇分割,兼容多模型基准,少量数据有效。
你的VLM已知道何时:通过是非提问实现免训练时间定位
多模态大模型时间定位差源于接口而非感知;用是非提问由粗到细排名,无需训练即大幅提升性能,新方法超越基准。