Sparse Multi-Stage Expert-Agent Routing for Complex Clinical Reasoning
利用高效非对角协方差建模改进的去噪扩散概率模型
提出高效非对角协方差建模(K-DCT),以近线性复杂度加速扩散采样,少步数下FID和似然更优。
VIG:视觉信息增益作为多模态思维链压缩的奖励信号
提出VIG,用图像降低预测不确定度衡量词元信息增益,在线双前向计算,提升多模态推理精度-效率权衡。
可缩放矢量图形潜空间
提出Transformer自编码SLS,学习SVG路径的紧凑可逆潜空间,支持向量运算,算力省150倍。
制造中数据稀缺下的可信视觉质量检测
针对制造中缺陷样本稀缺,用扩散模型生成合成缺陷,结合贝叶斯分类器延迟人工审查,提升检测可信度并降低成本。
面向低资源牙科记录补全的实体约束CBCT检索
提出ECCR:仅采纳不扩展实体集的检索证据,低资源牙科补全得分提升,获第二名。
基于观测算子的像素空间扩散
观测算子扩散用粗到细观测替代固定监督,收敛快质优,ImageNet-256上FID1.52。
检索增强视觉提示:在双光子成像中引导基础模型
提出检索增强视觉提示,推理时用检索示例框引导基础模型,免微调提升双光子成像神经元检测。
C²Path:视觉-语言增量目标检测中的类条件路径解耦
提出C²Path,利用专家库构建类条件解耦路径,隔离更新,解决类别知识耦合,性能领先。
基于视图图剪枝的稳健全局运动恢复结构
提出子图引导的视图图剪枝框架,利用子图一致性剔除不可靠边,提升全局SfM在模糊、序列及无序图像上的鲁棒性。
基于哨兵二号影像的欧洲主要公路网车辆速度数据集(2022-2026)
基于哨兵二号波段时差,提取2022-2026年欧洲E级公路车速,含轨迹与质量指标。
用于前视声呐图像中节能目标检测的脉冲神经网络
脉冲网络用于前视声呐检测,能耗降至1/3,精度接近CNN,抗噪更强。
ADMIL:注意力蒸馏多实例学习实现病理选择性基础模型推理
ADMIL蒸馏注意力至轻量模型,仅选少量关键瓦片调用基础模型,省98%以上计算且性能不变。
autoPETV挑战赛的三阶段涂鸦自适应课程学习
提出三阶段涂鸦自适应课程学习,基于残差U-Net在PET/CT上交互分割病灶,纠错模拟使AUC-Dice与DMM逐折提升。
更多参考反而有害:面向少样本钢材缺陷检测的污染感知DINOv2记忆库
提出污染感知记忆库,用干净种子剔除可疑补丁,将污染从9.46%降至2.59%,提升少样本钢材缺陷检测性能。
竞争性记忆读出用于鲁棒视频目标分割:第8届LSVOS挑战赛MOSEv2赛道第二名技术报告
提出竞争性记忆读出法,抑制同类干扰并自适应恢复,获LSVOS挑战赛MOSEv2亚军,得分66.20。
从单目视频学习动态3D高斯溅射的隐式本构定律
提出GCA框架,从单目视频学习隐式本构规律,结合深度锚点与先验正则,显著降低Chamfer距离。
摒弃捷径,赢得长远:为无数据知识蒸馏寻求多样且稳定的生成器
为解决无数据知识蒸馏中生成器的频率捷径学习,提出CSWL框架,结合频域增强与跨阶段重构,提升多样性与稳定性。
ORBIT++:基于360度视频的野外运动恢复结构基准评测
提出基于360度全景视频的运动恢复结构基准ORBIT,裁剪生成视角片段,现有方法难准确估计位姿。
UR$^{2}$-MLLM:多模态大语言模型中面向放射学报告生成的不确定性感知复查推理
提出不确定性感知复查推理框架UR²-MLLM,动态复查不确定区域,在放射报告生成任务上达到最优。
基于校准残差解码的无训练视觉语言模型个性化
提出无训练残差解码框架,通过正、反、空三种画像校准个性化信号,用熵校准增强可靠性,提升多模态个性化理解。
DECO:面向低空无人机视觉定位的深度引导共可见性推理
提出深度引导共可见性推理DECO,解决低空无人机图像与参考图因垂直结构缺失导致的误匹配,提升定位精度。
TRACE:面向不完美表面扫描的伪影鲁棒统计形状建模——颅缝早闭三维摄影案例研究
提出TRACE框架,用无监督方法从含伪影临床头照构建统计形状模型,抑制非头部伪影,提升建模质量。
Hyper^2:通过双空间一致性释放双曲几何的全部潜力
提出双空间一致框架Hyper^2,统一双曲损失与编码,点云补全Chamfer降22.9%,远超单空间。
When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?
OVIBench:打断场景下的在线视频问答基准测试
提出OVIBench基准,评估大模型在视频问答中被用户打断时的处理能力,涵盖取消、误触发、纠正三类打断,验证了模型区分度及微调数据有效性。
VERDICT:在真实文档光学化学结构识别中,一致性胜过像素空间验证
在真实文档上,识别器间一致性远超像素空间验证,可高精度甄别错误,支撑大规模分子数据库标注。
SAM3Dual:第八届LSVOS挑战赛MOSEv2赛道第三名方案
提出SAM3Dual,无需训练,冻结SAM3,分离长短时记忆并在推理时重组,获J&F 64.37第三名。
GAN-Diff:将预训练的WGAN-GP特征与条件扩散U-Net相结合
提出GAN引导扩散框架,以WGAN-GP特征为条件,去噪与超分分别提升4.40/3.70dB。
自校准密集位移场实现大型光学卫星影像可靠配准
无需训练与GPU,用密集位移场配准卫星影像,自校准过滤,零失败,误差大幅降低。
目标迭代滤波
提出一种应用驱动的非线性扩散去噪方案,源自值空间线性扩散,性能优于现有非线性扩散技术。
Multimodal examination answer data with expert-designed Outcome-Based Education rubrics for criterion-level assessment
该数据集含485份多模态答卷,配专家设计的OBE量规(47条标准),支持标准级自动评估与文档理解。
MedReaMM:评估大型多模态模型在专家级临床诊断综合能力中的表现
现有基准缺乏临床叙事与影像整合,MedReaMM含625例多模态病例,多数模型诊断准确率不足50%,凸显综合诊断能力差距。
张量型偏微分方程及其对应的变分公式在彩色图像去噪中的应用
研究PDE作为泛函欧拉-拉格朗日方程的必要条件,用于彩色图像去噪,效果优于现有方法。
关于角点检测、光流与去噪中的张量估计选择
提出用梯度能量张量替代结构张量,用于角点检测、光流和图像增强。GPU实现实时处理,帧率提升40%且不损失质量。
针对部分标签多标签分类的密集视觉-语言关系自适应
提出LDSA用CLIP挖掘先验自适应关系配合密集对比约束与交互解码实现部分标签多标签分类最优
基于极化不透明度先验的快速紧凑3D高斯溅射
提出极化不透明度先验,在训练中主动精简高斯数量,实现快速紧凑的3DGS渲染,保持质量并加速训练。
TransHands:将人体姿态编码器改造为手部姿态编码器
提出TransHands,将人体运动先验迁移至手部姿态估计,跨架构提升精度与泛化能力。
AcroMELD:利用结构感知图集变换器恢复交互式PDF表单
该模型用结构感知图集变换器恢复PDF表单字段,内测F1 0.934,外测0.848,严格评测受限。
LiST:局部单纯形测试时LoRA融合
提出LiST,无标签测试时LoRA融合,构建局部单纯形搜索样本专属权重,优于静态融合与常规TTA,保持效用并提升鲁棒性。
VLMs何时助力阿拉伯手稿OCR?跨数据集研究
视觉语言模型在OCR先验可恢复时提升阿拉伯文识别,建议按脚本与失败模式自适应路由。
M³ISR:面向3D/4D高斯泼溅与前馈压缩的多模态多视图基准
提出M³ISR受控基准,支持3D/4D高斯泼溅重建与前馈压缩,含25场景及多模态密集标注。
面向组合视觉数据检索的样本级排序感知插值权重学习
提出SRAIN,动态预测样本级插值权重,结合排序感知训练与记忆库,组合视觉检索最优且时延低。
未修剪第一人称视频的预算型视觉-语言字幕:预解码声学分流
提出音频优先分流,解码前选窗口,按动作触发,覆盖提升4-10.8个百分点,调用减少9-20%,优于视觉法。
87分钟搞定:面向目标检测的视觉Transformer从Softmax到线性的无标签适配
DiD无标签蒸馏,87分钟将检测器Softmax骨干转线性,性能匹敌监督,延迟降62%,内存降49%
HeatTok:基于热扩散标记化的遥感图像理解增强
热扩散聚合生成语义独立不规则标记,配高斯多模态旋转位置编码,提升遥感图像理解,超越现有方法。
TRACE:面向长时程视频理解的锚定与收敛证据时间检索
提出VES-Bench基准与TRACE方法,无需训练,用锚定收敛证据检索,以更少帧获更高准确率。
RS^3-Prune:用于视频目标分割的读稀疏、存稀疏令牌剪枝
无需训练的令牌剪枝:稀疏读写令牌,加速视频目标分割38.8%,省13.1%显存,精度不变。
VISTA:视觉自回归生成的测试时组合对齐
提出VISTA,面向视觉自回归生成的首个测试时组合对齐方法,不修改参数,提升属性与空间关系,保持质量。
面向职业体力暴露评估的视觉-语言模型:从RGB视频估计手工物料搬运中的外部手力
基于视觉-语言模型,从RGB视频及箱重估测双手外部力,水平误差约5N,垂直约11N,多视角提升峰值力估计。