OccTrack360:基于环视鱼眼相机的4D全景占用追踪
提出长序列鱼眼全景占用追踪基准OccTrack360及方法FoSOcc,解决畸变与定位问题。
基于空间稀疏线性注意力的低延迟事件驱动目标检测
提出SSLA方法,实现异步低延迟事件目标检测,精度达SOTA且计算量降低20倍。
NanoGS:免训练高斯泼溅简化
NanoGS免训练,通过局部成对合并简化高斯泼溅,大幅减少数量并保持质量,高效运行于CPU。
W4A4量化下伪装目标检测的破解:令牌组双约束激活量化
提出COD-TDQ量化方法,通过令牌组双约束解决W4A4下伪装检测精度下降,S_α提升超0.12。
部分标签下鲁棒提示学习的整体最优标签选择
提出HopS方法,通过局部密度滤波与全局最优传输选择标签,在弱监督下提升提示学习性能。
仅一次高斯:超密集采样场景的可控3D高斯泼溅
提出YOGO框架实现确定性预算感知高斯生长,结合新数据集突破稀疏性屏障,达到高保真重建。
Fre-Res:面向高效视频多模态大模型的频域残差视频令牌压缩
Fre-Res通过空间锚点保留细节、残差频率令牌捕捉时序演变,实现视频令牌压缩,精度接近全令牌。
TSCA-Net:用于可解释多模态行人轨迹预测的时空团注意力
提出TSCA-Net,含时空团注意力和自适应网格细化模块,在行人轨迹预测中达到SOTA性能。
无训练合成图像溯源中的表征与参考选择
中间层表征溯源最佳,参考选择关键:语义约束提升准确率,低参考时重塑有效。
SpikeDS:用于3D MRI中神经侵犯预测的双稀疏Spikformer
提出SpikeDS,利用激活与空间双稀疏性高效预测3D MRI神经侵犯,AUC 0.753,能耗仅14.4mJ。
GenDiff:一种剂量和解剖感知的扩散模型,具有结构先验精化,用于低剂量CT重建与泛化
GenDiff扩散框架联合建模剂量与解剖,通过结构先验精化,实现高质量低剂量CT重建,鲁棒性优异。
基于VLM描述比较的异常帧检测方法,利用视频内自相似性提取专家动作与情境决策场景
通过视觉语言模型比较帧描述,检测异常帧,提取专家动作(65%)与决策场景(61%),优于传统方法。
结构MRI表征学习中的对比联合嵌入预测
提出COJEPA框架,结合联合嵌入预测与对比损失,在脑MRI上实现局部预测与全局判别,三项任务均表现优异。
SymbOmni:通过符号概念学习演化代理全知模型
SymbOmni通过符号概念学习实现代理模型自主演化,显著提升图像质量与任务成功率,减少40%以上token消耗,达成持续学习新SOTA。
MetaView: 基于尺度感知隐式几何先验的单目新视角合成
融合隐式几何先验与度量深度,实现单图大视角新视角合成,兼顾几何一致性与精确控制,性能优于现有方法。
基于解剖特权蒸馏与令牌路由的MRI预测神经周围浸润
提出解剖特权教师-学生框架,从T2-MRI预测神经周围浸润,训练用掩膜、推理无需,AUROC达0.750,计算高效。
关于异构医学视觉问答的持续学习实证分析
系统评估持续学习在多目标医学视觉问答中的表现,发现现有方法难以平衡稳定性与可塑性。
数据安全:使用CIFAKE数据集进行合成数据质量分析
从三维度分析合成与真实图像差异,提出评估策略以安全利用合成数据增强模型可靠性。
RegHead:通过前馈配准的非人形头部混合变形
RegHead用前馈配准快速构建非人形头像语义混合变形,保真度高且支持实时重定位。
从互补超声表征中学习肝病分类
融合物理引导与局部相位超声表征,结合自监督MAE与GCN,提升NASH与NAFLD分类准确率32.4%、F1分数91.2%。
情感行为分析中的注意力因果监督
引入因果监督、交叉协方差正则化和SwiGLU变换,改进注意力池化框架,在s-Aff-Wild2上总分达1.2214。
NEEDL-Bench:用于显微镜图像中瑞士针叶枯病和气孔检测的数据集
首个显微镜下瑞士针叶枯病检测数据集,含3250张图像,基准F1=0.8479,需领域特定归纳偏置。
ACZ-GSeg: 基于自适应同心圆区域的两阶段LiDAR点云地面分割
提出自适应同心圆区域两阶段地面分割法,粗分割加权PCA提取候选点,细分割反射强度一致性精化,F1评分达97%以上。
从重建到解读:X射线断层扫描数据的零设置多相分割
提出零设置多相分割框架,无需训练即可快速生成诊断级分割掩码,支持实时实验反馈。
用于矛盾/犹豫识别的校准多模态集成:系统描述与私有测试提交策略
提出校准等权重多模态融合模型,公共测试达0.7358 macro-F1,私有测试提交策略证实泛化性。
自洽流:统一速度与端点预测的修正流模型
SC-Flow通过一致性损失联合训练速度和端点预测,稳定优化并提升生成质量。
视频编码标准中跨分量环路滤波综述
综述跨分量滤波器利用亮度-色度相关性减少压缩伪影,提升色度保真度,介绍其起源、现状与未来展望。
超越完美先验:用于野外4D驾驶重建的自适应高斯图
提出自适应高斯图,解耦静态与动态并自适应修正拓扑,实现鲁棒的野外4D驾驶重建。
审计全切片图像多模态基准中的数据泄露
揭示全切片图像多模态基准存在患者和机构级数据泄露,导致性能虚假高估,需构建无污染评估。
时间基准分数究竟衡量什么?——分解视频VLM评估中的通道使用
时间基准分数混淆任务与通道问题,反转下降法区分模型依赖位置编码还是视觉顺序,揭示分数不反映故障模式。
面向零样本裂缝分割的SAM3语义边缘响应解码
利用SAM3内部语义响应解码裂缝似然场,结合边缘先验校准,无需标注实现零样本裂缝分割,性能显著提升。
基于稀疏注意力自适应跨模态融合的行人过街意图预测
提出ADAPT多模态框架,融合视觉与运动信息,利用稀疏注意力降低冗余,在行人意图预测中达到SOTA且推理速度仅17.23ms。
GeoSEAN:可解释的东盟国家级别图像地理定位
提出可解释国家级别图像地理定位管道,MLP分类器准确率达85.91%,通过对象检测与注意力分析揭示视觉证据。
MobileSAM2:轻量级分割万物以实现空间智能
提出超图知识蒸馏法,将SAM2压缩为轻量模型MobileSAM2,实现移动设备高效分割,并验证了优秀泛化性能。
粗路径签名引导的几何增强用于小样本工业表面缺陷检测
提出粗路径签名引导的几何增强,利用边缘路径二阶签名聚合空间图,显著提升小样本工业缺陷检测性能。
GEST引擎:从事件图到合成视频——完整技术报告
GEST引擎通过事件图从文本生成多演员合成视频,显式世界模型保证零成本标注与时空一致性。
如何实现递归自改进智能体与个人奇点:一种目标、范围、工具和基准驱动的多智能体架构
本文提出受治理的多智能体架构实现递归自改进,引入个人奇点作为有界人机协同目标,通过目标、范围、工具和基准驱动。
隐式4D高斯泼溅:应对大帧间位移的快速运动
提出SPIN-4DGS,通过隐式网络学习时空位置,高效重建大位移快速运动,性能显著优于基线。
DM-KG:一种提升街景图像中视觉语言模型空间认知能力的新方法
提出DM-KG知识图谱,提取方向与距离关系,使VLM空间推理精度提升,距离误差降31.1%,方向误差降65.8%。
过滤低质量图像以准备数据
提出过滤低质量图像而非去噪法,利用质量指标和阈值筛选并保留足够图像,交通标志识别准确率93.8%,物体识别84.9%。
ProtoPointNet:基于原型的可解释三维牙科点云分类与可验证空间激活
提出ProtoPointNet模型,实现可解释三维牙科点云咬合分类,F1达0.724,AUROC达0.825,空间激活定位至解剖区域。
ACID:面向视频生成的自适应缓存
ACID动态切换缓存阈值,无需重训,在视频扩散模型中大幅加速且质量损失可忽略。
UMSS:迈向无监督多模态语义分割
首次提出无监督多模态语义分割方法UniM2,通过跨模态协同与协调器,有效利用互补信息,显著提升性能。
Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction
IQA-T1:基于工具的视觉证据推理用于图像质量评估
IQA-T1用工具生成视觉证据增强多模态大模型推理,实现可解释评估,在7个基准上表现最佳。
前门中介因果推断方法在全切片图像分类中通用双通道特征解耦特性的证明
提出因果推断MIL双通道假设:新通道独立分类,特征差异越大越能消除虚假关联,提供新理论视角。
SeamGen:通过图流匹配实现与艺术家对齐的UV接缝生成
提出SeamGen,利用流匹配生成模型从专业接缝数据学习分布,结合Mesh Transformer捕捉网格拓扑,生成符合艺术家偏好的UV布局。
全局视觉引导与局部超声线索:稳健的自由手三维超声重建
提出全局-局部位姿框架,融合相机与超声信息,将轨迹漂移降至1.67mm,优于现有方法。
对比增强流匹配实现风格-内容解耦
通过对比增强流匹配,有效解耦内容与风格,提升表征鲁棒性和泛化能力。
无需插值的物理感知影像组学:解耦CT与MRI中的体素几何与信号修改
体素间距感知影像组学无需插值,解耦体素几何与信号修改,保持原生信号,优于各向同性重采样。