RISE:基于单静态雷达的室内场景理解
RISE利用多径反射实现单雷达室内场景理解,布局重建误差16cm,物体检测IoU达58%。
校准零样本对抗性CLIP的不确定性
针对CLIP对抗扰动下不确定性校准缺失,提出狄利克雷分布对抗微调,实现校准不确定性与鲁棒性,保留干净数据精度。
个人AI助手在相册视觉问答中的应用
研究个人相册VQA,构建camroll数据集和camroll-agent,利用层级记忆导航大量个性化图像,揭示与长文本记忆的差异。
模型是否共享安全表征?跨模型引导安全视觉生成
提出跨模型安全控制框架,源模型学习安全方向迁移至目标,无需目标不安全数据,实现同等安全性与生成质量。
深度学习辅助基于OCT和OCTA的AMD分期
深度学习模型利用OCT/OCTA数据自动准确分级AMD严重度,基于生物标志物模型性能最优,尤其利于早期检测。
从单目视频恢复物理上合理的人-物交互
提出RePHO,用强化学习和自适应采样从单目视频重建物理合理的人-物交互,提升物理合理性。
LightVesselNet:用于视网膜血管分割的超轻量级亚10万参数网络
提出仅75K参数的LightVesselNet,集成注意力与多尺度特征,在五个数据集上高效分割,适合低资源临床部署。
TopoPult-SSL:基于自蒸馏弱临床先验的无腺体掩膜跨设备睑板腺分割
提出TopoPult-SSL框架,无需腺体掩膜,仅用弱临床先验实现跨设备分割,Dice达0.716,性能超越现有模型。
Biomazon: A Multimodal Dataset for 3D Forest Structure and Biomass Modeling in the Amazon Basin
OCT血管造影中的三维视网膜微血管修复
提出深度学习算法,从单次OCTA数据恢复三维视网膜微血管,显著提升图像质量与保真度。
NIV:神经轴变体用于可变字体生成
NIV自动将静态字体转为可变字体,通过神经变形预测位移,支持多轴一致变体,泛化至未见图样和手写输入。
VideoKR:迈向知识密集与推理密集型视频理解
首个知识密集型视频理解训练语料VideoKR,含31.5万推理示例,有效提升模型视频推理能力。
通过特权传感器引导对比学习实现PointGoal导航的鲁棒场景迁移
提出特权传感器引导的对比学习,解耦表征与策略,提升PointGoal导航场景迁移,部署仅需单目RGB,性能超越大模型。
UniPixie:通过流匹配的统一概率性三维物理学习
UniPixie将物理预测重构成连续分布学习,单图生成可控多样物理场,统一多求解器,误差降低超50%。
你还会把这个叫做Dax吗?视觉语言模型与人类中的新颖视觉参照
VLM学习矛盾新概念困难且过度泛化,人类与模型敏感度相关但更精准。
Disentangled Fine-Grained Prototype Learning for Incomplete Image-Tabular Classification
用于马匹情感状态评估的马眼眨眼检测与分类
三种眨眼分类方法在马视频中达高F1分数,揭示细粒度面部动作单元检测的潜力与挑战。
形式概念格:基于概念学习的语义支架
利用形式概念格作为语义支架,引导神经网络学习分层概念表示,提升可解释性与干预效果。
ORACLE-CT:面向CT分类的解剖感知支持池化
提出ORACLE-CT框架,通过多器官分割实现解剖感知池化,提升CT分类的判别力和外部鲁棒性。
我们能否在生成前预测文本到图像内容的人类偏好?这样做有用吗?
研究能否在生成前预测人类偏好分数以改进图像生成质量,发现可行且硬件开销极小。
使用视觉几何变换器的非配对RGB-热高斯泼溅
提出非配对RGB-热高斯泼溅框架,用视觉几何变换器估计位姿,对齐后实现多模态新视角合成。
LLM引导的ANN索引优化用于人-物交互检索
提出相位感知LLM代理优化耦合参数,HICO-DET上比TPE提升33.3%,吞吐量增益15.3倍。
UltraVR: 面向证据支撑推理的诊断性超分辨率图像VQA基准
UltraVR基准用结构化推理链诊断VLM在超分辨率图像上的证据获取与推理失败环节。
ShotCrop³:将人像图像裁剪为电影级三镜头构图
提出三重镜头构图任务和ShotCrop方法,从单张人像生成三镜头组,定位精度比GPT-5提升2.82倍。
Almieyar-Oryx-BloomBench:面向认知启发的视觉-语言模型双语多模态基准
首个基于Bloom分类法的双语多模态认知基准,揭示VLM在事实回忆与创造性合成上的短板及英阿差距。
BRepCLIP:面向CAD理解的BRep基元对比多模态预训练
BRepCLIP首次以对比预训练对齐BRep几何与语言图像,大幅提升CAD检索与零样本分类性能。
HDST-GNN: 用于无人机航拍图像多目标跟踪的异构动态时空图神经网络
提出HDST-GNN异构动态时空图网络,通过高度自适应边、异构节点和遮挡门控聚合,MOTA达94.51%,ID切换减少81%。
BMCR:基于强化学习的自适应骨干模块组合用于遥感目标检测
提出BMCR方法,动态组合CNN与ViT模块,实现自适应遥感检测,性能提升达2.5点。
面向医学视觉问答的噪声感知视觉表示学习
提出噪声感知Med-VQA框架,用去噪自编码器与LoRA微调,提升鲁棒性与性能。
皮肤之下是什么?估算猪的体况
PigFormer系统利用RGB-D摄像头自动预测猪的背膘厚度等体况指标,MAE仅2.43毫米,实现非接触连续监测。
面向细粒度分布外检测的双特征解耦方法
提出双特征解耦网络(DFDNet),通过空间-频率与重构引导模块解耦特征,解决细粒度类间细微差异与背景干扰,显著提升检测性能。
KV-Control: 参数高效的键/值注入方法用于轨迹可控的文本到运动生成
KV-Control通过注意力侧注入键值记忆实现精确轨迹控制,轻量高效且不破坏文本运动先验。
VTI-CoT:面向视频推理的视觉-文本交错思维链
提出VTI-CoT框架,融合视觉与文本推理,自动构建多模态数据,经OCR压缩提升训练效率,达到SOTA性能。
多任务裂缝基础模型:面向土木基础设施中工程可靠的裂缝表示与拓扑保持
提出CrackGeoFM多任务框架,实现裂缝精确分割、拓扑保持与不确定性校准,仅需5张标注样本即可适应新场景。
T-SAR-JEPA:通过潜在预测的SAR幅度堆叠自监督时间异常检测
自监督框架T-SAR-JEPA通过潜在预测检测SAR时间异常,在夏威夷数据集上ROC-AUC达77%,优于基线方法。
CoFi-UCGen:无需标签先验的由粗到细无监督条件生成
提出CoFi-UCGen框架,通过语义互学习与比特码实现无标签的粗到细条件生成,提升图像质量与语义一致性。
V2V-Bench:视频到视频生成评估的综合基准
V2V-Bench提出11维度评估视频到视频生成,包含时序对齐等五类,与人类判断相关性达0.905。
LongSpace:探索视频中从感知到回忆的长时空间记忆
提出长视频空间记忆基准LongSpace-Bench和框架LongSpace,利用3D线索与层级记忆提升长程空间理解。
用于快速自回归图像生成的并行雅可比解码
提出并行雅可比解码(PJD),通过二维空间并行扩展和注意力掩码优化,实现4.8-6.4倍加速,保持生成质量。
基于机器学习的监控摄像头实时威胁检测
基于YOLOv8,融合自建钝器数据集,实时检测枪支、刀具和钝器,提升精度且无过拟合。
ViCuR:视觉线索作为多模态在策略蒸馏中的可恢复特权
ViCuR用可恢复视觉线索替代答案特权,轻量模块提取任务相关证据,提升多模态蒸馏性能,平均超1.19。
TextWand:场景文本编辑的统一框架
提出统一框架TextWand,通过ORPE实现像素级布局与样式控制,RAS确保擦除干净,构建基准TextWand-Bench,多项任务超越现有模型。
基于LLM提示翻译和LoRA微调的韩语日记文本情感感知图像生成
利用LLM识别日记隐含情感,结合LoRA微调生成儿童画风格图像,研究触发词影响与评估指标局限。
DRIFT: 一种用于视觉-语言模型中连续输出解码的残差流适配器
DRIFT框架结合基础预测与流匹配生成细化,在连续输出任务(如视觉定位、机器人控制)中迭代提升性能。
物理引导的深度展开用于盲跨传感器光谱超分辨率:通过学习光谱变换函数
提出PGU-Net,联合估计高光谱图像与光谱变换函数,解决盲跨传感器超分辨率,性能领先。
ExpSpeech-Net:表情与语音的多模态融合用于深度伪造检测
提出轻量级多模态深度伪造检测模型ExpSpeech-Net,融合表情与语音,准确率达94.5%。
先想象再预测:交错潜在视觉推理用于视频事件预测
提出交错潜在视觉推理框架Future-L1,通过潜在空间保留视觉语义,在视频事件预测上达到最先进性能。
超越绝对分数:基于相对编辑差异的通用图像美学评估
提出RED-Aes框架,利用编辑模拟审美推理,通过相对监督学习美学差异,实现更优泛化。
LPDR下一代并行解码器:架构优化与类别平衡的GAN增强
融合空间混合注意与类别平衡增强,将少数省份车牌识别率从78.2%提至91.5%,保持152FPS实时处理。
LiAuto-GeoX: 高效可落地的驾驶Transformer
提出基于几何蒸馏的稠密3D重建模型,220FPS运行,实现高效实时自动驾驶感知与预测。