利用图像-问题依赖性提升VLM测试时强化学习
TTIQ利用图像与问题依赖性构建奖励,引导VLM测试时强化学习,在八个VQA数据集各规模上均取得最佳表现。
月球遥感多模态多分辨率基础模型
提出月球遥感多模态多分辨率基础模型,基于近200万瓦片、11模态双尺度预训练,四任务超基线并开源。
医学图像分类中类间过渡不确定性的自适应共形重分配
提出AdaConRed,将共形预测集重分配为可操作单类决策,提升口腔癌和黑色素瘤等关键类别准确率。
经目标校验的视频问答可靠性分数优化
无需重训或改答案,利用目标校验精炼视频问答可靠性分数;HERBench与Perception Test上AURC平均降16.6%和18.9%。
基于时间可靠性抑制与组合图解码的可靠第一人称动作预测
提出TRS+RVG,抑制不可靠时序证据并重排动名组合,损坏下鲁棒性提升,稀有组合降至1.1%。
HGSQ:面向实时航拍小目标检测的热力图引导稀疏查询检测器
HGSQ以热力图预测引导稀疏查询与局部细化,并自适应调整解码预算,航拍小目标实时检测达高精度。
Multimodal Foundation Models Adaptation based on Domain-Aware Relaxed Orthogonal Subspace for Remote Sensing
ConeGaussian:面向通用中心相机的抗锯齿高斯光线追踪
各向异性像素足迹由相机逆向映射的相邻光线直接构建,可免修改适配多种中心相机与高斯光线渲染骨干,1/8分辨率下提升达4.3dB。
基于事件视觉与时间增强卷积脉冲神经网络的行人过街意图分类
将驾驶视频转为事件流,用CARLA增强,训练卷积脉冲网络分类行人过街意图,准确率达95.83%。
RIGOR:面向全景重建的机组感知几何
冻结前馈主干,将全景视频视为四视图虚拟机组,通过一致性检测与几何验证构建Sim(3)位姿图,校正漂移、提升重建精度。
迈向实用精准农业:嵌入式边缘硬件上的实时水果检测与视频分析
在Jetson边缘端实现实时水果检测、跟踪计数,TensorRT FP16高效,管线30 FPS无丢帧,性能受采集视角影响。
基于任务的CT协议优化:强化学习与虚拟成像试验
提出强化学习与虚拟成像试验的CT协议优化框架,仅评估约2%方案即恢复98.2%穷举最优,无仿真预筛达89.7%。
ProtoCAM:用于超声图像乳腺病变分类的可解释小样本掩膜引导原型学习
ProtoCAM融合掩膜引导特征与原型度量学习,小样本下乳腺超声分类F1达0.910,兼具可解释性。
从宣传的改进到实测能力:在伪造任务上评估 ChatGPT Images 2.5
实测ChatGPT Images 2.5伪造任务:宣传改进未带来目标字段正确性提升,细字与定位仍受限。
多模态遥感影像火星滑坡分割的全局-局部上下文渐进扩展网络
首次系统评估火星滑坡分割,提出融合渐进扩展与Transformer的U形网络,多模态数据上表现最佳。
YOLO12-MambaScan:一种融合高频增强与状态空间建模的高效目标检测器
融合高频增强卷积、坐标注意力与Mamba全局建模的YOLO12航拍小目标检测器,精度与效率兼顾。
Realtime-Venus:一种具备异步委托能力的全双工交互系统
提出全双工交互系统Realtime-Venus,双9B模型支持视听与语音,异步委托任务,多项基准领先。
MARC:面向亚细胞空间转录组细胞分割的形态学感知共识回归
MARC预测多方法共识支持图,免去多流程推断,Dice达0.90,助力大规模细胞分割评估。
Hyper-LLaVA:面向多模态持续指令微调的双曲不确定性感知模态平衡路由
提出Hyper-LLaVA,用双曲空间分布相似度增强模态内任务匹配,并按不确定性平衡跨模态路由。
面向共显著目标检测的秩一致性集合推理
提出RCSR框架,将图像组视为无序集合,用秩一致性与截尾统计聚合多尺度组槽,抑制偶然匹配,无需外部模型。
FFVO:面向长时序视觉里程计的前馈位姿解码器
FFVO以紧凑相机令牌、分层时序解码与轨迹监督,实现长时序视觉里程计稳定低漂移的位姿估计。
基于眼中心追踪与动态阈值的低成本实时驾驶员疲劳检测系统开发
利用摄像头非侵入式实时监测眼睛开闭,超时闭眼即判定疲劳并报警,低成本防事故。
MomentBA:面向可微光束法平差中各向异性对应不确定性的二阶空间矩
MomentBA从局部匹配响应的二阶空间矩导出各向异性协方差,融入可微光束法平差,提升单目视觉里程计精度与鲁棒性。
恢复真正重要之处:联合恢复与识别的启示
提出任务驱动的联合恢复-识别(JR²)范式:只恢复识别所需区域,提升性能,并跳过约70%干净帧降本。
StepPrune:跨多模态大语言模型的自适应序列化视觉Token选择
将视觉token剪枝建模为自适应序列决策,自动确定保留量,剪枝88.9%仍保94.6%性能,提速1.5倍。
GEAR:从动态编码到动态激活的社交轨迹预测
提出GEAR,在轨迹生成时动态激活个体与社会偏置,按未来步和密度调节社会线索,提升预测性能。
超越OCR准确率:图像退化下以文本为中心的VQA——模块化与端到端方法对比
退化图像下,微调模块化OCR流程准确率达57.5%,远超端到端基线,OCR错误率难测VQA表现。
面向3D点云的效用保持语义隐私保护
提出类别迁移式点云语义加密框架,隐藏原类别、保持任务效用并支持授权恢复。
DiVA:通过视频模型实现交互式数字生命模拟
DiVA用MLLM路由加堆叠视频管线,实现可长期交互的数字生命模拟,AVC转场防退化,效果领先。
TotalSynth:基于MRI和CBCT的稳健全身合成CT
TotalSynth是可复用预训练框架,用MRI和CBCT生成全身合成CT,性能稳健;外部数据需验证并可选微调。
使用深度学习的零样本跨材料叠层衍射相位重建
提出局部到全局学习框架,无需迭代即可零样本跨材料重建叠层衍射相位,指标最优,速度较ePIE快约十倍。
基于深度面部表情分析的真实场景事件级情绪识别
提出端到端事件级情绪识别流程:检测人脸、CNN分类表情并聚合概率,实验验证真实场景有效性。
BLInD:将驾驶意图学习为未来自车轨迹上的分布
仅凭车辆状态历史即可预测未来轨迹的多模态分布,无需感知输入,跨数据集通用,毫秒级推理,使AEB误报最多降25倍。
SGWIB:面向视频高光检测的切片Gromov-Wasserstein信息瓶颈
提出SGWIB信息瓶颈框架,以切片Gromov-Monge差距正则保留片段时序结构,并结合上下文解耦,在两数据集上取得最优高光检测性能。
SkyAnchor:从无位姿地面视角序列更新度量尺度航拍3D高斯场景
以航拍场景为固定支架,配准无位姿地面序列,插入地面高斯并联合优化,实现度量轨迹与高质量渲染。
面向地球基础模型的物理类型化与几何感知表示
探讨地球基础模型是否应显式保留物理类型与几何变换,先以ERA5分阶段证伪,检验实际增益。
Mind2Cloud:基于双粒度扩散解码的脑电到点云生成
双粒度扩散解码融合全局Transformer与局部PVCNN,随去噪时间步自适应调整粒度,由脑电生成点云,在EEG-3D数据集上刷新最优。
CirrGuide:基于T2加权MRI的肝硬化分割与严重程度分类深度级联框架
深度级联框架先分割肝硬化肝脏,再以预测掩膜为解剖先验引导分类,提升T2W MRI分割与轻中重度分级性能。
面向CT肝脏肿瘤分割的基础模型参数高效微调
PEFT微调SAM分割CT肝转移瘤:Conv-Adapter/LoRA最准,DiSCo参数效率最高。
量子门控 LiteSSD:一种参数高效的前视声呐目标检测轻量级量子-经典混合框架
提出量子门控LiteSSD,将量子多电路处理改写为通道门控,以极少参数实现前视声呐高精度检测。
适配开放权重多模态大语言模型以生成电子显微镜分割点提示
MLLM经适配可从自然语言生成电镜点提示;Qwen3-VL AP50达0.736,且能跨数据集迁移。
LPA-CWM:一种基于反事实世界模型运动推理的学习型物理裁判器
LPA-CWM用3M参数学习型裁判器学习候选响应可靠性权重,改进反事实世界模型的运动推理。
RA-CoA:基于检索增强属性链的免训练时尚图像描述生成
免训练框架RA-CoA以检索属性集+属性级推理提升时尚图像描述精度,METEOR涨26.3%。
弥合合成-真实域差距的少样本冷冻电子断层扫描分类
提出可学习变换模块的合成到真实适应框架,在输入与特征层面弥合域差距,少样本分类超越现有迁移学习基线。
面向各向异性纹理分析的PyRadiomics体素间距感知扩展
为PyRadiomics添加体素间距感知扩展,无需插值即可分析各向异性纹理,与原版兼容。
不依赖网格特征系统加速 HKTex:局部展开与随机化热特征
用局部展开与随机化热特征替代 HKTex 全局特征分解,提高精度并大幅加速,支持超大网格。
在对我说话还是对别人说话?重新思考第一视角视频中的"对我说话"检测
将TTM重构为在线帧级预测,构建90万帧数据集,多模态模型F1达75.5%。
基于三维步态的孤独症分类:注意力增强深度学习与跨折统计稳定性分析
提出注意力增强Transformer框架,基于三维步态特征分类自闭症,两数据集五折交叉验证准确率达99%与95%,并评估跨折稳定性。
SignMimic:基于人体形状无关姿态迁移引导的鲁棒高质量手语动作生成
SignMimic通过刚性规范化、非刚性适配与姿态补全,实现鲁棒高质量手语视频生成,在多数据集达SOTA。
双向路由与稀疏空间注意力驱动的多视角BEV 3D目标检测及其在自动驾驶中的应用
提出Sparse-BEVNet,融合双向路由与稀疏空间注意力,提升BEV 3D检测性能。