大、亮或隐形:三维CT基础模型的冻结特征基准测试
三维CT基础模型基准测试:无通用最优,检出率取决于病灶大小与对比度,小低对比病灶仍难。
Diff-VF:基于扩散模型的免训练高质量长视频生成
提出免训练框架Diff-VF,融合三种策略将短视频扩散模型扩展为长视频生成,兼顾时间连贯与运动多样性。
尊重零样本不确定性:测试时自适应视觉语言模型的保守校准
TTA提升精度但损校准,提出ZAEC:以零样本熵为参考做最小温度缩放,无需标签,多数据集上ECE最低。
PaCoNet:面向平行坐标的深度数据提取方法
首用深度学习方法提取平行坐标图数据,超越基线,并构建大规模数据集,实现自动分析与重设计。
DARAD:面向持续遥感图像-文本检索的双适配器与排序感知蒸馏
提出DARAD框架,结合双适配器与排序感知蒸馏,缓解遥感持续检索中对齐空间扭曲,兼顾新数据适应与旧数据保留。
从失败中学习:基于硬负样本的检索中心思维链用于统一多模态检索
提出UniME-R1框架,借硬负样本模拟检索失败,生成检索中心思维链,优化候选重排与全库重检,显著提升统一多模态检索性能。
迭代还是加宽?测试时细化何时有助于LiDAR场景补全:证据几何、训练覆盖与计算量的受控研究
受控实验表明迭代细化仅对连续缺失胜过加宽模型,对稀疏删减不如训练增强,对附加杂波无效,且计算成本更高。
面向SAM3图像分割的通用概念扰动
提出通用概念扰动UCD,首个针对SAM3的跨概念对抗攻击,显著降低分割性能且可迁移至新模型。
下一张截图知道答案:面向移动GUI智能体的门控后见之明蒸馏
提出门控后见之明蒸馏,用下一截图作特权信息,仅在学生失败时蒸馏,提升移动GUI智能体成功率。
Wan-Animate-2:拓展角色动画的应用边界
提出端到端角色动画框架,摒弃显式运动提取,支持文本控制视角,轻量版实现实时流式生成。
Bar-JEPA:利用联合嵌入预测架构从柱状图中提取数值
Bar-JEPA利用自监督联合嵌入预测架构提取高语义特征,简化解码器恢复柱状图数值,优于监督基线。
域引导的候选选择用于智能体图像编辑:以阴影去除为例
商用视觉模型直接编辑阴影易出错,基于物理的智能体候选筛选流程在基准上CDD降47%以上。
Dense-Cast:面向降水临近预报的轻量级深度学习架构集成
融合密集连接、残差与注意力的轻量级模型,实现半小时降水临近预报,印度东北部验证精确。
EvReflection:事件驱动微动力学实现反射去除
提出事件驱动的反射去除网络EvReflection,利用微动态分离图层,构建首个真实数据集,性能最优。
样本自适应潜在奖励:不确定性引导的扩散后训练
提出SURE框架,学习奖励分布,用不确定性引导扩散后训练,提升偏好预测并达SOTA。
EmoWorld:用于可控情感视频生成的解耦情感场
EmoWorld解耦情感视频中的氛围、语义与时间因子,通过VAS/SAS/TAS提升情感对齐度、降低波动,支持27类情感生成。
置信度至关重要:利用多视图几何先验提升GS重建质量
集成多视图预测的深度/法线先验及置信度图,可显著改善3DGS几何重建,尤其对高光物体效果突出。
基于CT的合成数据生成框架用于患者体位评估
提出从CT扫描合成生成深度图与X光片训练数据,预训练使上踝关节体位评估准确率提升11个百分点。
CFGPNet:基于交叉注意力的融合梯度编程网络框架用于多光谱目标检测
提出CFGPNet,用交叉注意力与梯度编程提升多光谱目标检测,在五个基准上实现高性能与效率平衡。
HOPE:从单目视频估计手-物体压力
提出HOPE,用单目视频估计手物接触压力,泛化至裸手。
支撑操作因子分解:受控干预下冻结视觉编码器的组合读出
提出因子化读出,分解支持显著性与操作后验,消除操作洗白,标准基准高精度,但MuJoCo暴露边界。
学习绘画与摄影构图分析的视觉表征
对比类人感知与微调模型,前者可解释,后者性能优但牺牲跨域泛化。
BendTwin:基于弯曲感知可微分弹簧-质量模型的鲁棒稠密到稀疏物理重建
提出弯曲感知可微分弹簧-质量模型BendTwin,用弯曲约束增强稳定性与变形预测,优于基线,可从稀疏RGB-D视频重建。
利用输入自适应优化攻击视觉Transformer的对抗性效率退化综述
综述针对ViT输入自适应优化的对抗效率退化攻击,比较两种攻击,用计算量等指标度量,并探讨防御。
PRISM:分布门控流匹配用于可控无配对图像翻译
分布门控流匹配实现可控无配对图像翻译:逐特征门控依据源特征到目标分布的距离决定保留或改变,兼顾真实与结构。
深度引导的拥挤场景视频目标计数
提出深度引导检测器,融合跨模态注意与遮挡预测,统一去重,新数据集上平均误差降62%。
迈向可部署的孟加拉手语识别:专家验证数据与轻量级注意力模型
提出专家验证的孟加拉手语数据集RSBdSL38和轻量注意力模型,手机端高效运行,准确率96.37%。
MASS:具有权威共享状态的多玩家世界模型
MAS将世界动态与视角渲染解耦,用逻辑引擎推进权威共享状态,渲染引擎生成一致视角,实现可扩展的多智能体世界模拟。
OTLesMix: Wasserstein Barycenter and Optimal Transport Map for Synthetic Lesion Generation with Diverse Shapes and Locations
FLAIR超分辨率会抹除还是幻觉出小的白质病变?
超分辨率主要抹除真实小病灶而非产生幻觉,且随层厚增加;仍优于原始厚层,ECLARE最佳,INR无优势。
TLNM:基于Mask R-CNN的智能手机照片牙齿检测、编号与分割及外部验证
基于Mask R-CNN的智能手机牙齿检测编号分割模型,内外部验证精度高,可支持远程牙科筛查。
VLAff:面向统一可操作属性的视觉-语言-可操作模型
提出VLAff,从人类视频提取视觉、抓取和轨迹可操作属性,构建大规模数据集,统一预测并支持真实机器人零样本操作。
UQ-Loc:不确定性感知的LiDAR场景坐标回归
提出UQ-Loc,以各向异性高斯协方差头预测不确定性,用NLL损失和加权求解器,提升定位精度且校准良好。
面向超高分辨率静态360度远程呈现的多层系统
融合8K全景与4K云台,分层优化背景与动态前景,兼顾超高分辨率和交互性。
全局到腕部:任务条件下的未来腕部建模用于细粒度机器人操作
提出W2-VLA,通过任务条件下的未来腕部建模预测腕部状态,提升细粒度与接触敏感操作,动作生成频率超80Hz。
检视监督视觉网络中相似性发展的训练动态
提出DSI框架,揭示监督视觉网络训练中相似性感知经三阶段演化,并发现错误精炼现象。
XEWorld:动作条件世界模型能否泛化到未见过的机器人形态?
世界模型仅按视觉相似性匹配,无法泛化到未见机器人,需像素动作与时空对齐,小样本适应会遗忘已见形态。
面向第一人称助手的视觉意图定位
首个第一人称视觉意图定位数据集,提出链式推理指令调优,显著提升统一视觉定位能力。
零样本视觉-语言控制中的视觉接地
多数视觉语言模型零样本控制未真正基于视觉;图像正对照验证信息充分,加装监护后平衡准确率达0.954。
可逆不可学习示例:迈向深度学习时代的版权保护
提出可逆不可学习示例机制,以互信息最小化生成扰动阻止非法训练,双提取器消除水印影响,实现全面版权保护。
Afford-X:面向任务操作的可泛化轻量可供性推理
提出大规模数据集与轻量模型,实现任务操作的泛化可供性推理,性能提升逾一成,推理速度快近五十倍。
Prior-SG:任意结构环境下任务与先验驱动的场景图区域分割
Prior-SG将场景图生成视为概率对齐,融合任务与先验,结合多尺度特征,实现无墙环境下语义区域分割及零样本拓扑灵活。
LoRetta:面向全球尺度遥感稠密影像匹配的基础模型与大规模数据集
LoRetta将稠密匹配重构为定位-配准,构建全球多时相基准LEVIR-GM,AUC达83.3%,超越基线,延迟降低47.8%。
利用深度学习推进电线杆与标志检测
基于DETR检测电线杆和标志,精度达90.43%和88.26%,倾斜角误差1.01度,并公开数据集。
PADFormer:基于稀疏视角图像的姿态无关异常检测
提出姿态无关异常检测新模型,用ViT直接重建无异常图,免3D重建,在PAD基准最优,少样本检测亦佳。
GEB-Bench:多声部讲述的抽象结构
新基准测试抽象结构的多声部识别,失败有规律:模型能识别单声部,但跨声部映射普遍失败,仅前沿模型能缩小差距。
感知先于推理:视频理解与问答中的动态潜在推理
提出动态潜在推理法,先感知后按需推理,在九项视频问答基准上提升准确率,生成少于20个词元。
教基础模型读懂毫米波:用于人类行为理解的姿态引导运动学表示
提出mmMind,以3D姿态监督雷达编码器预训练,结合语言模型实现行为理解,性能优于基线。
TRNet:地形引导的频率校正与结构感知解码用于多模态水稻田分割
提出TRNet,融合高程与坡度校正地形干扰,联合语义边界内部分割,水稻IoU提升9-19个百分点,减少陡坡误检。
Radar4D-VLM:冻结语言模型上的提议引导时序4D雷达推理
提出仅用4D雷达的时序VLM,通过提议引导令牌化实现场景与运动推理,目标召回达98.13%,优于基线。