真实世界多模态纵向肺癌数据集
发布1365例肺癌多模态纵向数据集,多源缺失下融合方法仍优于单模态预后预测。
RoboSPA:VLA模型能否超越简单场景与短时任务?
提出机器人空间-程序评估基准,诊断视觉-语言-动作模型,发现其在复杂空间推理与长时规划上仍能力不足。
儿科胸部X光深度学习跨三国数据集的迁移性:判别、校准、工作点失效及有限标签恢复
儿童胸片模型跨三国迁移中,判别、校准、工作点失效各异;少量标签可恢复灵敏度但误报高,应分项评估并量化负担。
CoLMIN:面向协同自动驾驶的基于大语言模型的多决策路径协商
提出基于大语言模型的多决策路径协商与反思推理方法,实现协同自动驾驶稳定共识,仿真验证优于现有方案。
FSPGD:重新思考语义分割的黑盒攻击
提出特征相似投影梯度下降法,特征空间攻击破坏中间表示,提升语义分割迁移性。
面向长时程视觉-语言-动作操控的神经符号程序推理
本研究提出神经符号框架,结合VLA控制与任务图及程序记忆,辅以演示视觉引导,提升长时程操控的可靠性与条件分支能力。
BEAM3R:基于Mamba-3的射束视角隐式剂量重建架构
BEAM3R用Mamba-3在射束视角实现剂量重建,CT光子质子伽马通过率约96%,用时约20秒。
事故模拟器:基于真实事故报告生成具有物理真实碰撞轨迹的车辆碰撞视频
从真实事故报告中提取物理线索,用物理模拟器生成碰撞轨迹数据集,调优语言模型预测轨迹,结合NeRF渲染,生成视觉与物理双真实的碰撞视频。
分布外语义占用预测
提出OccOoD框架,用跨空间语义细化提升3D占用预测中的异常检测,在VAA数据集上显著提高未知障碍识别。
WeakMCN:用于弱监督指称表达理解与分割的多任务协作网络
提出WeakMCN多任务协作网络,联合弱监督指称表达理解与分割,通过动态视觉增强和一致性模块,在基准上优于现有单任务方法。
统一视觉-语言模型中理解与生成的跨任务泛化:一项受控研究
混合训练可双向提升但依赖视觉空间对齐;对齐好则跨任务迁移强,偏差大则冲突,生成监督助理解稀有概念。
物理引导扩散模型映射暗物质团块
新方法基于DarkClusters-15k数据集训练扩散先验,结合引力透镜观测快速精确重建星系团质量分布。
锚织:利用检索式局部空间记忆实现世界一致的视频生成
锚织方法用多个干净的局部空间记忆代替全局重建,通过学习协调跨视角不一致,显著提升长视频场景一致性。
E-RGB-D:基于结构光的实时事件感知
结合事件相机与主动结构光,逐像素获取彩色与深度,实现无帧超高速RGB-D感知。
用于鲁棒多模态三维检测的融合后鸟瞰图特征稳定化
提出轻量级融合后稳定器,稳定鸟瞰图特征,抑制传感器退化,提升相机丢失与低光检测精度。
边缘感知超像素标签传播与自适应伪标签的半监督高光谱图像分类
提出边缘感知超像素标签传播与动态历史融合预测框架,抑制边界标签扩散,稳定伪标签,提升半监督高光谱分类性能。
移动无人机视频中的个体计数与跟踪:基准与方法
构建移动无人机密集人群计数与跟踪基准,提出分组式跨帧匹配方法,计数误差近乎减半、跟踪精度提升逾六成。
RoboTok:面向人类演示检索与灵巧操作学习的互联网规模数据引擎
RoboTok是互联网规模数据引擎,检索网络视频中手部轨迹演示,助力灵巧操作学习并提升成功率。
SLIDEFORGE:将幻灯片视为结构化制品进行可控编辑的LLM智能体
提出智能体框架,构建可执行幻灯片状态图,实现保留布局、风格及可编辑性的受控编辑,效果优于现有方法。
IDSPACE:用于数字身份验证系统可靠评估的新型文档生成器 [扩展技术报告]
IDSpace通过模型引导贝叶斯优化生成合成证件,提升评估一致性15-45%,并发布35.9万张高质量文档。
WireSeg-32K:面向线缆实例分割的物理仿真合成数据集
提出WireSeg-32K,基于物理仿真生成3.2万张线缆合成图;微调SAM3使真实世界分割mAP@75提升10.2%。
Position: Unlabeled IS NOT Equal to No Human Supervision in Visual Learning
Exemplar:经典先验补充冻结特征,用于原生分辨率下的少样本显微图像分割
融合冻结特征与经典滤波先验,单配置跨十一数据集少样本分割达0.782,优于多数方法。
超越小补丁:多样后门触发器的黑盒检测与净化
提出TRIM黑盒防御,推理时检测并仅净化被操纵区域,无需训练数据或干净样本,攻击成功率降至1.16%,精度保持87.87%。
通过可微子集采样解决乳腺X线摄影视觉语言模型中的大海捞针问题
针对高分辨率和报告同质化问题,提出可微补丁采样与软标签分类损失,提升乳腺摄影零样本诊断和病灶定位。
谁为被剪除者发声?视觉标记剪枝作为覆盖优化
提出CoverPruner:将视觉标记剪枝视为查询加权覆盖最大化,无需训练,多种架构下平均精度最高,高压缩增益最大。
VeriPhy:面向世界模型评估与优化的智能体物理推理
VeriPhy将提示编译为类型化物理义务,用专家证据给出可溯源三值判定;覆盖生成缺陷多于现有方法,支撑世界模型评估与优化。
利用对比课程高效学习图像缩放
提出无需额外标签或监督微调的对比课程内在奖励,高效训练多模态大模型缩放工具,性能媲美基线。
当深度有害:面向无深度RGB-D显著目标检测的可靠性感知几何蒸馏
提出可靠性感知几何蒸馏框架,以冻结深度教师迁移几何知识,推理仅用RGB,在多个RGB-D SOD基准上取得最优或持平结果。
ProgResViT:面向自适应视觉Transformer的渐进式分辨率与宽度
ProgResViT以渐进分辨率和宽度进行输入自适应推理,低置信时复用特征继续细化,精度-计算权衡优于多种自适应基线。
无需计数标签的相机陷阱图像序列动物计数:iWildCam 2021挑战赛冠军方案
结合物种分类与检测启发式,无需计数标签即可估计序列中的动物个体数,获2021挑战赛冠军。
基于张量的脑表面建模与分析
提出统一的张量形态测量框架,结合曲面建模与扩散平滑,分析脑表面差异,定位儿童皮层灰质生长或萎缩区域。
有限数据下基于集成自学习的停车位分类方法
基于卷积自编码器集成的自学习方法,利用无标签数据学习通用特征,在小样本跨域情形下达到93%-96%精度。
面向高效3D高斯溅射训练的拉普拉斯频率层级
提出拉普拉斯频率层级法,采用由粗到细分频训练,归档低频场以减少活跃高斯,加快训练并兼容现有加速器。
P-CORE:面向点云神经编辑的自监督表面一致性
提出自监督方法,通过随机变形前后表面一致性,增强点云神经表示对大形变的鲁棒性,无需真值多视图图像。
PointGT:基于点表示的几何与纹理同步编辑
提出基于点的三维表示,结合几何变形与可学习UV映射,实现几何和纹理同步精细编辑,保持高渲染质量。
MedQA-MM:医学视觉推理背后的捷径
医学多模态问答凭文本/选项线索即可猜对,基准高分含水分;新子集去捷径后准确率骤降,需路径级证据。
BMCTrack-d:挑战性摄像环境下基于背部标记的猪只重识别与追踪
提出BMCTrack-d,利用背部标记在侧视复杂环境中实现猪只重识别与追踪,结合分类器、时间一致性检查和去重,追踪精度显著优于现有方法。
OCR-EDR:渲染感知的闭环OCR改进诊断与修复
提出渲染感知OCR-EDR框架,实现细粒度诊断到迭代修复,显著提升OCR性能与公式识别准确率。
MudraGen:几何监督的交互式双手手印生成助力印度古典舞蹈遗产保护
提出几何监督扩散生成,生成交互式双手手印,姿态解剖准确超现有方法,助力古典舞遗产保护。
Preserving Knowledge across Space and Time for Continual Video Deepfake Detection
深度可分离边缘视觉系统中的预处理失效与对抗检测
预处理防御在深度可分离边缘架构上失效,但其预测分歧可无训练检测对抗样本。
冻结视觉语言模型何时会响应无图像对象令牌编辑?一项免答案键协议及其启示
免答案键协议揭示:冻结视觉语言模型响应对象令牌编辑需显式教学,受令牌洁净度与密度影响,文本问答保留九成以上。
神经崩溃引导的无任务持续异常检测
提出NC-TFAD框架,用等角紧框架几何空间与合成异常样本,实现无任务边界的工业异常检测,在MVTec AD和VisA上优于现有方法。
FoRIS:免训练上下文分割中的渐进式前景细化
将上下文分割视为由粗到细过程,提出免训练FoRIS框架,经前景纯化、定位、整合三阶段渐进细化,1-shot/5-shot平均提升4.5/4.8 mIoU。
STARS-GS:面向大规模航空地表重建的结构感知正则化高斯泼溅
提出结构感知的高斯泼溅重建框架,通过保留结构的分区、邻域约束与自适应正则化,显著提升大规模航空地表重建精度。
探索对比语言-图像预训练在多源遥感数据中的潜力
提出全模态遥感框架,以光谱基分解和掩码对比学习将模型扩至异构数据,并建大型数据集,提升检索与零样本分类。
遮挡鲁棒的多模态情绪识别:基于面部图像与EMG融合的VR方法
融合下半脸视频与遮挡区EMG识别七类情绪,宏F1达51%,优于单模态基线,可用于VR情感交互。
TruncGradGS:通过截断梯度更新改进的3D高斯泼溅
提出分段截断梯度以解决梯度消失,提升三维高斯泼溅优化稳定性与初始化鲁棒性,适用静态与动态场景。
残差最优传输的专家协作方法用于模态感知红外-可见光目标检测
提出FlexibleFusion,用模态感知专家协作和残差自步熵最优传输,在模态缺失时仍可自适应融合,实现一致检测性能。