物理闭合性对机器嗅觉至关重要:面向可辨识动态气体解混的麦克斯韦-斯特凡图求解器
提出物理闭合图神经求解器UnMixNet,求解多物理约束动态气体解混,实现可辨识浓度推断。
ECoNGS:用于体可视化的高效压缩神经高斯溅射
ECoNGS用神经网络预测隐式高斯溅射,联合学习与熵编码压缩,体视化中PSNR提升2.2dB,模型大小减少6.1倍,训练提速5.9倍。
基于CT生成的数字重建放射影像的深度学习估计性别、年龄、身高和体重
基于CT冠状DRR,集成模型高精度估计成人性别、年龄、身高和体重,误差低,泛化性可微调改善。
属性应来自图像而非类名:面向视觉语言模型的分布条件属性选择
从图像选属性替代LLM描述,提升分布偏移下零样本分类准确率,高效可解释。
Fluid-SDF: 基于可微分基元的超轻量且可编辑的隐式形状表示
提出用不到100个参数的可微分基元框架,实现复杂形状重建、抗噪和零样本编辑,适合边缘设备。
DeforM: 通过时空掩码进行推理引导的物理感知视频生成
DeforM利用VLM推理生成时空掩码,引导视频生成聚焦物理关键区域,提升形变真实性与物理一致性。
先感知后生成:物体感知提升单视图三维重建
利用预训练感知模型提取语义几何特征,驱动单视图3D重建,显著提升性能。
MissingBench-Verified:探究视觉语言模型无法检测物体缺失部件的问题
VLMs普遍无法识别物体缺失部件,现有方法无效,需架构或训练干预。
无根基的注意力:医学视觉语言模型中视觉解释的因果评估
评估表明,医学VLM的注意力热力图不忠实,与遮挡重要性负相关,模型实际依赖文本而非图像。
通过类别级数据集混合实现乳腺MRI肿瘤分类的跨数据集泛化
通过混合不同来源数据每类样本,消除数据集偏差,使外部测试准确率从近随机升至0.88+
双刃同质模态相似性:面向可见光-红外模态不完全行人重识别的模态自适应匹配方法
针对模态不完全行人重识别,提出MAMT方法,通过发散与共享模块提取特征,动态融合实现稳定匹配。
范数还是方向?解读高分辨率视觉中的Vision Mamba
VMamba通过token方向编码判别信息,MambaOut依赖高范数前景token;VMamba密集预测优势源于token范数与方向的结构组织。
游戏速度级别的生成式世界渲染器
提出AlayaRenderer-Flash,将渲染速度从0.56 FPS提升至31.54 FPS,实现实时可玩游戏世界。
SkyEV:RGB-事件无人机检测与跟踪数据集及基线
提出SkyEV数据集,含高同步RGB与事件数据,覆盖真实挑战,提供多模态基线。
演化领域中的连续视频多模态大语言模型适配
提出DAER框架,通过域隔离专家与分布感知路由,实现视频MLLM在演化领域中的持续适应,避免灾难性遗忘。
解耦流水线结合提议重排序与分数融合的正-无标签海洋物种检测
解耦流水线:冻结检测器、微调分类器、分数融合,应对正无标签检测;保留召回并改进排名更有效。
后验采样:医学图像翻译中缺失模态的生成器
以线性逆问题建模缺失模态,后验采样加流匹配,学习联合先验重建任意模态,性能最优。
使用边界框提升小语言模型在基于视觉的评分任务中的性能
通过边界框裁剪学生回答,显著提升小语言模型在短答案评分中的准确性和计算效率。
弱监督病理信息引导的表示学习用于基于PET的瘤内异质性内容检索
提出弱监督PET框架,利用病理信息训练但仅用PET推理,热点条件嵌入有效捕捉瘤内异质性并提升检索性能。
跨模态无人机目标跟踪:状态感知表示学习与统一基准
提出状态感知表示学习SARLA,含模态与空间状态模块及偏移损失,建立1079序列基准CM-UOT,性能优于20种方法。
CGMap:一种利用无人机的地理空间感知深度学习框架用于作物缺株测绘
利用无人机影像和YOLOV8检测甘蔗出苗,通过MST归一化方向生成空间点云推断缺苗,输出地理空间图指导补种增产。
面向无掩码皮肤病变分类的特权病变-上下文关系蒸馏
提出PLCRD框架,训练利用掩码,推理无需掩码,通过关系蒸馏传递病变-上下文知识,实现高性能无掩码皮肤病变分类。
STS-NET:基于卫星图像时间序列的自监督作物胁迫时空检测网络
提出自监督3D卷积自编码器STS-NET,利用卫星时序植被指数检测作物胁迫,在甘蔗数据上达到高精度,减少标记数据依赖。
移动字母:文本到视频生成中训练数据的受控研究
通过受控实验发现,数据分布多样性和描述质量对模型性能至关重要,但优质数据微调无法完全弥补训练数据缺陷。
可靠性感知的三维几何注入用于通用行人重识别
提出UniGeo框架,通过一致性门控与双流残差融合安全注入3D几何先验,提升通用行人重识别在遮挡、换衣等挑战场景的鲁棒性。
图像编辑模型作为数值求解器
预训练图像编辑模型可充当数值求解器,成功模拟多种物理方程,但表征误差限制混沌系统长期模拟。
UVFaceFusion: 基于UV空间神经融合的快速多视角野外拓扑一致性人脸重建
通过UV空间可学习神经融合,实现快速多视角固定拓扑人脸重建,仅Ava-256训练即达SOTA精度,16视图重建<3秒。
使用小型多模态语言模型的上下文学习进行伤口分类
检索式上下文学习让小型多模态模型无需训练即可伤口分类,性能依赖模型规模与检索策略。
ZeroSplat: 三维高斯泼溅中的广义指代分割
ZeroSplat提出无需训练的3D广义指代分割框架,通过多视图几何约束将2D先验提升至3D空间,实现任意数量目标的高效精准分割。
开放词汇注视目标预测:基准与方法
提出开放词汇注视目标预测基准DiSG及方法,结合文本驱动发现与梯度调优,提升野外场景泛化能力。
OPD-IAD:通过在线策略自蒸馏从语言判断到工业异常检测
提出OPD-IAD框架,以语言引导实现精准像素级工业异常定位。
稀疏思考,密集预测:用于图像超分辨率的连续思维机器
连续思维机器通过窗口级稀疏表示生成密集查询,实现图像超分辨率渐进重建,PSNR显著提升。
通过语义不变自蒸馏学习语义鲁棒的变更检测
提出SCDistill框架,用语义不变自蒸馏和扩散扰动模拟,提升遥感变更检测鲁棒性,减少误报,达SOTA。
局部标签引导的特征迁移用于生成真实医学图像:基于GAN与扩散方法比较
提出LLIFT框架,利用GAN和扩散模型生成带真实病变的脑MRI,无需像素级标注,为XAI提供可控基准数据。
Wave2Body:将毫米波人体姿态估计重新构想为雷达到身体令牌翻译
Wave2Body解耦毫米波姿态估计为令牌翻译,实现强跨域泛化与低计算成本。
TAP-RAG:面向长文档多模态问答的任务感知策略控制
提出任务感知策略框架TAP-RAG,通过预测任务先验与证据扩展,在长文档多模态问答中提升准确率9.1和4.5个百分点。
SynGallery:面向实例级艺术品识别的真实画作合成画廊
合成画廊数据集通过多视角3D渲染提升艺术品识别性能,增益来自几何视角变化而非真实感。
面向增强大型视觉语言模型鲁棒性的双重对抗微调
提出双重对抗微调框架,联合视觉与语义监督信号,增强LVLM鲁棒性,在多任务中超越现有方法。
面向视频生成的显式物理参数控制学习与基准测试
提出物理参数数据集、物理引导扩散模型及物理一致性基准,实现显式物理控制,提升视频生成物理真实性。
DobicVLM:通过分组相对策略优化实现胸部X光报告生成与临床程序化奖励对齐
DobicVLM结合SFT与GRPO,用临床规则奖励提升报告生成质量,超越Gemini,实现透明对齐。
中文标题:AEC工程图纸布局检测与信息提取的深度学习方法基准测试
中文摘要:构建AEC专用数据集并基准测试五种深度学习模型,RF-DETR与Qwen3-VL表现最优,为自动信息提取奠定基础。
SWITi:使用滑动窗口内部平铺量化和减少平铺伪影
SWITi通过滑动窗口平均降低后验预测平铺伪影,引入无参考指标FRT/ASV,在荧光显微镜数据中提升重建保真度与分辨率。
缓解零样本视频时刻检索中的模态与语言风格差距
基于自相似性规避模态和语言风格差距,结合MLLM推理,实现零样本视频时刻检索最先进性能。
基于大视觉语言模型的上下文结构化视频异常检测
提出CSI-VAD,通过分解视频为环境、物体、时间三种上下文进行无训练异常检测,效果优于直接整体推理。
CoGoal3D: 基于3D感知融合与精化的协作式3D目标检测
提出两阶段3D协作检测框架CoGoal3D,通过3D感知融合缓解空间错位,并用点重构精化,在三个数据集上[email protected]提升超10%,达SOTA。
IMMoE:基于视图专家混合融合的不完整多视图异常检测
提出IMMoE,通过多视图专家融合和局部异常增强编码器,处理缺失视图异常检测,在RIMAD上像素级和图像级指标分别提升11.8%和2.8%。
Mage-Flow:一种高效的原始分辨率图像生成与编辑基础模型
Mage-Flow是4B参数的高效图像生成编辑模型,协同设计实现快速训练与推理,1024^2图像生成仅需0.59秒。
对比式在线策略蒸馏
COPD通过对比指令生成token级优势信号,促使学生模型学习更简洁高效的推理,减少推理长度且不损性能。
FilmWorld:通过动态电影世界建模实现小说到电影的智能体生成
提出FilmWorld智能体系统,分构建与演化两阶段将小说转化为长视频,显著提升叙事保真度与跨场景一致性。
Gaze-DETR:基于优先级地图自上而下引导的红外弱小无人机检测方法
提出Gaze-DETR,通过预测优先级图引导定位前特征增强,在红外弱小无人机检测上取得高精度。