Latent Space Analysis for Interpretable Uncertainty in Melanoma Classification
ESMStereo:用于实时精确立体匹配的增强型ShuffleMixer视差上采样
通过特征融合与混合重构细节的增强型视差上采样,实现实时高精度立体匹配(116FPS)。
可信图像认证:基于取证知识图谱的方法
提出取证知识图谱框架,集成证据提取与推理,实现高可解释性检测,性能优于现有方法。
ABACUS:适配统一基础模型以桥接图像计数理解与生成
ABACUS统一模型无需基准训练,通过三大创新实现多种计数与计数图像生成,在七项基准达SOTA。
HANCLIP:双曲角度否定视觉语言模型系列
HANCLIP通过双曲角度嵌入重构,仅用2万数据增强否定推理能力,同时保持标准任务性能。
Sol视频推理引擎:面向高效视频生成的智能原生全栈加速框架
提出智能体驱动加速框架,组合五种技术,针对特定实例优化,在三个模型上实现2倍以上加速且质量近乎无损。
基于几何信息的自行车视角超车车辆检测与分析方法
提出几何信息驱动的视觉方法,自动检测自行车超车,召回率97.8%零误报,提前2.44秒预警,横向距离误差14厘米。
从空间到频谱:高效、频率引导的小目标检测特征表示学习器
提出频率引导特征学习框架,用轻量模块解耦特征建模,仅1/6参数超越YOLOv11。
倾听让视觉语言模型的视觉更清晰
提出PV-TAM,利用提示侧注意峰值分布,避免解码偏移和模态标记干扰,提升VLM视觉语言一致性。
REALM:面向物理世界视觉-语言模型的统一红队测试基准
首个物理世界VLM统一红队基准,集成12种攻击、3种防御、13个模型,发现文本注入攻击最易引发失败,多模态优化攻击迁移最强,单次攻击逼近迭代效果,模型规模不保证鲁棒性。
注意注意力头:多模态大语言模型的拓扑表示对齐
提出HeRA方法,对齐最未对齐的注意力头以保持跨模态拓扑结构,提升视觉任务性能并抑制幻觉。
教授:面向视觉语言模型的多教师无监督提示蒸馏
提出多教师无监督提示蒸馏,置信度加权集成提升平均HM 1.77点,域迁移下增益最大(+5.78)。
用于语义融合的文本嵌入的Token到Token对齐
提出Token-to-Token对齐框架,对齐提示间token对应关系,实现平滑语义融合与连续编辑。
DivRL:用于多样化主题驱动的解耦自相似性奖励
提出后训练框架DivRL,利用解耦特征同时优化身份一致性与结构多样性,破解“身份-多样性悖论”。
渐进式像素邻域可变形交叉注意力用于多光谱目标检测
提出PNAFusion,通过局部邻域交叉注意力和可变形对齐迭代优化多光谱特征融合,显存降低33%,mAP达84.2-90.5。
面向营养意识的食材级食物图像分割
研究食材级语义分割,SegFormer-B1在FoodSeg103上达79.29%像素准确率、32.04%平均IoU,并给出食材面积百分比作为营养意识提示。
EPEdit:用生成式AI和以用户为中心的设计重新定义图像编辑
EPEdit基于零样本Stable Diffusion,无需微调,支持多种编辑任务,用户友好且成本低,性能优于现有方案。
DriveStack-VLA:基于BEV的DeepStack视觉-语言-动作模型的渲染-教师对齐
提出DriveStack-VLA,通过BEV表示和渲染-教师对齐增强空间智能,自批判模块优化轨迹,取得领先驾驶得分。
从合成到恢复的织物图像去波纹基准
首次提出织物图像去波纹基准,构建物理合成数据集与基线模型,推动该领域研究。
VisChronos:通过真实事件革新图像描述
结合大语言模型和密集描述,从图像识别真实事件并生成上下文相关描述,新数据集EventCap提升事件理解。
ObsGraph:面向具身推理与探索的分层观测表示
ObsGraph提出分层观测场景图,通过粗到细检索与自适应探索,提升具身推理与探索效率。
基于神经形态计算的端到端雷达与通信调制识别
提出EMRFormer SNN架构,实现低功耗高精度调制识别,能耗降低超90%。
基于混合LLM智能体的通用准则驱动图像聚类
提出混合LLM通用图像聚类框架,利用文本准则桥接任务差异,无需特定训练,性能优于专有方法。
一种用于精准定位文档元素的大语言多模态模型
通过高质量数据与强化学习联合训练,PreciseDoc模型精准定位文档元素,显著提升文档理解性能。
具备反事实可控性的自主视频生成用于自进化世界模型
本文主张反事实可控的自主视频生成是实现自进化世界模型的关键,通过测试动作后果并反馈知识。
使用视觉基础模型从RGB影像进行洪水制图
微调卫星预训练基础模型,实现RGB影像洪水分割最优性能,并快速迁移适应新洪水事件。
孟加拉人头姿态估计数据集Bengal-HP_RU
首个孟加拉人头姿态数据集,含12894张标注图像,自动流程加手动校正,展现年龄、性别、遮挡等真实多样性。
Sat2City v2:基于单张卫星图像的原生3D城市资产生成
提出Sat2City v2,利用预训练3D基础模型从卫星图像生成纹理网格,在真实数据集上取得最佳性能,并建立首个卫星-网格配对数据集。
几何感知的三维高斯散射风格迁移
提出几何感知3DGS风格迁移框架,通过解耦优化和几何对比特征匹配,同时迁移外观与几何结构,效果显著优于现有方法。
戏剧导演:几何引导的短剧生成
利用真实短剧镜头的深度姿态几何信息,检索参考引导生成,通过强化学习提升忠实度、一致性与可控性。
用于胃肠内窥镜中视觉语言模型幻觉检测的基准
胃肠内窥镜VLM幻觉检测基准中,白盒ReXTrust最优(AUC93.0),非白盒token级灰盒统计最佳。
超越拜耳:面向鲁棒自动驾驶分割的任务最优传感器协同设计
通过可微分RAW-to-task流水线,发现学习2x2 CFA权重可提升分割鲁棒性(mIoU+0.017~0.023),而光学设计与噪声优化效果差或为负。
三效迁移学习用于点云视频
提出PoinTriE框架,通过伪运动轨迹与对偶网络实现数据、参数、内存三效,低标注低内存微调,动作识别与语义分割新SOTA。
差分展开:用于视频快照压缩成像的高效展开重建
提出差分展开框架,以动态演化替代均匀重复,高效重建视频压缩成像,实现精度与效率最优。
面向多视图一致组合式3D生成的包容性交互碰撞方法
提出I2C-3D,采用包容性交互碰撞和多视图自适应蒸馏,实现高质量多视图一致组合式3D生成。
基于分布外评分的零样本测试时规范化
将测试时规范化视为分布外检测,通过评分最小化变换,找到距离评分+随机搜索+局部细化的最优组合,并加入门控保护准确率。
深度学习在3D医学场景补全中的应用:从几何建模到生成范式
综述2016-2026年3D场景补全从体素语义到生成式高斯泼溅渲染的范式演进与挑战。
扩散模型反学习中的共现关联保留概念
提出CARE分数量化共现概念保留,设计ReCARE框架在擦除目标时保护它们,实现稳定反学习。
面向多模态大语言模型的长视频快速有效理解:自适应准高斯采样方法
提出AdaQ自适应准高斯采样法,基于3-σ规则动态优化帧选择,仅需64帧即可超越GPT4o,高效鲁棒。
使用先验校正的令牌缩减加速多模态大语言模型
提出先验校正令牌缩减法,分离任务条件注意力与模型先验,提升加速时的准确率与效率平衡。
基于扩散解耦的双分支交叉投影去偏
无组标签下用CBCM识别语义偏差,DCD双分支解耦投影去偏,达最差组准确率SOTA,仅调0.22%参数。
多模态大语言模型中的频谱演化引导令牌剪枝
提出跨层频谱演化(CLSE)剪枝框架,无需训练,通过频域令牌演化衡量重要性,减少冗余,加速模型并保持性能。
从开阔水域到封闭舱室:面向海上感知与舱室巡检的跨场景视觉位置识别方法ProteusVPR
ProteusVPR双阶段检索细化框架,融合几何视觉估计,跨场景定位误差平均降低60%以上。
MorVess: 形态感知的肺血管分割网络
MorVess形态感知网络融合可微几何先验与大模型,通过多任务联合预测,精细分割肺血管,提升小血管恢复与拓扑连通性。
3DCarGen:基于3D一致多视图合成的可扩展三维汽车生成
提出3DCarGen,通过多视图扩散和颜色-法线优化,合成任意视角一致图像,实现高保真单视图3D汽车重建。
Geometry-Instructed Video Editing
FiCA:单张肖像图像的前馈即时高斯编解码虚拟化身
FiCA前馈生成逼真3D高斯化身,结合视觉基础模型与扩散模型,从单张图像实现无优化实时驱动。
M^2C-EvDet: 事件驱动目标检测的多域多阶跨模态知识蒸馏
提出M^2C-EvDet框架,利用频率学习和超图计算,通过自适应频率解耦与多阶关系蒸馏缩小事件与帧数据的跨模态差距。
图灵ViT:让顶尖视觉Transformer人人可用
TuringViT通过线性注意力、数据策展和动态分辨率预训练,仅用10%数据超越开源ViT,大幅降低SOTA ViT成本,实现人人可用。
社会结构在3D人-人交互生成中的关键作用
针对文本驱动3D人际交互,提出“LLM规划+运动执行”框架,先推断交互阶段与角色,再生成协调双人运动。