基于测地线点云补丁的对比学习用于三维几何局部对称检测
利用对比学习与测地线补丁,无标注检测三维几何多实例局部对称
视觉扩散模型中的复制现象:综述与展望
首篇全面综述视觉扩散模型复制现象,系统分类揭示、理解与缓解,并探讨现实影响及未来方向。
RS-Agent:通过智能体自动化遥感任务
提出RS-Agent智能体,通过任务规划与工具编排自动化遥感任务,性能超95%准确率。
调谐反向蒸馏:利用跨模态调谐器增强多模态工业异常检测
提出TRD多分支方法及交叉模态调谐器,实现多模态工业异常检测与定位SOTA性能。
NumGrad-Pull: 数值梯度引导的三平面表示用于点云表面重建
提出NumGrad-Pull方法,以三平面表示加速学习,用数值梯度替代解析梯度,结合渐进扩展与采样策略,提升点云表面重建精度与细节。
Freqformer:基于有效频率分解的图像去摩尔纹Transformer
Freqformer通过频率分解分离纹理与颜色失真,双分支架构与非对称训练,结合可学习频率融合和空间通道注意力,实现紧凑高效的去摩尔纹。
一种用于多模态遥感分类的空间-光谱-频率交互网络
提出S^2Fin网络,通过高频稀疏增强和双级空间-频率融合,实现多模态遥感分类最优性能。
ZeroBench:当代大型多模态模型的“不可能”视觉基准
ZeroBench是对抗过滤构建的轻量视觉推理基准,初始前沿模型得分为0%,一年后最高仅6% pass^5,极具挑战性。
社交3D场景图:面向交互服务机器人的人体动作与关系建模
提出社交3D场景图,建模人与环境的交互关系,提升机器人社会智能。
基于信息锚定引导的视觉自回归采样再思考
IGG通过注意力动态加权锚定引导至语义重要token,解决AR模型信息不一致,生成更清晰连贯的图像。
SAGE:空间-视觉自适应图探索用于高效视觉地点识别
SAGE通过空间-视觉图联合优化特征聚合与难例挖掘,冻结DINOv2骨干在8个基准达SOTA,SPED上Recall@10达100%。
FUSE: A Flow-based Mapping Between Shapes
RL-AWB:低光夜间场景下自动白平衡校正的深度强化学习
提出结合统计方法与深度强化学习的夜间白平衡框架,无需真实光照,在低光和良好照明图像上均具强泛化能力。
VisCoP:面向视觉语言模型视频域自适应的视觉探测方法
VisCoP用轻量级视觉探头学习域特定表示,实现视觉语言模型高效域自适应且避免灾难性遗忘,性能超越现有方法。
SWITCH:在长时程具身场景中对有形界面的建模与处理进行基准测试
SWITCH基准测试1170个视频,评估闭环交互推理,发现模型在视觉时间感知与错误恢复上的弱点。
细粒度退化引导的顺序推理用于压缩视频盲质量增强
提出细粒度退化引导与自适应顺序推理,显著提升盲增强效果,PSNR提高0.34dB,推理时间减半。
Pro-Pose: 基于规范UV图的非配对全身肖像合成
利用规范UV图和非配对数据,将日常照片转化为可控高保真虚拟形象,解耦姿态与外观,微调保留身份。
FIELDS: 利用直接监督学习实现精确表情推断的人脸重建
FIELDS采用混合2D/3D监督与几何约束,提升表情识别情感预测精度,兼顾几何保真度。
MorphGS: 形态自适应的视频铰接3D运动迁移方法
MorphGS通过图像监督直接优化目标形态和姿态,实现视频中铰接3D运动的高效迁移。
模型是否学习得足够?通过子集选择的反事实增强进行归因引导训练
提出SS-CA策略,掩盖决策区域构造反事实样本引导鲁棒训练,显著提升模型准确率和泛化性。
面向稀疏视图神经重建的可靠性感知单目深度监督
研究稀疏视图神经重建中单目深度监督,通过光度掩模选择性应用,发现对Splatfacto有效,但需适度加权。
扩散模型中的注意力动态:一个用于人机协作的可视化分析框架
提出可视化框架探索扩散模型注意力动态,整合定量度量与阶段识别,揭示生成模式,促进人机协作。
糖尿病足溃疡分割模型能否泛化?CNN与Transformer架构的跨数据集基准测试
跨数据集测试表明,Transformer架构比CNN泛化更优,且架构族比模型复杂度更重要。
需要多少标签?跨栖息地海洋物种识别的决策框架
DINOv2加线性分类器,每物种仅需10-20张标签即可实现跨栖息地海洋物种可靠识别,大幅降低标注工作量。
面向城市形态间无缝行人级风预测的修复U-Net
提出两阶段U-Net框架,以修复边界不连续,高效预测城市行人级平均风速,效果良好但峰值低估。
基于学习先验的熵编码MS-VQ-VAE用于超低比特率视频压缩
离散编码结合学习先验,实现0.043-0.064 bpp超低比特率,性能超H.265。
双螺旋主动几何:基于LiDAR锚定的多视图深度与选择性放弃
提出DH-Active轻量几何后端,以LiDAR近场深度锚定位姿,选择性放弃不良估计,实现CPU毫秒级低误差深度恢复。
DELTAVID:利用跨视频差异增强细粒度时空感知
提出DELTAVID框架,通过跨视频差异训练,增强细粒度时空感知,在多个视频理解基准上显著提升。
杂乱环境下刀片插入的三维可操作空间学习
VulcanVoxel用3D占据场重建刀片占据,实现杂乱收纳中多模态预测,覆盖率0.89,远超基于姿态的基线。
可解释机器学习利用运动校正QSM MRI和多波段多回波fMRI特征预测帕金森病严重程度
结合QSM和fMRI特征,可解释机器学习预测帕金森病运动严重度,解释45.4%方差,75%预测误差±5分内。
双自适应SAM3:低秩专家层的层级路由实现参数高效医学图像分割
双自适应SAM3通过动态路由与低秩专家层,以80%参数减少实现最优医学图像分割。
从原始分割到仿真就绪的心脏网格:解剖重建与虚拟队列生成的自动化框架
提出半自动流水线,将CT分割快速转化为拓扑一致的高质量心脏网格,基于58例数据构建统计形状模型,用于虚拟队列生成。
评估生成图像模型的知识产权护栏:一份技术报告
提出基准与自动化评估流程,测试14种图像模型的知识产权护栏。私有模型拒绝频率各异,商业标志生成率最高,所有模型仍可生成可识别IP。
MAGE: 视图引导的点云补全与高效模态对齐及自适应几何增强
提出统一几何感知框架,通过高效模态对齐与自适应几何增强,解决跨模态几何不一致,显著提升点云补全性能。
坐标奇异性破坏注视和头部姿态的共形覆盖
坐标奇异性导致共形预测覆盖崩溃,无坐标测地评分可消除扭曲。
面向数据集偏移下可转诊糖尿病视网膜病变筛查的RETFound不确定性感知最后一层适应
不确定性感知最后一层适应可提升DR筛查安全操作点,但可信赖需安全覆盖评估与偏移验证。
加性因果构建:多源图像融合中可迁移与可重构的跨系统学习
提出加性因果构建框架,通过因果锚点与不确定性建模实现跨系统可迁移与可重构学习,显著提升多源图像融合的分布外泛化。
标准条件上下文学习:评估视觉语言模型中的标准偏移适应能力
提出标准条件上下文学习(CC-ICL),构建多领域基准测试发现模型存在刚性边界偏差,多标准训练可显著提升适应性。
基于YOLO的课堂行为监测:高等教育环境下的实证研究
YOLOv11监测课堂行为发现学生注意力后期下降,验证了计算机视觉在教学质量管理的可行性。
对称结构化的神经补全:从稀疏控制几何完成伊斯兰几何图案
嵌入对称规则的神经补全,利用旋转轨道约束保证精确对称和有效性,从稀疏控制几何完成伊斯兰图案。
旋转注意力:面向视频生成中INT4量化注意力的RoPE感知旋转与范围修正
提出RotateAttention,通过RoPE感知旋转和范围优化量化,实现视频生成中INT4注意力加速,性能近无损,端到端加速1.68倍。
CPR:链式感知细化用于由粗到精的医学图像分类
CPR框架通过粗到精的链式感知细化,在恒定内存下提升诊断精度,计算量降低达19.6倍。
Homer:利用分层记忆与智能体推理理解长视频
Homer通过分层记忆与智能体推理,实现长视频在线理解,在多个基准上大幅超越现有方法。
可靠性感知的CT-MRI配准:含稳定性分析与风险分类的质量工程框架
提出可靠性框架,用阈值将CT-MRI配准质量分为绿/黄/红,仿射优于刚性,Dice为主,实现可解释质量控制。
H-OPD:置信度感知的异构多教师多模态在策略蒸馏
H-OPD通过token级仲裁动态结合视觉-语言与纯文本教师,提升多模态推理性能。
一种基于深度学习网络损失函数序列的自动识别错误标注图像的方法
利用损失函数序列自动识别错误标注图像,提升数据集质量与模型性能,实验验证有效。
CV-DCLR:因果视觉动态标签精炼实现鲁棒零样本学习
提出因果视觉动态标签精炼框架,通过双流互校正与自适应门控解耦语义纠缠,提升零样本学习鲁棒性。
令牌级响应-视觉注意力引导用于多模态大语言模型知识蒸馏
揭示响应-视觉注意力对蒸馏关键,提出令牌级注意力引导TRAG自适应加权KL散度,显著提升性能。
CIPHER:医疗公平性与鲁棒性的因果干预路径
提出多路径因果干预框架CIPHER,利用扩散模型减少敏感属性差异,降幅达35.8%,提升诊断公平与准确率。
评估自主计算病理学的智能框架系统
ACP-Bench评估自主计算病理学智能框架,发现工作流启动与诊断报告成熟,但工具执行和端到端完成仍不足。