通过可微分联合推理与能量一致性验证从RGB-D序列合成URDF
KinemaForge管道联合推断部件形状与关节参数,经能量验证,降低关节轴误差37%、仿真漂移64%。
中文标题:连接单一失真伪影与多因素临床质量:基于失真训练的原型网络的少样本双参数MRI质量评估
中文摘要:提出少样本双参数原型网络,仅用失真标签元训练,5个样本即可预测多因素临床质量评分,数据高效。
Visual-OPSD:跨模态在线策略自蒸馏实现高效统一多模态推理
Visual-OPSD通过在线策略自蒸馏,将多模态推理转移给纯文本学生,速度提升14.3倍,性能提升3.40个百分点。
BindEdit:驯服注意力泄露实现精准多对象图像编辑
BindEdit通过抑制两种注意力泄露,在单次扩散中实现精准多对象图像编辑,性能优于现有方法。
拉丁与阿拉伯文字手写文本识别的性能差距分析
拉丁与阿拉伯文字HTR存在5-7 CER差距,源于阿拉伯文视觉变异性高、字符分布重尾及混淆错误率(30% vs 15%)。
LARE: Low-Attention Region Encoding for Text-Image Retrieval
DINO-Med3D:通过渐进适应弥合体积分割中的维度与领域差距
提出DINO-Med3D框架,用多切片嵌入、3D适配器和细节恢复流,将DINOv3适应3D医学分割,性能领先。
SP-TransientBench:一个真实捕获的单光子感知基准
首次提出真实捕获单光子感知多任务基准STB,含10场景10297视角,支持深度估计与3D语义评估。
物理智商验证
改进物理智商基准,提出三种方案解决不足,优化57.6%样本和34.8%提示,更可靠评估视频模型的物理理解。
使用基于最短路径的层区分实现CFRP显微图像的自动逐层分析
提出基于最短路径的自动方法区分CFRP显微图像层实例,实现逐层定量分析微观结构属性。
聚焦运动的潜在动作实现从人类第一人称视频进行跨具身VLA训练
从无标签人类视频提取动作先验,通过解耦VQ-VAE和意图感知解耦,仅需50条轨迹即可高效适应下游具身。
Mem-World:面向持久机器人操作的记忆增强行动条件世界模型
提出Mem-World记忆增强世界模型,通过4D腕视角表面元记忆实现持久视频生成,策略评估相关性提升14.5%,长任务成功率从58%提至72%。
ProductConsistency:通过监督微调与强化学习提升指令式图像编辑中的产品身份保持
提出ProductConsistency数据集及循环一致性奖励,通过SFT+RL训练显著提升产品图像编辑的身份保持,字符错误率降低5倍。
PorTEXTO:欧洲葡萄牙语视觉文本提取基准
引入首个当代欧洲葡语视觉文本提取基准,发现专用多语言数据比模型规模更关键。
DREAM:通过双目标编码扩展视觉-语言模型实现跨模态检索
DREAM模型采用双目标语言建模与层次化视觉编码,在三个视频检索基准上R1达49.4%/49.7%/27.3%,创SOTA。
DVANet:面向图像复原的退化感知视觉先验对齐网络
提出DVANet,通过退化感知与视觉先验协同展开,实现复杂退化下的统一图像复原,性能优越。
驯服I2V模型用于图像HOI编辑:一种认知基准与智能自我修正框架
提出HOI-Edit基准和SCPE框架,利用I2V模型动态编辑,通过自我修正提升人-物交互准确性。
AMALIA-VL: 一个原生欧洲葡萄牙语的开源视觉与语言模型
首个欧洲葡萄牙语原生开源多模态模型,三阶段训练构筑强基线,开源资源助力发展。
FlowObject:流引导以弥合生成先验与重建保真度
FlowObject通过双空间引导流匹配和3DGS细化,在稀疏视图3D重建中兼顾生成先验与观测一致性,显著提升几何完整性和保真度。
展示而非询问:具有回合有效覆盖的合成图像检索的生成式视觉消歧
CLARA框架通过展示视觉替代方案让用户选择原型,保持覆盖保证,高效消解视觉模糊。
基于分数阶正则化与Ky Fan p-k范数的低秩张量补全
提出TNPK范数比代理实现低秩张量补全,证明局部最优,设计高效ADMM算法,性能优于现有方法。
大型视觉语言模型在细粒度图像任务上的基准测试:从评估到诊断
提出FG-BMK基准,百万级细粒度图像评估,诊断LVLM视觉表征与语义对齐瓶颈。
Moebius:0.2B轻量级图像修复框架,性能达10B级别
Moebius以仅0.22B参数超越10B级模型修复效果,推理加速超15倍,树立高效高质量修复新标准。
高效遥感视觉问答的统一框架:适配双编码器、混合和编码器-解码器架构
提出RS Adapter参数高效微调方法,应用于三种视觉语言模型,混合FLAVA架构性能最佳,建立资源高效VQA新基线。
Transformer几何观测站 TGO-I:谱几何观测站
TGO-I观测ViT谱几何:训练中维度利用上升、各向异性下降、谱熵上升,方差再分布,CLS token有效维度最高。
当AUC误导时:领域偏移下深度伪造检测器的极化感知评估
提出Cross-AUC指标,结合域AUC和预测极化度量,更真实评估域偏移下深度伪造检测器的泛化能力。
Hand-4DGS:基于前馈3D高斯点绘的自我中心视频4D手部重建
提出前馈框架Hand-4DGS,无需3D标注,从自我中心视频快速重建动态4D手部。
CABLE:面向V2X系统的云辅助带宽高效LMM编码
提出CABLE框架,利用掩码传播和ROI编码,实现73-87%像素减少与5-8倍预填充加速,保持感知性能。
OneCanvas:通过全景重投影实现3D场景理解
OneCanvas将多视角特征聚合到全景画布,无需复杂几何编码器,以极少计算实现最先进的3D场景理解。
ROSA-TFormer: 雷达-光学传感器感知的时间Transformer用于基于GEE的Sentinel-1/2时间序列的陕北樟子松人工林分类
提出ROSA-TFormer,融合雷达-光学时间序列,对陕北樟子松分类达99.67%准确率。
针对GPT-Image-2生成的AI文本丰富图像检测的多领域基准
提出多领域基准检测GPT-Image-2生成文本图像,评估显示检测器性能依赖领域且对JPEG压缩敏感。
GUMP-Net: 一种可解释的模型-数据驱动的多类骨盆分割智能算法
融合测地线活动轮廓与深度学习,小数据下精准鲁棒,为多类骨盆分割提供可解释几何视角。
置信度不等于可靠性:重新思考脑肿瘤分割中的MC Dropout
MC Dropout不确定性估计无法可靠识别临床关键子区域错误,需结合子区域校准评估。
Splaxel:通过像素级通信实现大规模场景重建的3D高斯泼溅高效分布式训练
Splaxel基于像素级局部渲染与全局合成,避免高斯同步,通信成本稳定,实现7.6倍加速。
先看后推理:解耦感知与推理的抗捷径多模态在线策略自蒸馏
ViGOS先视觉描述再推理,解耦感知与推理,避免捷径,提升多模态模型图像基础能力。
SC3-Eval:通过自一致视频生成评估机器人基础模型
SC3-Eval通过三种一致性约束的视频生成,实现机器人策略的准确评估,Pearson相关0.929。
EDoF-NeRF: 使用编码孔径相机的扩展景深神经辐射场
用编码孔径相机扩展NeRF景深,保留空间频率,生成高保真新视图,性能优于传统相机。
A Controlled Benchmark of Quantum-Latent GAN Augmentation for Brain MRI
NeuMesh++:面向多功能高效体编辑的解耦神经网格隐式场
提出解耦网格隐式场,实现几何、纹理、语义编辑,高效多功能。
中文标题:传感器配置至关重要:四足机器人多模态SLAM的系统性评估
中文摘要:评估表明,硬件选择显著影响四足机器人SLAM鲁棒性:立体及全局快门相机更优,标准惯性融合可能降低视觉性能。
超越当前观测:在可控非马尔可夫博弈中评估多模态大语言模型
提出RNG-Bench评估大模型记忆与行动能力,发现主要错误源于遗忘,微调可提升性能。
DART:一种面向实时活细胞图像分析的设计感知微流控芯片范式
DART范式通过CAD蓝图与芯片对齐,实现高通量ROI快速定位与全自动图像处理,支持实时分析。
模仿我:从日常人类视频中获取灵巧操作数据
提出DO AS I DO算法,从单目RGB人类视频重建并重定向到多指灵巧机械手,生成机器人操作数据,优于现有方法。
多单元平面图的识别与重建
提出基于MDA-Unet和MACU-Net的像素分割法,从2D平面图重建3D模型,F1达0.86,优于其他方法。
简单域泛化方法是开放域泛化的强基线
研究表明简单方法CORAL和MMD在开放域泛化中与复杂方法DAML性能相当,扩展后计算成本更低,是强基线。
不完全信息条件下纹理图像重建与分类的神经网络方法研究
提出GAN修复与Transformer分类框架,高重建质量下准确率仅53%,混合集成提至58%,揭示生成模型幻觉问题。
模型中的市场:潜扩散作为神经经济
潜扩散模型作为神经经济,将社会交流抽象为可比较向量,批判版权拜物教,聚焦社会交换。
生物成像中不完整、大规模和稀疏多图匹配的优化
针对生物成像大规模稀疏多图匹配,提出GREEDA方法与新数据集,速度与效果远超现有方法。
透穿遮挡:面向机器人遥操作的确定性手臂运动学校正
提出AKC方法,利用手臂长度几何约束校正遮挡下深度估计,经Vicon验证可靠,成功用于机器人遥操作。
VGGHeads:基于大规模合成数据集的3D多人头部对齐
提出百万级合成数据集VGGHeads及单阶段模型,实现头部检测与3D网格重建,在真实图像上性能优异。