塑造NeRF几何:基于人类偏好的3D感知人脸GAN微调
通过人类偏好强化学习直接优化NeRF密度场,无需网格,少量样本即可提升3D几何,用户偏好率达74.4%。
ViQ:任意分辨率下的文本对齐视觉量化表示
ViQ通过两阶段量化学习平衡语义与细节,支持任意分辨率输入,训练效率提升20%-70%。
OctoSense:多模态机器人感知的自监督学习
提出多模态传感器平台及59小时数据集,采用晚融合掩码自编码器实现快速鲁棒自监督学习,优于图像基础模型。
低成本无键盘交互
提出仅用摄像头和打印键盘的虚拟键盘系统,通过指甲颜色检测按键,成本低且实用。
DnA:面向视觉任务的去噪注意力
提出DnA去噪注意力,通过正负查询分离子空间抑制噪声,在ImageNet-1K提升0.8%,视频任务也有提升。
在自进化大型多模态模型中更加关注视觉标记
提出VISE框架,用不变性奖励正则化视觉条件,解决视觉欠条件问题,显著提升多模态任务性能。
为量子机器学习定制嵌入
提出变分自编码器框架,将高维数据压缩为13量子比特嵌入,在MNIST上达98.5%准确率,量子硬件中稳定重建。
询问、求解、生成:通过自一致性奖励实现自我进化的统一多模态理解与生成
提出自我进化框架,通过自一致性奖励协调提问-求解-生成三角色,无需人工标注,显著提升多模态理解与生成性能。
TaskNPoint:如何在几分钟内教会你的人形机器人打反手球
通过教练示范和关键窗口训练,利用模拟环境快速学习动态技能,无需奖励调整,零样本泛化。
利用3D高斯溅射对MRI进行新视角渲染
通过3D高斯溅射从稀疏各向异性MRI重建体积并重采样至最佳解剖平面,提升脊柱狭窄分级的准确性。
揭示深度学习乳腺癌风险模型中的乳腺摄影表型
通过聚类Mirai模型补丁嵌入,识别与五年乳腺癌风险相关的反复出现的乳腺摄影表型,揭示临床特征和潜在模型混杂因素。
WatchAct: 行为驱动的机器人操作基准测试
WatchAct基准用3000个实例评估机器人基于人类行为推理与操作能力,当前最优成功率为16.3%(模拟)和14.0%(真实)。
DanceDuo:人类动作与AI编舞的桥梁
DanceDuo利用扩散模型生成音乐同步舞蹈,集成姿态估计支持用户视频对比,提供直观舞蹈练习体验。
MLFFM-SegDiff:一种用于皮肤病变分割的多层次特征融合扩散模型
提出MLFFM-SegDiff扩散模型,通过双路径编码器与多层次特征融合提升皮肤病变分割精度,Jaccard达0.8546,Dice达0.9207。
世界动作模型通过循环生成回放实现持续模仿学习
提出REGEN框架,利用世界动作模型生成伪回放轨迹,使机器人持续学习新任务,遗忘减少50%。
双重先验引导的零空间学习结合混合样条用于任意医学切片超分辨率
提出DP-NSL框架,利用测量一致性投影和混合样条几何连续性先验,实现任意切片超分辨率并严格保持原始数据,性能领先。
PressMimic:基于压力引导的人形机器人运动模仿与控制系统
提出PressMimic框架,利用压力统一感知与控制,提升人形机器人动作模仿的物理一致性和稳定性。
序数神经坍缩作为视觉导航的表征先验
ORION利用导航动作序数关系组织表征,抑制类内方差,融入扩散框架,显著提升复杂场景导航成功率。
使用结构化阶段与关键帧监督改进视觉-语言-动作模型微调
提出StaKe框架,通过阶段分类与关键帧预测提供结构化辅助监督,使VLA模型微调在长程操作中成功率提升14%-56%。
单色制造中生成3D资产的外观保持细化
GenMF将纹理转为几何阴影,平衡外观与制造鲁棒性,显著提升单色制造细节保真度并降低应力集中。
Neural Texture Compression using Hypernetworks
从名人到任何人:刻画4chan上AI脱衣内容、技术与社区动态
AI脱衣目标转向普通人占55.8%,开源模型主导,少数生产者驱动技术扩散。
基于提议条件的潜在扩散闭环交通场景生成
本文提出基于提议条件的潜扩散场景生成框架,通过紧凑动作潜表示和提议初始化提升效率,实现真实感、安全性与可控性的平衡。
通过扩散驱动选择实现一致且高效的数据集蒸馏
提出基于扩散模型的图像块选择方法,利用损失差异识别判别区域并保证多样性,实现一步蒸馏,性能领先。
六指单肾:自然对抗性医学图像揭示视觉语言模型关键缺陷
提出罕见解剖变异基准,发现VLM性能从71%骤降至28%,揭示其泛化至罕见病例的严重缺陷。
现实世界中AI生成图像检测器的对抗鲁棒性
现实条件下AI图像检测器易被对抗样本欺骗,攻击无需内部知识,上传后仍有效,商业工具也脆弱;鲁棒预训练模型可提升但性能不足。
圆形拟共形去湍流:基于几何的多帧湍流图像恢复
提出圆形拟共形去湍流框架,利用几何约束和循环一致性从多帧湍流图像无监督恢复无失真图像。
TF-TI2I:基于多模态隐式上下文学习的免训练图文到图像生成
提出免训练方法TF-TI2I,利用隐式上下文学习和选择性掩码处理复杂多图指令,并引入新基准。
透过窥镜:弱监督少样本分割的双重视角
提出同源异构网络,双重视角增强互补性,以少量参数超越全监督模型。
重构对齐提升统一多模态模型
提出RECA方法,利用视觉编码器嵌入作为密集文本提示,通过自监督重构损失对齐理解与生成,高效提升图像生成与编辑性能。
EndoUFM:利用基础模型进行内窥镜图像单目深度估计
EndoUFM创新利用双重基础模型,通过自适应微调和掩码引导损失,在多个数据集上达SOTA,提升内窥镜深度估计性能。
TinySR:面向真实图像超分辨率的扩散模型剪枝
TinySR通过动态剪枝与VAE压缩,加速5.68倍、参数量减少83%,实现实时高质量超分辨率。
UniFlow:面向自动驾驶车辆的零样本激光雷达场景流
UniFlow跨数据集训练实现零样本泛化,在Waymo和nuScenes上分别提升5.1%和35.2%,在未见数据集上提升超30%。
FreeStory:无需训练的面向自由形式视觉叙事的角色一致性方法
无需训练的实体特征复用方法,实现自由形式视觉叙事中的角色一致性,性能领先。
反射式VLA:行动后果的上下文使VLA实现泛化
提出反射式VLA,利用观察-行动-后果三元组上下文,通过共享注意力与并行训练,在分布偏移下提升泛化性能。
Chorus II:跨请求稀疏性复用实现高效图像到视频生成
提出稀疏复用框架,利用相似请求的稀疏注意力模式复用历史掩码,避免在线预测,加速2.16倍且保持生成质量。
曲率引导混合用于多模态大语言模型适配
提出CGM框架,利用曲率信息推导最优混合比,平衡专化与通用能力,优于现有方法。
Wan-Streamer v0.1:端到端实时交互基础模型
端到端流式多模态交互基础模型,实现音视频全双工通信,模型延迟约200ms,总延迟约550ms。
噪声感知的边界增强生成式超声斑点降噪方法
提出噪声感知边界增强生成学习框架,自适应调制噪声水平,在降噪与结构保留上优于现有方法。
我们到了吗?探索多模态大语言模型在辅助AI应用中的能力
评估MLLM在辅助AI中的物体识别、场景文本问答和多语言阅读能力,揭示其优势与局限。
SEMIR: 用于薄结构分割的拓扑保持图子式
提出SEMIR框架,用图子式保持薄结构连通性,压缩像素为超节点,GNN分类,碎片化减少超4.6倍,性能优于专业基线。
通过学习低损失子空间的神经网络量化
利用低损失子空间的中点直接量化,性能堪比量化感知训练,且无需直通估计器与显式离散化。
Yuvion VL:面向对抗性内容与人工智能安全的多模态基础模型
Yuvion VL系列多模态大语言模型专攻内容与AI安全,通过对抗鲁棒性设计和对比微调,在安全任务上达到业界领先水平。
MRI2Rep:面向3D肝脏MRI的自回归结构化报告生成
提出自回归框架MRI2Rep,实现3D肝脏MRI结构化报告生成,病例级灵敏度76%,病灶级F1 29.4%,医生认可度70-75%。
基于笼形几何滤波的纹理迁移
提出基于笼形几何滤波的纹理迁移方法,高效抑制伪影,移动设备上仅需约70ms。
MJEPA:一种简单且可扩展的联合嵌入预测架构,用于音频-视觉学习
提出MJEPA,用单一编码器和单一预测目标实现音频-视觉跨模态学习,通过跨模态预测互益提升性能,超越先前方法。
CoGeoAD: 层次化颜色-几何融合与多视图注意力用于零样本3D异常检测
提出CoGeoAD框架,融合颜色几何特征与多视图注意力,实现零样本3D异常检测,性能领先。
三维潜在扩散中的跨模态结构引导实现鲁棒FLAIR超分辨率
提出MR-DiffuSR,用HR T1w跨模态结构引导与混合尺度退化,防止解剖幻觉,在ADNI-4上PSNR 32.46dB,分割Dice达0.63。
Pre-Warm:面向卷积神经网络的输入条件化权重初始化
提出Pre-Warm零成本初始化方法:聚类训练batch局部块初始化一半卷积核,在五个基准上准确率显著提升(p<0.05)。
结构化稀疏性:块稀疏特征提取器捕获视觉概念流形
块稀疏特征提取器将视觉概念建模为低维流形(2-4维),更紧凑且可解释,用于解析曲线、阴影及控制图像生成。