OvAi Focus:基于AI的妇科超声中功能性卵巢和附件肿块的多类分割
OvAi Focus AI实现超声附件肿块和卵巢多类分割,囊性DICE达0.85,性能优。
ToolAnchor:锚定反事实上下文以增强代理工具使用能力
提出ToolAnchor,通过反事实上下文打破工具扩展中的行为惯性,提升代理动态适应能力。
多步视觉推理的分层去噪
HDR框架通过树状分层潜变量实现粗到细推理,显著提升多步视觉推理成功率与效率,推理速度比双向扩散快54倍。
Instant NuRec:面向驾驶场景模拟的前馈式三维高斯重建
单次前馈重建驾驶场景,1.5秒生成可模拟3D世界,PSNR比基线高2.01 dB。
ViPSAM:使用Segment Anything模型的视觉提示医学图像分割
ViPSAM借鉴临床对比增强MRI参考,通过视觉提示编码器和交叉注意力,提升非对比CT肝脏病变分割准确性。
Open-AoE:面向具身学习的开放自我中心操作数据集与工具链
Open-AoE提供约2000小时自我中心操作视频及结构化注释与完整工具链,降低具身学习门槛。
骨架:非视觉数据体验的可视化创作工具
Skeleton通过可视化导航结构,将无障碍设计从合规任务转变为设计问题,提升非视觉数据体验。
SEMA:通过令牌定位与平均实现的可扩展高效Mamba式注意力
提出可扩展高效Mamba式注意力SEMA,利用令牌定位避免分散并维持聚焦,结合算术平均捕捉全局,在ImageNet-1k上超越线性注意力。
Action QFormer: 视觉-语言-动作模型中动作监督下的结构化表征塑造
Action QFormer通过查询接口重组动作表征,零样本导航成功率从18.8%升至56.3%,解决了动作监督的双重效应。
SportD:视觉语言模型能否进行物理策略推理?
VLMs在足球决策中最优动作准确率低于人类,且倾向低风险低回报动作,存在模仿行为。
基于修正流激光雷达上采样的图像到点云配准方法
提出利用条件修正流生成密集LiDAR强度图,与图像匹配实现无对数据的高精度快速配准,误差4.89°/1.63米。
WanSong v1.0 技术报告
WanSong是纯扩散模型,直接生成长达5分钟的多语言歌曲,一次输出人声和伴奏,支持快速推理和下游编辑。
DriftWorld:通过漂移实现快速世界建模
DriftWorld基于漂移模型单步生成未来帧,速度提升17倍,决策性能最优,兼具离线模拟评估能力。
ESAR: 事件驱动的合成孔径重建
提出基于事件相机的合成孔径反问题,正则化恢复静态场景辐射场,抑制细尺度纹理。
利用激光雷达和摄像头输入模拟车载雷达
提出用摄像头和激光雷达模拟4D毫米波雷达信号的方法,两个神经网络生成高保真信号,增强目标检测性能。
通过表示反馈为扩散模型添加条件残差
提出条件残差反馈机制,将聚合特征转为条件嵌入残差,无需外部编码器,提升扩散模型生成性能与表征能力。
LaViDa:一种用于多模态理解的大型扩散语言模型
LaViDa扩散语言模型实现多模态理解,支持并行解码与可控生成,性能媲美自回归模型,并具有灵活速度-质量权衡和双向推理优势。
TokenSwap:针对大型视觉-语言模型组合理解的后门攻击
TokenSwap通过交换文本关键词语法角色,破坏LVLMs对象关系理解,实现高隐蔽性后门攻击。
Sparse-LaViDa:稀疏多模态离散扩散语言模型
提出动态截断掩码令牌的稀疏框架,引入寄存器令牌,加速多模态扩散模型高达2倍,保持生成质量。
DINO-SLAM:基于DINO的RGB-D SLAM,用于神经隐式与显式表示
提出DINO-SLAM,用几何编码器增强DINO特征的几何感知,集成到NeRF和GS SLAM中,性能超越当前最优。
RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
MapAnything:评估单目度量深度模型用于三维城市资产定位
MapAnything利用单目深度估计自动将2D图像转为3D资产坐标,验证了精度与实用性。
GSVisLoc:面向高斯泼溅场景表示的通用视觉定位方法
提出GSVisLoc,利用3D高斯泼溅场景,通过三步特征匹配估计相机位姿,无需再训练,泛化至新场景。
Lavida-O:用于统一多模态理解与生成的弹性大规模掩码扩散模型
Lavida-O统一多模态理解与生成,支持物体定位、图像编辑及高分辨率合成,性能领先且推理加速。
WorldWander:弥合视频生成中的自我视角与外部视角
WorldWander通过上下文学习框架实现自我与外部视角视频的相互转换,具备卓越的视角同步与角色一致性。
中文标题:重新审视视频GRPO中的奖励信号:当分数成为目标
中文摘要:针对GRPO奖励分数失真导致捷径优化和饱和问题,提出TaRoS框架,利用组件评估和组内稀疏性防止奖励黑客,显著提升视觉质量。
归纳瓶颈:视觉Transformer中表示稀疏性的数据驱动涌现
ViT的U形信息压缩是数据依赖的适应,中间层压缩高频以提取语义特征。
C-Norm:细胞分布归一化实现医学细胞图像精准识别
提出C-Norm归一化方法,结合YOLOv12与DINOv3,实现TCT细胞图像精准识别,性能达最优。
可微分偏振光路径追踪
提出可微分偏振光路径追踪,解决反向微分不稳定,实现材料与光照参数的高效优化。
自监督视觉表示学习:预训练-微调还是联合训练?
对比自监督预训练-微调与联合训练,发现联合训练在低标注时更高效,预训练-微调在专业领域更可靠。
一种掩码自编码器方法用于无监督钢表面缺陷识别
基于Transformer掩码自编码器,无监督学习钢表面缺陷表征,聚类准确率91.3%。
Boogu-Image-0.1:提升开源统一多模态理解与生成能力
Boogu-Image-0.1开源多模态模型家族,仅用2.08亿图像和约40万美元成本,实现高性能文生图与编辑,接近闭源系统。
MGFace: 基于条件相似度路由的掩码门控人脸匹配
提出MGFace方法,区分口罩状态选择性匹配,戴口罩时仅重排序可靠上半脸区域,准确率达90%以上,查询时间降低20倍。
基于弱监督的主动学习实现手术视频高效标注
主动学习结合弱监督,迭代优化伪掩码,减少手术视频标注工作量50%。
即时场景图增长:应对长时域机器人感知饱和
JITOMA通过按需激活休眠锚点,避免全图构建,大幅降低延迟和冗余。
AffectFlow-DINO: 基于条件整流流的不确定性感知多任务情感估计
提出AffectFlow-DINO,用条件整流流建模情感歧义,联合估计价-唤醒、表情和动作单元,性能大幅超越挑战基线。
连续演进的深度伪造检测:动态检测系统的架构与公共基准评估
动态对抗训练持续更新检测器,在19个数据集上AUC达0.936,大幅超越静态模型性能下降45-50%的困境。
SARFA:基于放射组学特征对齐的任意分割
通过放射组学特征对齐和候选掩膜排序优化,解决医学图像中模糊目标分割难题,在CT/MRI上超越现有方法。
FOLIO:面向流式视频理解的聚焦语义记忆
提出无训练聚焦语义记忆FOLIO,通过动态聚焦与混合检索实现高效流式视频理解,性能达SOTA并显著降低记忆成本。
DiffGI: 面向高保真薄壳三维生成的可微几何图像
DiffGI以连续TSDF和可微算法实现端到端高保真薄壳3D生成,超紧凑潜空间扩散模型,边界精确且资源需求低。
Audio-Text Cross-Attention with Psycholinguistic Support Features for Ambivalence/Hesitancy Recognition
深入探究统一视频保护在应对图像到视频及微调定制化中的时序挑战
提出TC-UAP方法,首次统一防御图像到视频与微调视频定制,以强鲁棒性实现最优身份保护。
检测器置信度在杂乱操作中指示存在而非遮挡
遮挡下检测器置信度不变或上升,表示类别存在而非目标可见,导致评估偏差,建议采用接地信号。
无标记可变形配准与融合用于增强现实引导的肿瘤切除手术阳性切缘定位
提出无标记AR工作流,将阳性切缘定位误差从21mm降至6.19mm,融合误差2.15mm,在线融合5.23秒。
使用弗雷歇距离损失改进医学图像生成模型
提出弗雷歇距离损失微调模型,增强肿瘤结构捕捉,分割DSC提高超5%。
程序化材质生成中的过程专家经验体现
将专家工作流转化为文本过程轨迹,结合LLM合成与编译,提升材质生成与编辑效果。
无根据的准确性:视频大语言模型基准测试中视觉依赖分离的诊断
提出VDG指标揭示视频LLM基准准确率与视觉理解能力可分离,帧多样性贡献大而时序信息影响小。
AnomExpert:产前超声异常诊断中的解剖平面识别与选择
AnomExpert通过可学习平面原型和疾病感知选择机制,在弱监督下实现产前超声异常诊断,准确率达86.9%。
RoughNet:基于扩散超分辨率的北极海冰粗糙度卫星图像映射
利用扩散模型从卫星图像重建海冰粗糙度,跨区域泛化误差9厘米,实现可扩展的高分辨率制图。
TreeSRNF:用于树状三维物体几何与结构变异性生成建模的平方根法向量场
提出基于平方根法向量场的黎曼树形空间,建模树状3D物体的几何与结构变异性,实现统计分析与生成,性能领先。