AerialClaw:面向LLM驱动自主空中代理的开源框架
提出AerialClaw开源框架,使无人机作为LLM驱动的决策代理,实现任务理解、技能执行与闭环适应。
DAM-VLA: 解耦异步多模态视觉-语言-动作模型
DAM-VLA解耦多模态时序,各模态按传感器速率异步更新与读取,7个操作任务成功率95.2%,远超同步模型40.95%,实现100Hz平滑控制。
BiWM:利用双向自回归推进开源交互式视频世界模型
BiWM是首个双向自回归交互式视频世界模型全栈框架,两阶段训练,支持多模型,实现高质量长程滚动与相机控制。
SpineReport:腰椎退行性变的MRI自动三维量化与报告
开源全自动3D量化腰椎MRI退变,提取形态信号指标,生成对比报告,与中央管狭窄临床分级强关联(AUC=0.95)。
WHU-Infra3D:面向3D路边基础设施普查的全栈多模态数据集与基准
提出WHU-Infra3D多模态数据集,覆盖53.8km,含18万+属性标注,用于路边基础设施普查与健康评估,揭示跨城市域差。
公开医学视觉语言基准中预训练污染的控制性审计
审计医学视觉模型发现图像有来源重叠,文本有交换性信号,但某些检测器在小组中不可靠。
面向野外帕金森病视频分类的可解释时序面部区域运动分析
使用归一化面部区域速度描述符与随机森林,在YouTubePD基准上达0.826平衡准确率与0.855 AUROC,方法轻量可解释。
最大匹配精度:基于全局最优匹配的实例分割评估指标
提出最大匹配精度(MMA),通过全局最优匹配和逐像素归一化,解决评分不连续、扭曲和次优匹配问题,实现更稳定、灵敏、可解释的评估。
ABot-Earth 0.5:生成式三维地球模型
基于卫星图像,10分钟/平方公里合成逼真3D场景,支持实时交互,降低大规模重建门槛。
SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation
广义CVO:基于二阶黎曼优化的快速无对应局部点云配准
提出基于RKHS和二阶黎曼优化的无对应点云配准方法,速度提升10倍,漂移降低超55%。
使用预测不确定性增强模型改进基于PET/CT的全身病灶分割
提出不确定性感知框架,结合贝叶斯集成与不确定性训练,提升PET/CT病灶分割鲁棒性与检测率,首次系统研究不确定性量化。
FlexPath:基于图像规划的学习语义路径先验
FlexPath两阶段框架解耦可行性与偏好,通过可微路径形状目标适应多任务,减少搜索努力并实现零样本泛化。
解剖与剪枝:增强AI生成图像检测的鲁棒性
提出DEAR方法,通过剪枝干扰特征,增强对AI生成图像的检测鲁棒性,缓解预测不对称。
iSAGE:一种通过稀疏点监督实现遥感语义分割的人机协同框架
iSAGE仅需专家点击模型错误像素,无需辅助机制,以极少标注达到密集监督性能,是唯一迭代式人机协同框架。
融合卫星图像与平面地图的跨视角定位
提出跨模态条件化与补丁级融合规则,融合卫星图与平面地图,定位误差降低30.13%。
DB-3DME:从数据集到基准——面向人类对齐的自动3D网格评估
构建2619个合成3D网格数据集,微调VLM模型实现人类对齐评估,性能显著超越现有方法。
基于Fisher引导的自适应微调中的渐进参数选择
提出FisherAdapTune,利用Fisher几何漂移动态选择参数,提升下游分割任务性能。
大规模开源图像与视频数据集用于稳健野火检测与分类
提出GWFP大规模开源数据集,涵盖多样野火场景与负样本,评估多种模型,展示强跨域泛化能力,助力实际野火监测。
在视频扩散Transformer中实现时间可编辑
提出轻量时间模块扩展预训练DiT,保留原始先验,实现运动速度与时间结构编辑。
改进的生成对抗网络用于微电阻率成像测井恢复
提出改进GAN修复微电阻率成像测井图像,多尺度特征与注意力结合,结构相似性达0.903。
FoA-SR: 忠实还是美观?画像感知偏好优化的真实世界图像超分辨率
提出FoA-SR方法,通过画像感知偏好优化和LoRA微调,分别实现忠实与美观两种超分辨率目标,有效提升对应指标。
内容引导的空间-光谱聚合网络用于遥感图像变化检测
CSI-Net通过内容引导的空间推理和光谱差异模块融合全局信息,抑制未变化区域差异,性能优于现有方法。
ClinReadNet:受临床阅读启发的低剂量腹部CT图像质量评估网络
提出ClinReadNet,模拟医生阅片习惯,通过SOQN与(S)W-MTMSA模块及HRPS损失函数,在低剂量腹部CT图像质量评估中达SOTA性能。
视觉辅助的基础模型用于解决多任务车辆路径问题
提出视觉辅助基础模型VaFM,融合图像与图信息,解决多任务VRP,性能优于现有方法。
基于无人机多光谱影像的多角度反射率各向异性观测
提出多角度观测提取方法,分析BRDF效应,草地十波段反射率各向异性显著,红边和近红外波段变化达119-137%。
地震中的建筑物变化检测:一种多尺度交互网络与变化检测数据集
针对地震后短间隔变化检测,创建TUE-CD数据集并提出MSI-Net网络,有效处理侧视问题,性能优于现有方法。
FSS-Net:基于小波注意力的频域-空间域协同网络用于颈动脉超声分割
提出FSS-Net,融合小波注意力与频空协同,颈动脉超声分割Dice达96.46%,鲁棒性强,具临床潜力。
PF-Trans:物理嵌入的频率感知Transformer用于光谱重建
提出物理嵌入频率感知Transformer,通过双域块抑制混叠伪影,实现高保真光谱重建,PSNR达48.50dB。
用于3D打印火星地形模型的立体重建基准测试
火星地形重建中,标准方法可生成可打印近似,但基准精度不直接迁移,需领域特定验证。
基于RWKV的高效三维点云表示学习
提出P-RWKV模块,通过局部感知扩展与空间上下文增强,高效建模点云全局依赖,实现低延迟高性能。
CoCoSI:面向空间智能的协作式认知地图构建
提出无训练多智能体框架,协作构建认知地图,无需修改模型即可增强空间理解,性能优异。
使用视觉语言模型进行几何海岸线定位
提出几何海岸线定位方法,基于视觉语言模型直接预测折线,降低豪斯多夫距离和地球移动距离。
PrismAvatar:面向实时立体通信的伪多视图重建与亚像素棱镜渲染
PrismAvatar用单目视频重建头部高斯模型,通过伪多视图监督优化,实现裸眼3D实时立体通信,渲染32视图达38.49FPS。
3D-CoS:基于VLM代码合成的新3D重建范式
提出3D-CoS范式,用可执行代码表示3D资产,实现强可控性和高保真局部编辑。
5% > 100%:平坦偏好是多模态参数高效微调的全部所需
发现PEFT中平坦偏好,少量尖锐维度主导泛化,提出FlatPO平坦化关键维度以增强泛化。
少步生成模型作为有损压缩
将少步生成模型融入反向信道编码框架,实现有损压缩,减少编解码时间,提升低比特率真实感。
LAFP:通过流匹配在潜在策略学习中保持潜在动作结构
提出LAFP,利用流匹配和推理插值机制,解决潜在动作结构退化问题,模仿任务成功率提升10-15%。
PathRelax: 并行路径松弛推测雅可比解码加速自回归文本到图像生成
提出并行路径松弛推测雅可比解码框架,通过多序列树扩展搜索和交叉路径松弛验证,实现4倍加速且不损图像质量。
GUI-AC: 增强GUI代理的持续学习能力
提出GUI-AC方法,通过自适应优势与动态裁剪机制增强GUI代理的持续学习,超越现有基线。
面向高效音视频描述的视听交换感知令牌剪枝
提出强化学习动态剪枝,通过视听令牌交换选出高价值令牌,仅保留40%仍保持原质量。
GRAR:LiDAR点云中玻璃反射伪影去除
提出两阶段框架,先精确检测玻璃区域,再用反射几何描述符RE-LGGS去除伪影,性能优于现有方法。
通过替代模型特定偏差校正提高视觉语言预训练模型的对抗迁移性
提出DeBias-Attack,通过梯度校正去除替代模型偏差,提升对抗样本迁移性。
分段与选择:三维场景中的视觉-语言分割
提出SEGA3D范式,直接操作细粒度信息,结合LLM与选择器提升3D分割质量,在ScanNet和Matterport3D上分别超对手8.3和5.3 mIoU。
快手Keye-VL-2.0技术报告
快手开源Keye-VL-2.0 MoE多模态模型,支持256K无损上下文,在长视频与智能体任务达SOTA。
图像模型能否想象时间?ImageTime:基于时空一致性探测视觉世界建模的新基准
ImageTime基准通过四关键帧协议测试图像模型对时间过程的连贯想象,揭示其在视觉世界建模中的成功与失败。
GaussTrace:基于证据的大语言模型推理的3D高斯泼溅模型溯源分析
GaussTrace通过属性统计与编辑模拟,驱动LLM推理构建3DGS模型有向溯源图,准确可解释且无需训练或编辑历史。
SSR-Merge: 扩散模型中免训练LoRA合并的子空间信号路由
SSR通过子空间信号路由解决LoRA合并参数干扰,免训练且数学最优,性能显著提升。
基于图对齐的月球车像素级全局定位
WARG通过图对齐实现月球车像素级全局定位,真实数据误差1.68米(接近1像素),参数仅1.56M,轻量高效。
ChartLens:用于图表数据校正与事实性摘要优化的双分支框架
ChartLens双分支框架通过数据校正与摘要优化,提升图表理解准确性,获竞赛第一。