参考驱动的多说话人音频场景生成:基于野外先验
ScenA利用野外预训练模型,通过参考声音和自然语言提示生成多说话人音频场景,用高噪声偏置解决参考捷径问题,提升说话人绑定性能。
对极几何改进视频生成模型
利用对极几何约束偏好优化,视频生成一致性提升,误差降31%,人类评分从54%升至72%。
VidCRAFT3:图像到视频生成中的相机、物体与光照控制
VidCRAFT3统一控制相机、物体运动与光照方向,通过显式3D先验和交互建模实现高保真视频生成。
Beyond Nearest Neighbor Interpolation in Data Augmentation
重新审视主动说话人检测:一个面向泛化性和鲁棒性的野外基准
提出UniTalk数据集覆盖真实挑战场景,评估显示现有模型泛化不足,成为主动说话人检测新基准。
超越线性可分性上限:对齐视觉语言模型中的表示
提出诊断框架发现VLM对齐差距,通过对比学习重构视觉几何,超越线性可分性上限。
刺激运动感知研究暗示人类视觉稳定中的特定神经计算
实验揭示人类视觉稳定依赖视网膜信号特定神经计算,机制比预期精细。
面向3D CT扫描多标签异常分析的结构化谱图表示学习
提出2.5D图框架,用谱图卷积处理轴向切片三元组,跨数据集泛化强,性能媲美顶尖视觉编码器。
当汽车也有刻板印象:审计文本到图像模型中物体的群体偏见
引入SODA框架,发现中性提示默认输出偏向中年白人,群体提示产生高度刻板输出(如女生用玫瑰金笔记本),去偏牺牲组内多样性。
S3OD:基于合成数据的可泛化显著物体检测
利用合成数据训练的S3OD模型,跨数据集泛化误差降低20-50%,微调达SOTA。
SuperCarver:纹理一致的3D几何超分辨率实现高保真表面细节生成
提出SuperCarver,通过多视角渲染与先验扩散模型,为粗网格补充纹理一致的表面细节,实现高保真几何超分辨率。
使用多尺度隐式结构相似度的点云客观质量评估
提出MS-ISSM,用径向基函数连续化局部特征,避免匹配误差;结合ResGrouped-MLP多尺度映射差异,性能优于现有指标。
语义路由器:通过单一对抗性扰动劫持多模态大语言模型的可行性研究
提出SAUP作为语义路由器,通过单一扰动同时劫持多模态大语言模型决策,实验证实可行。
端到端自动驾驶中的零样本跨城市泛化:自监督与监督表示对比
研究发现自监督预训练相比监督方法能显著减少跨城市规划退化,提升端到端自动驾驶的泛化鲁棒性。
利用潜在流匹配学习患者特异性疾病动态以生成纵向影像
Δ-LFM利用流匹配和患者特异性潜在对齐,生成连贯可解释的纵向影像。
CrossEarth-Gate:基于Fisher引导的自适应调优引擎,用于高效跨域遥感语义分割
提出含多域模块工具箱及Fisher引导自适应选择的CrossEarth-Gate,动态激活关键模块,跨域遥感语义分割16/18达最优。
混合Transformer-Mamba用于弱监督体积医学分割
TranSamba混合Transformer-Mamba,通过跨平面线性建模实现高效弱监督体积医学分割,达SOTA性能。
基于噪声条件频率暴露的扩散逆问题后验延续
提出后验延续框架,按噪声水平暴露频率并逐步恢复全频段,在超分辨率等逆问题上达SOTA,提升高达5dB PSNR。
MUFASA:一种用于槽注意的多层框架
提出MUFASA多层框架,利用ViT多特征层槽注意与融合策略,提升无监督对象分割性能,达到新SOTA。
E-VAds:面向多模态大语言模型的电商短视频理解基准
提出电商短视频基准E-VAds与强化学习推理模型E-VAds-R1,商业意图推理性能提升109.2%。
生成式图像恢复进展到哪了?关于其能力、局限性和评估实践的研究
生成式图像恢复取得显著感知真实感,但面临从欠生成到过生成的范式转变,需新评估方法。
基于数字孪生表示的强化学习训练大语言模型用于高推理手术视频问答
提出强化学习框架,基于数字孪生解耦感知与推理,引入层次表示和临床合理性奖励,实现手术视频问答最优性能。
GeoDisaster:面向业务化灾害地理智能的编排式代理基准测试
首个业务化灾害地理推理基准,含2921实例5任务,提出编排式多代理框架RCEA提升工具使用与推理能力。
SierpinskiCam:基于谢尔宾斯基三角形图案提示的摄像机控制视频重拍
SierpinskiCam利用谢尔宾斯基穹顶纹理增强几何引导,并引入参考视频条件机制,提升大视角变化下的视频重拍质量。
Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration
基于量子增强多尺度CNN与双向Mamba的作物田分析
提出BiSpectral Mamba框架,融合多尺度CNN、光谱注意力和双向状态空间建模,实现作物分类84.83%准确率。
驾驭REINS:通过表征引导实现视频扩散模型的无训练安全对齐
REINS方法通过引导中间层表征实现无训练安全对齐,仅需一个方向向量,在9个视频模型上验证有效。
基于动作驱动数字孪生的手术室片段推理式文本-视频检索
OR3将手术室视频转为动作数字孪生,利用LLM想象检索与证据修正进行推理式检索,性能显著优于现有方法。
并非真正多语言:脚本一致性——VLM评估中缺失的维度
VLM多语言评估忽略多脚本用户,脚本间性能差达16%,SCR低至24.8%,需确保公平AI访问。
Beyond Benchmarks: Continuous Edge Inference for Fine-Grained Roadside Perception
基于视觉Transformer的Landsat-Sentinel-2藻华制图:模型描述、实现与示例
首次将视觉Transformer用于30米Landsat-Sentinel-2藻华制图,有效避免云和耀斑干扰,实现高精度监测。
使用稀疏先验和MCMC采样的贝叶斯磁共振联合图像重建与不确定性量化
用稀疏先验和MCMC采样实现贝叶斯MRI重建与不确定性量化,效果优于优化方法。
视觉会欺骗,一致性才可信:解耦视觉-语言模型中的空间注意力与可靠性
质疑注意力即置信度假设,发现视觉注意力与准确性无关,自一致性才是可靠性的主导预测因子。
现实世界中的复杂版面分类:一种基于版面保持增强的低资源方法
通过版面保持增强和CNN分类器,在标注稀缺下显著提升复杂版面分类性能。
DriveJudge: 用视觉语言模型重新思考自动驾驶评估
DriveJudge结合规则评估与VLM推理,基于大规模数据集,在驾驶分类和轨迹偏好上超越现有方法,实现可解释且上下文感知的评估。
改进与评估手-物体交互检测
提出HOI-DETR框架,构建四数据集评估套件,在多个基准上mAP提升超20%。
MeiBRD:元学习术中生物力学残余形变
提出MeiBRD框架,元学习残差形变校正生物力学预测,利用稀疏术中测量提升配准精度与泛化性。
TerraTransfer:无专家示范的端到端驾驶策略学习
提出TerraTransfer方法,通过自博弈预训练策略,利用动作KL散度和结构损失对齐视觉骨干,无需专家示范,实现高效端到端驾驶。
基于结构化基础模型适配的几何一致性内镜表示用于图像引导导航
提出统一框架,结合合成数据与层次适配,学习几何一致且域鲁棒的内镜图像表示,提升导航任务性能。
FATE:基于事件的物体检测中的柱编码与频率感知训练
FATE框架通过柱编码保留时间动态,结合频率感知训练,实现事件相机的高分辨率高频物体检测。
利用扩散学习视觉纹理的最大熵模型
用扩散模型训练最大熵纹理模型,仅需512统计量即可生成高质量纹理,且支持平滑插值。
连接空间与频率视角进行灾害评估:优势与局限
双域模型比单域方法提升明显,但检测细微损坏仍困难,需数据平衡与高级融合。
人类与视觉语言模型之间的注意力对齐
解码器架构主导对齐度:LSTM对齐高但任务区分差,ViT-Transformer相反,行为与神经数据存在权衡。
超声心动图视频标准切面分类的时空融合模型
提出STFM模型,融合时空特征与不确定性感知学习,在最大超声心动图视频数据集EV9V上实现标准切面高效分类。
手部损伤与遮挡对增强现实应用中手部姿态估计精度的影响
评估了Hololens2及算法在手部损伤和遮挡下的姿态估计精度,发现损伤组与对照组无显著差异,透明物体略有优势。
增强病理视觉语言模型的跨尺度推理
提出跨尺度训练评估范式与Scale-VQA基准,以强化学习训练ScaleReasoner-R1模型达SOTA,证实跨尺度监督可提升病理理解。
CIAN:基于检索增强生成的事件丰富图像描述多阶段框架
CIAN通过检索增强和语言优化,将事件图像描述CIDEr从0.030提升至0.094。
基于多特征聚合的图神经网络半监督图像分类
提出结合多特征提取器与图表示的GNN方法,利用流形学习提升半监督图像分类精度,实验证明特征策略组合显著提高准确率。
LADBench:图像逻辑错误检测基准
提出LADBench基准,评估VLMs检测图像逻辑异常的能力,最佳准确率仅70%,揭示隐式逻辑推理缺陷。
视觉检索增强生成:剪影引导的动物艺术创作
提出Visual-RAG框架,从自然剪影检索相似动物形状引导扩散生成,用户测试显示结构保真重要但感知冲击待提升。