A real-time RGB-D perception pipeline for autonomous impact hammers in mining: self-filtering, rock segmentation and rock-breaking poses generation
统一视频密集预测:从不相交数据学习
UniD模型统一预测八种场景属性,通过蒸馏从分散数据集学习,利用扩散模型桥接域差距,无需伪标注。
GLAM-SLAM:基于流密化与空间分解的实时高斯大规模建图
GLAM-SLAM实现实时高斯SLAM,通过流密化和空间分解,在长序列数据上重建质量提升15%。
KroQuant: 基于克罗内克结构块变换的扩散Transformer高效训练后量化
KroQuant用克罗内克结构块变换实现W4A4量化,参数少、速度快,图像质量优于现有方法。
为视觉Transformer建立遗忘基准
首次为视觉Transformer建立遗忘基准,评估多种算法、数据集与遗忘协议,提供公平可重复的比较基准。
将广义幂图拟合到三维图像数据:虚拟材料测试的先决条件
综述将广义幂图拟合到3D图像数据的方法,用于虚拟材料测试,比较多种算法策略。
可训练的对数线性稀疏注意力用于高效扩散Transformer
LLSA利用分层结构将注意力复杂度从二次降至对数线性,加速DiT训练6倍、推理28倍,保持生成质量。
聚焦关键:基于动作单元的时空注意力约束实现抗噪声动作质量评估
提出动作单元空间注意力与双流解耦框架,去除背景噪声,分离动作与环境,实现SOTA评分性能。
SuperFlow:基于强化学习的实时流匹配模型训练
提出SuperFlow框架,通过方差感知采样和步级优势计算,仅用5.4%-56.3%训练步数即实现性能提升与训练加速。
EmoSpace:细粒度情感原型引导的沉浸式情感图像生成
EmoSpace通过细粒度情感原型和条件引导生成沉浸式图像,提升情感对齐,适合场景设计。
受电弓-接触网系统电弧检测的多模态学习
提出多模态框架结合图像与力测量检测弓网电弧,扩展DeepSAD并引入伪异常生成,显著提升检测性能。
SoccerSynth Field:利用虚拟足球模拟器的合成数据增强场地检测
利用合成数据集预训练模型,显著提升足球场地检测的鲁棒性和准确性,实现经济高效的解决方案。
DCVC-MV: 具有高效视间预测的深度上下文多视点视频压缩
提出DCVC-MV框架,利用视间运动特征传播和条件熵模型,实现高效多视点视频压缩。
基于前馈高斯溅射的实时人体重建与动画
提出HumanGS框架,从稀疏多视图实时重建人体,无需预训练,重建速度提升15倍。
全旋转等变光谱-空间学习用于多光谱目标检测
FressDet提出全旋转等变光谱-空间框架,通过隐式扭曲、一致性加权和定向头,以93%更少参数达多光谱检测SOTA。
QATMA:多模态对齐的量化感知训练用于开放词汇目标检测
QATMA通过课程量化和文本锚定蒸馏,解决极低位量化下多模态对齐退化,零样本检测AP提升4.3-7.6。
O3N:面向城市自主体的全向开放词汇占据预测
首个全向开放词汇占据预测框架,从单张RGB图像实现,在多项基准上达到最优性能。
基于统一研究的相机陷阱物种随时间识别:经验与待解问题
首次系统研究相机陷阱物种随时间识别,揭示时间偏移和类不平衡挑战,提出改进方向与开放问题。
ELT:弹性循环变换器用于视觉生成
ELT通过权重共享循环变换器和内部自蒸馏,实现参数高效、动态计算与质量权衡的视觉生成。
PersonaGesture:基于单参考样本的未知说话人共语手势个性化
提出扩散管道PersonaGesture,通过自适应风格注入与隐式分布校正,实现单参考下未知说话人手势个性化,无需逐人优化。
Cambrian-P: 基于姿态锚定的视频理解
引入可学习相机令牌和姿态回归头,在空间推理和通用视频QA上显著提升,验证了相机姿态的关键作用。
高CFG扩散反演何时失败?提示与潜变量交互的受控研究
高CFG反演失败取决于提示-潜变量配对,提示压力可区分难易但不足,需局部轨迹感知干预改进重建。
任务对齐:跨多样视觉任务实现实用模型合并的简单代理
提出任务对齐代理,大幅加速超参数选择,将模型合并扩展到多任务视觉模型。
引导、思考、行动:视觉-语言-动作模型中的交互式具身推理
提出GTA-VLA框架,通过用户视觉引导和空间视觉链式思考实现可纠错的具身推理,OOD场景下成功率显著提升。
HOMIE: 通过多模态智能增强实现以人-物为中心的视频个性化
HOMIE框架通过多模态增强,统一内外主体输入,实现高保真人-物交互视频个性化。
面向安全网络物理空间的物联网架构:VISOR经验报告
VISOR项目在音乐节测试多种IoT设备(无人机、CCTV等)检测恶意活动,为安全网络物理空间选出最优架构配置。
广义最小二乘核化张量分解
提出GLSKF框架,融合全局低秩与局部残差建模,高效补全多维时空数据,实验性能优越。
最便宜的生存:面向对抗鲁棒性的成本感知硬件自适应
提出成本感知硬件自适应框架,用加速失效模型量化影响。实验表明低成本L4芯片生存时间增20%、成本降75%,推断延迟是关键。
Soft-TransFormers 持续学习方法
Soft-TF通过任务特定实值掩码微调冻结Transformer,消除遗忘且任务推断错误无害,性能优于提示/适配器方法。
FE-MCFormer:一种用于强噪声环境下机械故障诊断的新型时频可解释架构
FE-MCFormer通过频率自适应与多尺度时频融合,在-10dB强噪声下实现鲁棒可解释的机械故障诊断。
基于肿瘤锚定的深度特征随机森林用于肺癌分割中的分布外检测
RF-Deep用少量标注和深度特征随机森林检测肺癌分割中的分布外输入,近OOD准确率超93%,远OOD近完美。
Timeripple:通过理解潜在空间中的时空相关性加速vDiT
基于潜在时空相关性,提出自适应重用策略加速vDiT,节省85%计算量且质量损失小于0.06%。
深层弱监督图像分割的统一变分框架
提出统一变分框架用于稀疏监督分割,基于Potts模型与RKHS,作为损失函数无需真实分割图即达可比性能。
ChronoStitch:无训练组合视觉KV记忆实现长时域时序推理
提出无训练方法,通过全局RoPE坐标重定位和选择性重计算,高效组合视觉KV缓存,提升长视频时序问答性能。
Crowd4D:场景感知的单目4D人群重建
提出Crowd4D框架,联合优化人群与场景,利用HSIP代理实现准确人景对齐,在复杂大场景中稳健重建4D人群。
早期检测,极少升级:从压缩比特流中随时检测AI生成视频
从压缩比特流实时检测AI视频,利用编码运动场,计算量降低5个数量级,门控维持假阳性率,延迟15%片段提升准确率至0.78。
D3VL: 使用语言模型从3D时序数据和视频中理解驾驶场景
D3VL框架融合2D/3D时序数据,驾驶场景问答性能提升11%,并扩展WaymoQA数据集。
合成与衍生训练图像用于校园垃圾检测:基于YOLOv8n的多种子评估
合成与衍生图像未提升YOLOv8n检测性能,真实图像基线[email protected]最高达0.691。
EGRNet:一种具有边缘门控细化与对抗感知的轻量级语义分割网络
EGRNet轻量语义分割网络(0.46M参数),采用边缘门控细化与对抗感知,Cityscapes上mIoU达65.28%,适用于边缘实时应用。
VQ移植:预训练视觉分词器中高效VQ模块集成
VQ-Transplant框架实现即插即用集成新VQ模块,保留原参数,轻量适应后达近SOTA性能,节省95%训练成本。
病理学家注意力对齐的前列腺组织病理学报告生成
本文引入病理学家注意力训练报告生成模型,通过多模态数据集和注意力对齐损失,使NLP指标提升10.9%,临床组件准确率提升19.3%。
超声心动图中的域偏移:跨数据集左心室分割的可解释量化与预测
超声心动图域偏移可结构化测量,几何预处理缓解,分割性能下降可预测(R²=0.612)。
风格胜于实质:情感描述偏好评估的捷径审计
情感描述偏好评估存在风格捷径,未理解视频即可达高分,需改进评估方法。
危险还是异常?评估视觉语言模型对危险与差异的理解
研究发现VLM常将异常误判为危险,明确区分二者能更有效评估安全推理能力。
从像素到预后:卷积与GLCM特征融合实现自动四分类白内障严重程度分级
融合CNN深度与GLCM手工特征,SVM分类四类白内障,准确率95%,无需GPU,适合基层远程医疗。
Text-conditioned Segmentation for Tomato Phenotyping via Procedural Synthetic Data
DuSPiT:双分支子补丁像素扩散Transformer
提出双分支子补丁像素扩散Transformer,分离全局与局部建模,生成更精细图像,质量效率优于先前模型。
AniGS:桥接渲染与扩散先验的3D场景动画
AniGS利用视频扩散模型为3D场景添加环境动态,通过迭代更新和细化保持结构,实现沉浸式动画。
Recti-Q:面向边缘机器人中分布外鲁棒量化感知的特征空间校正
Recti-Q轻量特征空间校正恢复量化模型分布外鲁棒性,参数开销<1%,保留99%内存节省。
惊喜强制:长视频生成中的记忆与跳过选择
提出惊喜强制框架,通过记忆库和自适应去噪优化资源分配,提升长视频生成一致性和质量。