量子隐式神经表示用于新视角合成
提出3D-QISR,首个混合量子-经典辐射场模型,用参数化量子电路替代NeRF骨干,参数减半而性能相当,开辟量子隐式神经渲染新方向。
Fast-BEV++:算法致快,设计至简
Fast-BEV++分解视图变换免定制内核,提速超3倍;在nuScenes达0.488 NDS与134+FPS,兼顾精度与高效部署。
面向连续视角优化的相机泼溅法
提出相机泼溅法,将相机建模为3D高斯,用点相机连续可微优化视角;相比FVS,更好捕捉金属反射和复杂纹理。
Skyfall-GS:利用卫星影像合成沉浸式三维城市场景
融合卫星重建与扩散细化,无需昂贵三维标注,合成街区级沉浸式三维城市场景,支持实时探索。
DIAL-GS:基于4D高斯溅射的无标签街景动态实例感知重建
提出DIAL-GS:用4D高斯溅射无标签街景动态实例感知重建,实例与动态互促,超现有自监督。
基于大语言模型自动标注的短窗口滑动学习用于实时暴力检测
提出短窗口滑动学习,用大模型自动标注短片段,保留时序,实时检测暴力准确率高,分别达95.25%与83.25%。
热成像用于无接触式心肺与泌汗反应监测
热成像视频可无接触估计皮电、心率与呼吸率,最佳皮电相关0.40,呼吸误差3.1,心率受帧率限制,为工业人机交互提供辅助感知。
损失最知:通过损失轨迹检测视频标注错误
利用检查点损失轨迹计算累积样本损失,用于审计视频标注的语义错标与时间乱序,较基线提升达4.2点AUC。
EmbedTalk:基于高斯嵌入的说话头合成
提出高斯嵌入替代三平面,用于说话头合成,提升渲染质量、口型同步及运动一致性,模型更紧凑,可每秒60帧以上。
PoseDreamer:基于扩散模型的可扩展逼真人体数据生成流水线
提出扩散模型流水线PoseDreamer,生成50余万张带三维标注的逼真图像,质量优于渲染数据,训练效果媲美真实数据。
学习受控潜空间动态以加速掩码图像生成
提出轻量模型纳含已采样令牌,回归特征演化速度场,加速掩码图像生成,实现超4倍加速且保持质量。
ReCoSplat:基于渲染与比较的在线前馈高斯泼溅
提出在线前馈高斯泼溅新方法,用渲染-比较桥接位姿失配,缓存压缩超九成,实现高保真实时新视角合成。
F4Splat:用于前馈3D高斯泼溅的前馈预测性致密化
提出F4Splat,按空间复杂度与多视角重叠自适应分配高斯,控数量保质量,用更少高斯实现更优新视角合成。
ORMOT:全向指代多目标跟踪的数据集与框架
提出全向指代多目标跟踪任务,构建ORSet数据集与ORTrack框架,实现全方位场景语言引导跟踪,性能最优。
M3T:面向手语生成的离散多模态运动标记
融合面部身体参数,采用量化变分自编码器扩充面部码本,训练自回归模型生成非手部特征,实现领先手语生成。
LRConv-NeRV:面向高效神经视频压缩的低秩卷积
以低秩可分离卷积替换解码器密集卷积;仅末级应用即降低68%算力、9.3%模型体积与9.2%码率,质量近无损,适配低精度受限环境。
用于惰性弹药筛查的无人机热成像:多期数据集开发、目标检测与实践建议
构建多期无人机热成像惰性弹药数据集,训练检测模型并提炼实用建议,助力人道排雷筛查。
超越文本思维链:自动驾驶中基于动作的推理综述
综述自动驾驶从文本思维链转向动作落地推理,提出四类中间表征,强调可落地、实时且可安全验证。
FairLens:面向高风险决策的视觉语言模型公平性基准测试
FAIRLENS以招聘、法律、医疗场景评估VLM,发现主要问题是从人脸无据推断,而非群体间不公。
FORGE:微控制器上纯整数视觉模型的仅前向测试时自适应
提出仅前向测试时适应,对折叠BN的整数卷积逐通道重归一化,恢复大部分精度,只需调整少数层,能耗低。
AlphaRAD:基于α校正二元交叉熵与分解式潜在监督的胸部放射学定位感知零样本分类
借助医学概念空间和α校正二元交叉熵,用分解式潜在监督增强空间定位,实现胸部放射学零样本分类最优。
从视觉线索到口头叙述:重新思考音频描述
提出两阶段流程,同时预测口述内容与插入时机,在长电影基准上优于基线。
面向多模态反无人机检测的证据深度学习
证据学习目标提升反无人机检测精度,但证据融合、空性不确定性和时间门控无益;增益源于目标而非不确定性。
Swin与EfficientNet结合:面向GAN人脸取证的轻量级架构
混合EfficientNetB0+Swin模型检测GAN假脸,准确率99%、召回率99.44%,轻量高效。
ZipTok3D:具有紧凑标记前缀的高保真三维标记化
采用嵌套丢弃与迭代解码,实现极短标记序列的高保真重建;用1个标记可达到32个标记的质量,实现32倍压缩。
SCULPT:面向训练后量化就绪性的边缘视觉模型训练
该法在浮点微调中结合激活正则化与百分位裁剪,抑制离群值并学习量化边界,无需量化感知训练即可用于训练后量化。
先分配再嵌入:视频嵌入的自适应视觉输入分配
在嵌入前按预览分配帧级分辨率,固定预算下扩展时序覆盖,经检索反馈优化分配器,显著提升视频检索性能。
CoViT:面向视觉Transformer的实例对应对比学习
CoViT通过几何引导对比学习让纯ViT获得实例感知,无需额外解码器或标签,在实例级任务中稳定提升超2个AP点。
SliceBridge:T1加权磁共振成像中损坏切片区间的上下文一致性修复
提出切片桥框架,用流匹配修复磁共振连续切片损坏,保证上下文一致性,降低切片间误差,提升下游分析准确性。
利用大型深度神经网络改进合成孔径声纳图像中的自动目标识别
在合成孔径声纳图像识别中,比较卷积与变换器网络,研究规模、预训练、数据增强等以提升性能并给出训练指引。
一致性正则化的无监督阴影去除
提出ShadowCLR无监督框架,直接学习阴影图像,利用跨观测一致性正则化恢复场景一致性并抑制阴影变化,无需阴影掩码或参考图,性能优于现有无监督方法。
DESA-TTA:测试时自适应的动态EMA与源锚定
提出指数移动平均与源锚定方法,联合调节教师更新并抑制学生漂移,提升检测器测试时自适应鲁棒性。
集成激光扫描与图像拓扑优化的可见及亚表面结构缺陷检测与量化技术
结合激光扫描与DIC拓扑优化反演,非接触量化可见和亚表面缺陷。
十种架构,同一错误:空间不相交评估下高光谱分类的共性失效模式
随机分割致高光谱评估泄漏;无泄漏协议下十种架构F1降0.147、排名剧变,且误分类像素高度重合。
Video2Reaction:训练基础视频模型预测观众反应
提出多模态数据集,以分布标签建模观众情绪;视觉语言模型微调超越基线,仅百分之一数据迁移即达全量最佳。
Kirin:从野外视频生成动物动作
提出新框架从野外视频重建动物动作构建首个图文与动作对齐的大规模数据集支持文本图像引导的三维动画生成
线性融合MultiDiffusion:快速免训练的球面全景生成
提出LF-MultiDiffusion免训练全景生成法,用Krylov求解器高效融合潜变量,质量、文本对齐与一致性提升,推理加速15.36倍。
从无标注婴儿视频进行人类姿态基础模型的跨模型蒸馏,以实现无标记三维姿态估计
利用未标注婴儿视频进行跨模型蒸馏,显著提升婴儿二维关键点精度并降低三维姿态误差。
SignMatch:将词典手语与连续手语视频进行匹配
提出原型结构手语嵌入,将词典视频映射到连续手语视频空间,实现跨数据集/语言匹配,优于现有方法。
保守生成算不算忠实?重新评估LVLM幻觉缓解方法
评估六种缓解法发现:降幻觉常伴随信息量减少,基准提升不迁移至更广能力,应权衡忠实、信息与能力。
RAFT-DVC:基于机器学习的分辨率感知数字体相关
提出分辨率感知RAFT-DVC,位移误差约0.017体素,粗纹理大位移下占优,支持大体积密集估计。
TAPVid-MV:跨多视图三维任意点追踪基准
首个多视图三维点追踪基准,含284序列、109k轨迹。现有方法不敌单目,几何恢复为瓶颈。
聚合邻域嵌入投影与基于排序的流形学习用于图像检索
结合邻域嵌入投影与基于排名的流形学习,通过排名聚合互补上下文,提升图像检索精度。
基于三维重建的玉米果穗自动化表型鉴定
基于三维重建的玉米穗点云自动提取行数、粒数等,精度高,支持基因型与表型关联分析。
Volterra神经网络学习:系统理论视角
提出kVNN沃尔泰拉核化算子,解耦高阶交互表示,避免显式张量,以CNN层实现高效滤波,精度效率均衡。
全切片图像基础模型中的形态学信号可自动分诊切片
研究表明,全切片图像基础模型中的形态学信号足以自动分诊切片,即使患者有43张切片,也能让含肿瘤的切片排到前2。
InstEditSeg:指令驱动的息肉与皮肤病变分割图像编辑
提出InstEditSeg,将医学分割转为指令驱动图像编辑,借助DINOv3特征与双分支引导,性能媲美判别模型且跨域泛化更强。
InsightSeg:复用纠正洞察实现准则一致的分割
该方法以情景记忆复用修正经验,预防重复错误,提升分割质量并减少精修。
谁在驱动视觉语言模型的概率博弈?一种时间因果驱动评估框架
提出时间因果驱动评估框架,度量视觉、问题与生成前缀的逐步因果作用,揭示生成由早期引导转向依赖前缀,诊断准确。
基于跨模态注意力漂移与掩码验证的大型视觉-语言模型对象幻觉检测
提出一种轻量检测框架,用跨层注意力漂移与掩码验证识别视觉语言模型的对象幻觉,效果稳定。