SeetaPsych v1.0:面向行为心理测量的开源计算机视觉工具包
SeetaPsych v1.0是开源可扩展计算机视觉工具包,统一提取面部图像与视频中的心理相关信号,涵盖表情、心率、视线等模块。
STAR:面向基于扩散的光场重建的结构感知测试时自适应
首个从焦距堆栈重建光场的测试时自适应框架:冻结扩散先验,为每个光场拟合三个轻量适配器适配其空角结构。
近因强制:弥合自回归视频生成的长时程鸿沟
针对自回归视频生成的KV驱逐失配,提出近因强制:在注意力上加时步偏置,零开销提升长时程质量。
超越补丁移除:视觉-语言-动作策略中的持续性对抗效应
对抗补丁移除后,VLA策略仍受持续影响;仅36.2%任务可恢复,及时干预至关重要。
理解与利用自回归图像生成中的对角注意力稀疏性
揭示自回归图像生成的对角注意力稀疏性,提出对角感知稀疏注意力,吞吐提升3.1倍、质量损失不足2%。
面向细粒度MLLM感知的区域级策略优化
提出区域级强化学习Vision-RL2,无需区域标注优化提议网络,以约四分之一视觉token超越基线精度。
面向隐私保护的肾结石检测联邦学习框架
联邦学习结合YOLOv8检测CT肾结石,无需共享数据,mAP@50达0.733,兼顾隐私与边缘部署。
IMFD:基于指令的大型视觉语言模型端到端多人脸伪造检测
IMFD用指令式大型视觉语言模型端到端联合定位多人脸并检测伪造,借人脸框增强指令,优于现有方法。
面向可穿戴智能的AI智能眼镜:从第一人称感知到智能体个性化
AI智能眼镜从第一人称感知走向可穿戴智能,协同感知、计算、推理与交互,提供个性化实时辅助。
缺席即在场:安全认知约束下的视觉场景负面事件理解
提出反事实重建与对比解码框架,将物理缺失转为语义负面事件,实现安全约束下的视觉场景负面描述。
SnapPhysics:面向交互式混合现实场景的单视图物理感知场景图
无需训练,从单图重建3D物体并估计质量、摩擦等物理属性,构建物理感知场景图,赋能物理交互式MR体验。
SlugTrails:面向大型建筑平面图定位的自我中心视角基准
提出大型室内平面图定位基准SlugTrails,含三栋六层数据;现成模型近乎失效,微调大幅提升并改善跨集泛化,瓶颈在数据而非架构。
面向安全关键视觉否定理解:基于认知期望场景图的多模态大语言模型基准评测
针对视觉否定理解,定义安全认知场景否定任务,构建数据集与认知期望场景图指标,建立 MLLMs 基准。
PACE:精准AI电影化表达——面向剧本驱动预可视化与几何一致性的类型化规范
PACE以类型化规范将剧本编译为提示词与三维场景,求解相机位姿,并逐字段测量渲染与声明的几何偏差。
KoUniTalk:以发音为中心的轻量级韩英3D说话人脸基准
提出以发音为中心的轻量级韩英3D说话人脸基准,统一网格拓扑,支持跨数据集评估。
社会化无人机跨任务学习:通过分层交互实现跨粒度协作
提出CrossUAV基准与CGSC框架,动态调控跨粒度交互,提升无人机检测和分割性能。
PART:基于Transformer学习3D部件装配与检索
提出基于Transformer的统一框架PART,实现3D部件检索与装配,预测6DoF位姿重建目标,并构建大规模数据集。
BINDER:一种用于概率医学图像配准的潜变量模型
提出概率医学图像配准潜变量模型,基于互信息实现闭式迭代优化,可高效非线性配准并量化高维多模态不确定性。
一种面向事件相机的保事件速度不变表示
SCARF:一种保留原始事件的实时速度不变表示,兼顾快慢运动与静止场景,效率与质量均达最优。
BinoGen:规模化自我中心双目数据,赋能具身视觉感知与学习
BinoGen自动合成具身双目视频数据,含两千万级标注图像,提升感知并揭示具身形态影响。
GS-PI:一种用于生成PBR高斯资产的优化解耦外观分解方法
GS-PI将PBR材质生成建模为点云上的条件扩散,解耦优化,保证多视角一致,输出可重光照高斯资产。
CitySTAR:面向开放词汇城市三维定位的结构化与拓扑感知推理
将城市三维定位转化为结构化约束推理,免训练,借场景图与超图拓扑验证及跨模态反思提升开放词汇定位。
超越前景:基于病灶引导自适应黏膜上下文传播的视野感知息肉图像合成
提出LAMP,病灶引导自适应黏膜上下文传播,分离病灶、黏膜与视野外区域,提升息肉合成及下游分割。
DirtyMoCap:面向无约束标记的鲁棒动作捕捉
DirtyMoCap将无序标记映射为代理锚点,拟合SMPL-H,单模型泛化任意布局,精度领先。
QCPruner:用于视觉令牌剪枝的查询条件化群体覆盖
提出免训练视觉令牌剪枝QCPruner,以查询条件化双边效用加权提升多模型性能。
AVTrace:诊断全模态模型中的音视频时序推理
AVTrace基准评估全模态模型音视频时序推理,含七类任务;五个开源模型表现普遍不佳,时序后训练可部分改善。
通过教师预测精炼增强检测Transformer的知识蒸馏
提出即插即用TPRD,精炼教师预测,纠正退化正例、抑制过自信负例并保留暗知识,提升DETR蒸馏性能。
GRF-Recon:面向长序列前馈重建的全局光线场优化
统一前馈框架结合粗到细轨迹对齐、LoRA几何先验与稀疏光线场优化,实现长序列低漂移、全局一致重建。
免费的午餐?将 PP-OCRv6 适配于历史文本识别
将PP-OCRv6适配历史文本行识别:异构预训练显著提升泛化能力,微调后可超越大型视觉语言模型。
AnyviewMeter:结合相机几何与多视角注意力的机器人奖励模型适配
结合相机几何与多视角注意力微调奖励模型,显著降低视角变化下的任务进度预测误差。
基于监督式目标域自适应的多中心平扫CT缺血性卒中分割与净水摄取定量
目标域适配支持多中心平扫CT自动分割缺血性卒中并低误差量化净水摄取,无需高级成像。
G²RA-Net:基于图的注意力门控跨切片关系建模用于医学图像分割
提出G²RA-Net,以图节点建模跨切片解剖依赖并通过注意力门控筛选邻域上下文,提升各向异性医学图像分割精度与边界质量。
Transformer 里藏着一个更小的 Transformer
视觉 Transformer 存在深度冗余,TWT 将连续冗余层融合为单个学习代理层,减少参数与推理计算,半深度下仍具竞争力。
Astronex-World 1.0:实时交互式世界模型基础
提出可控视频世界模型,支持文本/图像、相机与动作控制,实时生成,性能领先,可后训练用于具身与自动驾驶。
跨模态注意力即频率滤波器:为何冗长提示能提升视觉语言模型的鲁棒性
VLM在图像损坏下脆弱:冗长提示拓宽跨模态注意力的频率支撑,提升鲁棒性,漂移方差降70-81%。
皮层上的模态桥接:基于表面的扩散桥实现 MRI 到 PET 转换
提出皮层表面扩散桥DB-SUiT,实现MRI到FDG-PET高保真合成,提升痴呆诊断。
PointEvent:通过序列化运动证据累积重新思考基于事件的微小目标检测
PointEvent以序列化运动证据累积互补组织事件流,轻量检测微小目标,参数最少、推理最快并达SOTA。
低信噪比信道下面向多任务卫星遥感的任务导向语义特征传输
提出任务导向语义特征传输:跳过重建,直接传多任务预训练骨干特征,经压缩恢复,低信噪比下分类检测更优。
射线堆中的针:面向蝙蝠轨迹的超稀疏激光雷达占据检测
轻量3D U-Net结合加权交叉熵与Dice损失,在超稀疏激光雷达射线堆中检测蝙蝠飞行轨迹。
Scene-Q:面向3D场景的置信度感知由粗到细查询与选择性VLM推理
Scene-Q用温度缩放校准编码器分数,只对低置信查询调用VLM重排序,提升3D开放词汇检索性能。
CleanVideo:面向文本到视频扩散模型的自适应概念擦除
CleanVideo通过三模态门控的低维子空间干预,自适应擦除文本到视频扩散模型中的目标概念,保持视觉保真与时序连贯。
MTF-Net:面向行人意图预测的多模态时序特征融合网络
提出MTF-Net,融合运动、姿态、上下文与场景四模态,经门控时序融合预测行人过街意图,PIE/JAAD上AUC达0.95/0.94且实时高效。
MoSSGate:面向皮肤病变分割的记忆调制状态空间门控
提出即插即用模块MoSSGate,融合边界感知门控、记忆调制与并行二维状态空间建模,在ISIC基准上高效取得最优皮肤病变分割精度。
类原型距离:面向目标检测的主动学习
提出类原型距离评分信号,单次前向传播即可筛选样本,降低标注成本,性能优于后验概率方法。
面向弱监督白内障眼底图像增强的两阶段多尺度注意力网络
提出两阶段多尺度注意力网络,弱监督增强白内障眼底图像,合成配对图像并提升细节,性能优于现有方法。
SAGE-Yoga:面向瑜伽姿势分类与关节级矫正的多线索学习
SAGE-Yoga统一框架融合多视觉集成与几何校验,实现瑜伽姿势分类与关节级矫正,Top-1达90.7%。
AI还是真实:资源受限环境下的部分篡改视频检测
以知识蒸馏构建轻量全帧检测器,专为边缘部署识别部分篡改AI视频,兼顾时域误报与阈值校准。
生成式验证:重新思考目标检测主动学习中的不确定性信号
生成式验证:独立生成模型复核预测框标签,分歧作采集信号;扩散验证器建模标签分布,超越基线,增益最大。
TouchSight:通过生成式视觉增强从第一人称视频中实现裸手触觉预测
TouchSight用生成式视觉增强,仅凭第一人称视频预测全手密集接触力,无需触觉设备。
TinyCNN:用于端侧植物病害检测的193K参数网络及跨数据集鲁棒性诊断
TinyCNN仅19.3万参数,端侧植物病害识别准确率达98.88%,跨数据集鲁棒性仍存明显差距。