DOA-SORT:基于分布观测的方向性遮挡感知多目标跟踪
提出免训练在线跟踪器DOA-SORT,用方向性遮挡观测混合建模观测偏差,DanceTrack上HOTA升至66.34。
Math2Visual-X:面向小学低年级数学教学对齐视觉生成的模块化框架
提出模块化符号框架,生成小学低年级数学应用题视觉,覆盖更广且可扩展,人工评估优于主流文生图基线。
X-Beat:一种可解释的心电图图像分类框架
提出可解释且可靠性感知的心电图图像分类框架X-Beat,ResNet-50准确率达91.94%,并分析解释可靠性。
ConsistWorld:面向一致性多智能体世界模型的证据路由
提出多智能体世界模型从共享图像生成相机控制视频,路由历史与同伴视角证据,实现跨时间与跨智能体一致。
PanoSeg3R:面向全景图像的前馈式三维语义分割与自动数据整理流水线
提出PanoSeg3R,全景图单次前馈联合预测三维几何与语义分割,自动伪标注扩充数据,三维mIoU最高提升16.02。
Vision2CAD:面向参数化CAD建模中显式几何引用与定位的视觉智能体框架
Vision2CAD将VLM推理与CAD内核操作结合,实现显式几何引用与定位,并发布GERD数据集。
以门控线性注意力与KAN重新审视视觉架构
提出LKAT,将分块门控线性注意力与两层KAN前馈及RBF核融合,在ImageNet-100等任务上超越ViT与MLP-Mixer。
看见并不足够:视觉语言模型能感知证据却无法据此行动
提出VPAC-Bench与SRT,发现VLM识别证据却常误判,过程先验须与决策边界对齐方有效。
AdaMerge:面向多向量视觉文档检索的免调优补丁压缩
AdaMerge依各文档合并余弦突变点自适应压缩补丁,免调参,长文档检索优于调优PtM,开销极小。
超越排行榜:域偏移下端到端与视觉-语言-动作(VLA)驾驶策略的反事实诊断
排行榜难预测新场景表现;反事实诊断编辑真实帧,近行人场景真实避让不足百分之二,部分结论可跨域迁移。
SatOV:为遥感影像中的免训练开放词汇分割恢复空间先验
SatOV免训练框架,以残差QQ注意力与空间调制上采样两阶段恢复空间先验,提升遥感开放词汇分割效果。
PixelART:无需潜变量与文生图预训练的图层化解构
PixelART 无需潜变量和文生图预训练,以像素空间整流流 Transformer 从零训练,实现领先的图层分解,参数、时延、显存大幅降低。
面向端到端自动驾驶的规划对齐BEV表征预训练:稀疏动作条件目标
规划对齐BEV预训练:单次LiDAR构建稀疏风险目标,动作条件预测掩码BEV特征,免标注;nuScenes碰撞率0.51%→0.19%。
ZIL:零样本图像到LiDAR配准
ZIL为首个零样本非同步图像到LiDAR配准基础模型,在7个数据集1.4M帧训练,跨5个基准显著优于SOTA,误差最高降87%和76%。
迈向稳健的课堂考勤:人脸检测与识别模型综合评估
提出Visage数据集,FaceLiVTv2-M以99.75%准确率、6.459ms推理最优。
DriveReferee:驾驶世界-动作模型的几何安全判定无需学习
DriveReferee用学习场景读出直接执行几何安全规则,训练蒸馏偏好、部署筛选安全轨迹,NAVSIM达92.02 PDMS。
人类水平的准确率,非人类的策略:揭示视频物理推理中的模型-人类分歧
视频模型物理推理准确率近人类,但人机分歧达26.4%,策略异于人类,依赖场景统计而非前向模拟。
基于雷达图像融合的图像帧动态目标分割与自车运动估计
雷达- RGB框架Radar-Dot利用多普勒联合估计自车运动并分割动态物体,动态IoU达20.24%。
C$^{2}$-INR:定制化卷积隐式神经表示
提出C$^{2}$-INR,按频谱方向能量定制卷积核,结合正交基与自适应激活,提升表示、修复和超分性能。
LINGO:基于3D高斯泼溅的稀疏视角X射线新视角合成与CT重建的潜在初始化与梯度优化
LINGO融合潜在掩膜空间初始化与动态梯度优化,提升稀疏视角X射线新视角合成与CT重建质量并加速训练。
D3GS:深度、DINO 与 RGB 扩散协同引导的三维高斯泼溅稀疏视角重建
D3GS 融合扩散深度补全、DINO 引导的多视角一致学习与扩散先验细化,协同增强几何与外观,显著提升稀疏视角重建质量。
M3GA-Wild:面向森林多模态、多会话地空场景识别的大规模数据集与基准
首个森林多模态多会话地空场景识别基准,整合36公里地面与370公顷航拍数据,揭示跨模态对齐等挑战。
结合基础模型置信度与单目深度的免训练分布外分割
提出免训练分布外分割法,融合基础模型置信度与单目深度,在道路基准和视频跟踪中表现强。
Scout:边缘端的开放世界物种识别
Scout间歇调用云端VLM教边缘模型新物种,无需预定义列表,精度接近有列表模型,能耗降59-71%。
AVTR-1:面向实时交互式虚拟形象的开源技术栈
AVTR-1开源栈:1.53亿参数流匹配生成器驱动实时交互虚拟人对话,并提出R-DGG指标。
规划与渲染协同:面向视觉文本生成的自回归布局与扩散深度融合
提出DuetGen,深度融合自回归布局规划与扩散渲染,文本生成准确率显著提升。
面向开放式图像质量感知的进化式智能体方法
提出免训练多智能体框架PACE,用可验证VQA探针构建评估协议,每维度仅需四张标注图校准,显著缓解整体偏差。
RewardVerse:面向视频奖励建模的评分标准引导策略优化
RewardVerse以评分标准为中间表示引导视频奖励建模,并用RGPO缓解分数漂移,提升奖励稳定性与可解释性。
CLEAR:面向超加速4D血流CMR重建的复数学习型显式解析正则化
提出CLEAR,首个4D重建学习型正则化器,兼具压缩感知可解释性与学习模型灵活性;在10–50倍超加速4D血流CMR中优于LLR和FlowVN,参数少于1万。
通用协同智能:为韧性多智能体生态系统构建认知架构
综述以五维分类与三大认知协同条件,统一梳理多智能体协同架构、通信、学习与韧性机制,并提出GCI-Bench评测协议。
CrowdCue:面向视觉语言人群计数的专家线索条件化
将专家整数计数作为离散符号输入VLM,视觉通道MAE降至62.65,优于专家与热力图条件化。
MixiMotion:基于非对称集合蒸馏的一步文本到动作生成
MixiMotion用离线教师动作库与非对称双向匹配蒸馏实现严格单步文本生成动作,延迟仅9.30ms、加速89.2倍,语义对齐0.835接近教师。
基于跨表示先验的3D高斯泼溅压缩
提出CRP-GS,以跨表示先验优化锚点熵建模,平均降低约30%码率并保持渲染质量。
QwenVLConnector:面向细粒度临床感知与文本生成的快速、统一医学VLM聊天机器人
基于Qwen2.5-VL的统一医学VLM聊天机器人,用轻量多层连接器融合视觉特征,统一细粒度感知与报告生成,性能显著提升。
VDGS:面向航拍场景重建的可见性驱动大规模3D高斯泼溅
提出VDGS,将相机分布纳入建模,以可见性统计引导场景分区与梯度补偿,提升视角不均下大规模航拍重建效果。
LD-RSVIS:一个大规模、多样化的指代手术视频器械分割基准
提出LD-RSVIS基准:3536段手术视频、109万帧、30类器械,支持无/单/多目标指代。
面向兽医细胞学低成本计算花粉分析的重建全息图与解释感知评估
全息重建缩小低成本花粉分析差距;AHIR可区分真正解释失效与模型脆弱及粒度伪影。
BrainIAC:跨异构MRI模态的交互式3D脑病灶分割与在线自适应
BrainIAC框架融合多模态骨干网络、3D交互分割与在线自适应,跨异构MRI模态分割脑病灶。
MM-ContextFold:面向多模态智能体检索的上下文折叠
免训练框架MM-ContextFold按需加载图像,子任务完成后折叠为文本摘要,准确率提升6.3个百分点,上下文缩短27.5%。
HDMamba-YOLO:面向无人机小目标的高效状态空间感知与局部空间重建
提出HDMamba-YOLO分阶段异构SSM-CNN检测器,融合状态空间感知与局部空间重建,VisDrone mAP50达42.74%。
MinCU:面向图像对中最小变化定位理解的细粒度基准
提出MinCU基准与SG-ISA方法,提升多模态模型对图像对微小变化的描述与定位,推理token减约26%。
CausalWM:面向具身世界模型的因果思维链推理
CausalWM是16B具身世界模型,用因果思维链推理预测视频,三阶段训练后在多项基准达SOTA。
菲涅耳-库默尔曲面的精确商与可验证双轴折射
精确识别双轴晶体菲涅耳波面为Kummer曲面,建立可验证折射代数判定,商坐标模型更优。
永续辐照度相机
全向辐照度相机用少量探测器重建球面辐照度;49探测器原型光供能、无线30帧/秒,可测旋转、监测与日照。
SparkDiffusion:缓解高稀疏陷阱——视觉生成单GPU加速最高265倍的统一框架
SparkDiffusion缓解高稀疏陷阱:稀疏预热+轨迹蒸馏+FP8,单GPU视觉生成最高加速265倍。
GrapeSplat:基于融合无位姿编码的前馈三维高斯泼溅几何重建
GrapeSplat融合多视角线索为体素对齐表示,直接从网格解码高斯,单次前向传播即可从无位姿图像生成可渲染场景,跨视角数泛化。
带像素强度约束与稀疏梯度先验的二值及图案图像盲去卷积
提出结合像素强度约束与梯度稀疏正则的统一盲去卷积框架,用于二值及图案图像,性能优于现有方法。
UltraTex:释放2K多视角扩散,实现3D纹理生成
UltraTex提出高效端到端2K多视角扩散3D纹理框架,借背景Token丢弃、块稀疏注意力和前景感知VAE解码,大幅提速并保细节。
SPACE:面向领域适应的CLIP嵌入语义投影与对齐
SPACE以文本描述为语义锚点,经SVD将CLIP视觉特征投影至语义子空间,按语义而非外观对齐两域。
RegVGGT:通过受控记忆实现可持续的流式视觉几何基础
RegVGGT无需训练,调控令牌,每帧最多1%更新记忆,抑制显存增长,消费级GPU处理数千帧,长时重建达SOTA。