基于头颅CT自动鉴别颅内动脉内膜与中膜钙化
研究三种方法从头部CT自动区分颅内动脉内膜与中膜钙化,形状嵌入法最佳,加权F1最高71.5,自动分割亦稳健。
占据网络引导的自主机器人肾部分切除术
首个视觉引导自主机器人系统基于占据网络推断三维解剖在肾部分切除水凝胶模型中完成77次电切且切缘均阴性
几何与结构:基于图的激光雷达点云仿真保真度诊断
提出图框架,以Louvain社区检测与图谱度量评估激光雷达点云仿真的结构保真度,与几何指标互补。
多源遥感与地理空间分析下的葡萄园野火影响与恢复力:2019年金凯德大火
2019年金凯德大火中,葡萄园光谱损伤低于野生植被,但烟雾暴露普遍、恢复不足,韧性有限。
长尾图像分类中的小批量采样策略:基于 CIFAR-100-LT 的实证研究
系统比较四种小批量采样策略,发现渐进平衡采样稳健提升尾部精度,类平衡采样在极端不平衡下过拟合反损性能。
ConGraspXL:可控约束条件下的灵巧抓取动作合成
ConGraspXL实现可控约束条件的灵巧抓取动作合成,支持多约束组合与精确控制,可即插即用。
HairCS:从发片重建基于发丝的头发
提出自动化流程,将发片模型转为高质量发丝发型,保留原风格并补充细节,适用于渲染与模拟。
面向可变形物体重建的基于因子图推理的可微网格状态估计
提出因子图概率网格估计框架,融合物理先验、传感器测量与时序约束,经非线性优化实现可变形物体精确重建。
看见关键:视觉线索引导的视频规划,实现可泛化机器人导航
用BEV地图与本体视角线索引导视频规划,并以逆动力学模型将视频转为动作,实现可泛化机器人导航。
从像素到图像:遥感图像语义分割中深度学习范式的结构化综述
系统综述深度学习遥感图像语义分割,按像素-块-瓦片-图像分级,梳理监督、特征提取、融合策略与挑战。
TEMPO:为动态机器人操作学习时序上下文
TEMPO为VLA注入运动摘要与本体感知历史,化解运动模糊与状态混叠,交接成功率44%→74%。
神经符号分层人类行为意图预测
提出神经符号分层解码器,预测多层级意图与剩余行为,逻辑约束下显著超越基线,组合泛化仍存挑战。
evMLP:一种高效的事件驱动视觉MLP架构
evMLP为图像块独立处理的全MLP架构,以帧间变化为事件仅更新变化区域,视频计算量降8.4%-26.8%。
HuMemSLAM:面向鲁棒视觉SLAM的高效类人语义位置识别
受人类记忆启发,双向融合感知与上下文推理,实现高效语义位置识别,提升召回并降低延迟。
用于图像修复的可训练且参数高效的量子启发式张量网络
提出量子启发张量网络电路用于图像修复,对角QFT松弛可逆高效,无需相干惩罚,参数少且性能优。
用于AI生成图像检测的CLIP嵌入:基于轻量级分类器的小样本研究
冻结CLIP特征加轻量分类器可检测AI生成图像,准确率95%,小样本达85%,特定风格仍难分类。
部件定位而非动作知识:定位VLM可供性预测的瓶颈
可供性预测的瓶颈在于部件定位而非动作知识:忽略图像也能胜过各模型,点名目标部件后准确率大幅提升。
基于混合CNN--形态学特征的个性化可解释PPG血压估计
提出CNN与形态学混合框架,实现个性化可解释PPG血压估计,收缩压/舒张压误差3.77/2.36
基于掩膜条件潜在扩散和大型慢性伤口数据集迁移学习的合成麻风图像生成
用慢性伤口数据预训练掩膜条件扩散模型,再以708对麻风图像微调;生成多样性可比真实,但语义控制仍受限。
SJD-SV:面向自回归图像生成的语义验证投机Jacobi解码
分析视觉令牌语义模糊成因,提出语义子序列级验证的SJD-SV方法,可即插即用加速自回归图像生成。
EMCStereo:面向细结构深度估计的注意力增强立体匹配与合成树枝基准
为树枝等细结构立体匹配提出EMA注意力增强骨干、虚幻5合成数据集VirtualTree与八路消融,精度持平且更小更快。
编码器究竟决定了什么?视觉骨干网络在树木联合分割与立体深度上的受控比较
受控比较:编码器影响树木分割与深度;卷积/混合优于ViT,参数量不预示质量,任务排序一致,有模型崩溃。
别只看,要干预:面向VQA图像的基于扰动的区域标注
CSGR以扰动候选区域、聚合答案敏感性为VQA标注因果关键区域,跨域提升多种接地训练。
ArtSociety:面向艺术情感理解的多智能体多模态协作
多智能体框架整合异构多模态专家,以免训练投票与描述优先推理联合预测艺术情感、效价与描述。
面向正畸报告生成的闭式咬合几何
提出闭式咬合几何,从已配准口内扫描提取31项指标,融合梯度提升与照片分类,快速生成正畸报告。
Abstract-LoRA:通过定向 U-Net 模块训练解锁单图风格迁移
通过训练扩散模型特定U-Net模块的轻量LoRA,提升单图风格迁移的风格与内容平衡。
多视图运动恢复结构实现三维有向射影形状分析
多视图SfM实现三维有向射影形状分析,首次完成统计推断,验证三立方体蓝图假设,重建精度提高约26倍。
可解释的时序视频推理:EventGraph 与 EventField
提出结合离散EventGraph、连续EventField与可读EventGlyph的时序视频推理流程,子集准确率0.98,超越字幕基线和VLM,兼顾性能与可解释性。
多模态面部状态分析全面综述:任务、方法与资源
综述多模态面部状态分析的任务、方法与资源,融合多模态和多任务学习,提升表情、AU及软生物特征分析的可解释性。
面向高精度单目平面分割的逐像素平面性预测
提出逐像素平面性预测框架,融合深度与表面法线进行区域生长,实现高精度、高效的单目平面分割。
基于多尺度小波监督的图像外扩中主体清晰度保持
融合VLM语义引导与多尺度小波监督的图像外扩框架,显著提升主体清晰度,误差与FID均优于现有方法。
面向长视频理解的MLLM无关即插即用关键帧选择方法评测
评测5种免训练、MLLM无关的即插即用关键帧选择法:QAaF在15项中13项最佳,FOCUS次之。
TryOnReward:面向虚拟试衣强化微调的中心凹一致性学习
提出细粒度奖励模型TryOnReward,以中心凹校准与偏好监督缓解奖励劫持,提升虚拟试衣强化微调效果。
采样余量并非选择增益:视频世界模型测试时扩展的计算价值审计
视频世界模型测试时扩展,采样余量不等于选择增益,仅当额外计算能可靠转化为收益超成本的决策才有价值。
多模态大语言模型(如何)像人类一样报告双稳态图像?
多模态大模型对双稳态图像的报告可受视觉/语言线索调制且多为排他,机制涉及竞争表征与物体计数编码。
填补未见区域:基于3D高斯泼溅的场景外推
提出并行无冲突场景外推框架与分层流程,设计质量感知掩码选择性利用生成数据,避免重建退化并提升性能。
前向近红外对农机可通行性相较彩色相机增益甚微:传感器相关空间泄漏的站点分离评估
消除空间泄漏后,近红外在日间农机可通行性上并未优于彩色相机,原有优势为站点特定假象。
BEACON:面向特定主体视频生成的行为与外观控制
BEACON解耦身份与表情行为,以参考图和视频双条件生成,仅微调1%参数即提升特定人物视频表现力。
面向科学图表理解的结构令牌证据锚定推理
STEER 引入结构图编码、证据锚定推理与弱解析强推理对齐,强制每步运算引用图节点,在 ChartQA 等基准显著领先。
面向长上下文文档问答的能力路由视觉检索与证据串联
以能力路由、弱到强页选与视觉证据串联增强冻结VLM的文档问答,多基准提升。
GaugeDefect:基于特征传输曲率的表面异常检测
GaugeDefect 用特征传输曲率检测表面异常,经正常图像校准捕捉特征场局部不一致,提升细微缺陷定位。
基于投影绕序的帧同步手势检测
利用投影绕序零交叉实现帧同步手势检测,无需分类器、训练或标定,翻转检测率95%、平均误差6.7毫秒。
MODA 通用属性套件:面向时尚属性提取的四轨评测基准
发布MODA四轨基准,分离服装裁剪、商品图、全身照与文本评测,各轨独立指标且不平均,公开评分器与预测文件。
SomBench:推动月球科学机器学习发展的基准数据集
SomBench整合四任务十仪器30余层月球数据,空间对齐、机器学习就绪,分辨率1米至20公里,附基准任务与基线。
CANAL:医学图像分割中差分隐私特征蒸馏的通道感知噪声分配
CANAL按通道重要性分配差分隐私噪声,每图仅释放一次并诚实计费,医学分割同预算保留更多任务信号。
RxScribe Bench:面向印度门诊处方的视觉语言模型多轴评测基准
提出RxScribe Bench,按临床风险分四轴评测手写处方识别,发现无单一模型全面领先。
VectorHarness:从科学图形中恢复可编辑、关系保持的结构
提出VectorHarness多智能体框架,将科学图形重建为原生可编辑对象,并构建基准评估可执行编辑与关系保持能力。
LLaDA-UI:将分块扩散引入视觉语言GUI智能体
提出16.7B MoE分块扩散视觉语言GUI智能体,两阶段训练,多项基准超越Qwen3-VL-8B
GroundBench:用于定位VLM可供性失败的因子化、反事实基准
GroundBench以分支合并与反事实追问拆解信息,定位VLM可供性失败,发现性能常源于类别—动作关联而非视觉定位。
面向图案化结构异常检测的变分模板匹配与统计融合
提出变分模板匹配与KDE统计融合框架,无需训练实现结构化图像异常检测,性能媲美ResNet-50。