AxonSynth:面向光片显微镜零样本三维轴突分割的域随机化合成数据
AxonSynth以域随机化合成数据实现光片显微镜轴突零样本3D分割,无需真实标注。
针对CLIP中隐蔽嵌入空间后门的区域级黑盒防御
CLIPGuard通过分段嵌入扰动检测并语义修复可疑区域,黑盒防御CLIP嵌入空间后门。
INRs 能走多远?面向脑部 MRI 的跨域参数高效 INR 语义分割
探究INR脑MRI分割跨域表现:低参数下优势显著;提出分层架构HierINRSeg,Dice最多提升8.2个百分点。
面向可解释关键安全视野评估的结构化推理智能体框架
提出结构化推理智能体框架,以场景图与子准则验证分解CVS评估,实现可解释判读,mAP达68.1%。
OC-GS:面向不规则转台采集的高斯泼溅重建
OC-GS以共享运动模型联合优化图像几何与视角,显著提升稀疏不规则转台采集的重建质量。
GraphWrit3R:端到端三维场景图生成
GraphWrit3R以点云或高斯泼溅为输入,端到端输出JSON三维场景图,免真值标注,在3DSSG上达SOTA。
FreshLatent:面向资源受限具身VLM感知的信道感知潜空间适配
冻结VLM、仅训练轻量信道感知潜适配器,0 dB下分割精度显著提升,参数与能耗远低于重型编解码方案。
FuseReg:正则化层融合缓解表征自编码器中的重建-生成差距
FuseReg以随机编码器层子集训练正则化融合,单解码器适配多融合,缩小重建-生成差距,gFID降29%。
取证双生:面向AI生成图像取证的自监督残差学习
提出自监督残差学习框架,仅用真实图像训练,可零样本检测27种未见AI生成器,AUC达97.99%。
VkVIO:基于Vulkan的跨平台GPU加速视觉惯性里程计
首个基于Vulkan的跨平台GPU加速视觉惯性里程计VkVIO,多设备实时高精度,性能超越CUDA方案。
WALT:为自动驾驶学习世界模型对齐的潜在轨迹
提出WALT:将原始轨迹映射到紧凑潜空间,与冻结驾驶世界模型对齐,提升NAVSIM规划性能并降低30.5%算力。
基于未训练神经先验的相位图像重建
提出两阶段投影框架,融合傅里叶相位、空间支撑与未训练神经先验,重建显微图像优于仅约束基线。
仅凭像素能否揭示图像来源?被动溯源的极小极大极限与可学习接口
仅凭像素溯源存在极小极大极限,公开验证器在对抗编辑下可被绕过,需分评估统计上限与接口信息。
基于交互中心建模,实现双指夹爪操作的统一跨域表征
交互中心框架统一双指夹爪表征,融合VLM与流匹配Transformer,实现跨本体零样本仿真到现实迁移。
用于医学图像分析的量子扩散模型
提出可扩展混合量子扩散模型,以离散时间量子游走实现前向扩散,经典模型反向去噪,可处理大规模医学图像。
TempQ-Jail:面向文本到视频越狱攻击的查询受限候选排序
该法将T2V越狱建模为查询受限候选排序,融合多机制评估攻击价值,有限查询下优先输出高价值攻击,提升成功率。
普适漂移校正用于多维扫描显微术
将二维正交扫描漂移校正扩展至光谱与衍射多维数据,结合仿射与非刚性校正,无需先验模型,开源GPU加速,实现自动化定量显微漂移校正。
面向低延迟音视频目标说话人提取的个性化语音增强适配
AV-PVQE基于个性化语音增强,融合嘴部特征微调,低延迟提取目标说话人,混淆率46%降至1.6%。
FeatMark:面向扩散模型模仿攻击的特征级水印保护
FeatMark将水印转为语义微特征,经掩码引导编辑注入,可抵御多种去除与自适应攻击,兼顾保真与鲁棒性。
利用预训练扩散模型和多模态条件增强摄影测量数字表面模型
用预训练扩散模型和多模态条件精化摄影测量DSM,融合卫星影像,减少噪声空洞并显著降低城市高程误差。
FlatClip:用于fMRI表征学习的几何感知表面级基线
FlatClip以几何感知flatmap复用冻结图像编码器,构建ROI与体素模型间的折中基线。
探索视觉基础模型在无监督域适应中的优势
视觉基础模型与无监督域适应结合,可提升语义分割性能与分布外泛化,并显著加速推理。
RECAST:从日志回放到视图完整参与者的闭环驾驶仿真
RECAST用3D高斯泼溅从单帧观测生成视图完整演员并注册入场景,支持闭环仿真,大幅提升无碰撞率。
以端点约束轨迹优化引导端到端驾驶模型
提出ECO后处理层,固定预测端点并重塑中间路径点,无需额外训练,显著提升多种端到端驾驶模型的闭环性能。
基于多实例学习的胎儿超声先天性心脏病全检查筛查
两阶段多实例学习框架直接对胎儿超声全检查筛查先心病,内部AUC0.985,外部适配后0.944。
ChronoFuseGS:具有逐Splat持久性与变化可视化的多时相高斯融合
提出多时相高斯融合方法ChronoFuseGS,合并各时相独立训练模型,支持增量扩展与子物体级变化可视化,新视角合成优于单时相模型。
基于视觉的机器人布料展开六自由度抓取位姿估计
提出CeDiRNet-6DoF框架,联合预测最优抓取点与完整6自由度位姿,实现机器人布料展开,性能达最优。
InternW0-Δ:以超2万小时开放数据连接预测动力学与动作的世界动作模型
InternW0-Δ统一世界动作模型,以MoT融合视觉动态、语义与4D先验生成动作;构建2万+小时开放数据,仿真与真机表现领先。
TemplateCraft:智能体驱动的视觉模板生成
提出多智能体系统TemplateCraft,可将自然语言指令转为可执行视觉模板,提升生成成功率与风格一致性。
面向婴儿运动分析的不确定性感知联邦学习
首个婴儿运动分析联邦学习框架,利用预测不确定性改进聚合,性能接近集中式并优于FedAvg。
SonicMesh:利用声学信号增强视觉受损环境中的三维人体网格重建
首个声学-视觉三维人体网格重建框架,通过ISAR声成像与跨维度配准融合,在弱光及遮挡下鲁棒重建。
面向时间序列异常检测的可视化技术适配:从卷积神经网络到卷积循环神经网络
研究适配显著图与Grad-CAM于CNN+RNN时序异常检测,提升可解释性,克服TimeDistributed层挑战。
LadderMIL:基于由粗到细自蒸馏的多示例学习
提出LadderMIL,通过由粗到细自蒸馏提供实例级监督并编码包内上下文,病理任务指标平均提升。
锚定以扩展:面向个性化文本到图像扩散模型的语义锚定
提出语义锚定个性化(SAP),将新概念学习与先验保持统一为锚定学习,兼顾主体保真与文本对齐。
VFM-UDA++:改进面向无监督域自适应语义分割的网络架构与数据策略
VFM-UDA++优化多尺度特征、ViT兼容损失与数据策略,提升无监督域自适应分割并受益于更多数据。
无监督视频质量提升方法:复原与增强技术综述
综述无监督视频复原与增强技术,涵盖退化成因、方法分类、损失函数及未来方向。
RefRef:用于重建折射与反射物体的数据集与基准
现有方法难处理折射反射材料且缺专用数据集;提出RefRef(150合成+60真实场景)及基准,评测表明任务远未解决。
OSPO:面向文本到图像生成的以对象为中心的自改进偏好优化
提出OSPO自改进框架,无需外部数据,构建对象级偏好并加权损失,提升细粒度图文对齐、减少物体幻觉。
面向可解释视觉识别的空间信息瓶颈
提出空间信息瓶颈S-IB,从信息论解耦前景/背景信息流,优化VJP空间结构,提升解释质量与分类精度。
在视觉基础模型(VFM)时代,无监督域适应(UDA)的附加价值是什么?
合成源增强使UDA增益从+8降至+2;真实多样源无增益;合成场景仍优,1/16标签达85mIoU。