UC-VLM:基于视觉-语言大模型与一致性驱动的AI生成图像检测
提出UC-VLM统一多阶段框架,仅用二元标签监督,自动优化指令,复用标签增强视觉与文本输出,显著提升AI生成图像检测准确率。
基于共轭梯度的全局-局部正则化网络用于稀疏视图CT重建
提出CG-GLORE,二阶启发展开网络,结合共轭梯度与全局-局部正则化,实现稀疏视图CT高质量重建。
DCA-MoE:空间自适应跨层融合与密度路由专家的人群计数方法
提出DCA-MoE,用空间自适应层融合和密度路由专家计数,在NWPU-Crowd上MAE达31.7。
Robust structure from motion for aerial-ground images via detector-free feature matching and multi-view track refinement
基于运动感知扩散的无人机视频去模糊:通向稳健目标检测之路
提出运动感知扩散的无人机视频去模糊方法,通过自适应潜尺度和多帧门控,有效恢复细节并提升目标检测精度。
面向铁路图像质量评估的自监督拓扑不变流形学习
自监督拓扑不变流形学习免标注建质量参考经单调滤波与稳健融合在基准及铁路上验证零样本迁移与鲁棒性
锚点正则化自适应:基于DINOv3的泛化AI生成图像检测
提出ARA:LoRA捕像素伪影,冻结锚点保表征,混合数据提升泛化,9基准SOTA。
PersonaDrive:基于多维驾驶人格的可控轨迹预测
提出双轴(时间紧迫性、乘坐舒适性)九种人格数据集及语言驱动轨迹预测框架,实现多维可控预测,性能超基线。
边界对齐贡献路由用于鲁棒光学-SAR目标检测
针对光学-SAR融合中的负迁移,提出边界对齐路由机制,仅用检测监督调控模态贡献,显著提升全输入与缺失模态检测精度。
SAGE-OR:手术室的半监督自适应场景图生成
提出特征中心半监督框架,消除定位标注,用提示驱动实体增强,以轻量图变压器实现高效关系推理,性能接近全监督。
遥感语义变化检测的对抗鲁棒性研究
提出针对遥感语义变化检测的对抗鲁棒性评估框架,发现整体双时相预测路径决定鲁棒性,跨模型迁移较弱。
TinyDETR-Pose:面向端到端实时单阶段6DoF物体姿态估计的轻量级Transformer
提出轻量端到端单阶段6D姿态估计框架,免PnP/NMS/迭代优化,在YCB-V达85.9 AUC,参数量减少72.7%,Jetson Nano上仅4.5ms实时推理。
面向持续异常检测的记忆受限贪心采样延续
提出记忆受限的贪心采样延续法:固定内存下经贪心扩展与整合保持核心集代表性,理论有界,持续异常检测最优。
FMReward:基于人类偏好对齐与评估音频驱动的三维面部动画
构建人类偏好数据集,学习奖励模型,优化并评估音频驱动的三维面部动画,使其符合人类偏好。
SOS!:用于无模型分割的精简对象条件Transformer
提出精简对象条件变换器,仅用单张参考图,无需三维模型,统一掩码与目标识别,实现高效无模型未知物体分割,达新最优。
基于自适应秩聚类滤波器的图像去噪
提出基于Otsu聚类与模糊融合的空间局部去噪滤波器,对混合噪声鲁棒性优于多种基线算法。
用于4D占用预测的几何感知时空上下文建模
提出GAST法,结合显隐式生成与双路时空建模,几何保真高,mIoU提升7.67%,速度快2.84倍。
LightLoc++:面向高效室外LiDAR定位的传感器鲁棒表示学习
LightLoc++:跨传感器一致性学习,样本分类+冗余降采样,高效室外LiDAR定位,训练成本最低。
TEA:文本编码器对齐用于文本到图像模型的稳健概念擦除
提出TEA框架,仅微调文本编码器,零推理开销,有效擦除概念并抗对抗攻击,保持生成质量。
NumerosityVLM:一个受认知启发的视觉-语言模型数量表征解读基准
提出数量感知基准NumerosityVLM,含10800张受控图像;评估7个VLM发现架构主导性能差异,数量信号在视觉编码器早期出现。
用于极端CT重建的前馈分层高斯扩散
提出HiGDiff前馈分层高斯扩散,分解结构到细节,应对极端CT重建,多种退化下达SOTA,PSNR提升5.81dB。
ENAF:一种具有自适应补丁融合的多出口大图像超分辨率网络
提出ENAF动态网络,通过多出口和自适应补丁融合,估算PSNR分配图像块,提升超分辨率质量与计算复杂度权衡。
基于图约束多实例学习工作流的全切片图像报告生成分解
提出图约束多实例学习分解框架生成病理报告,器官条件图提升推理链与报告分数,外部验证器官路由是主要瓶颈。
CBX-Bench:用于概念瓶颈模型解释基准测试的类人对齐多模态大模型评议会
提出多模态大模型评议会,评估概念瓶颈模型解释质量,与人类判断高度一致,并发布CBX-Bench基准。
浑浊水下图像中分割噪声与不确定性的多标注者研究
首次多标注者研究浑浊水下图像分割,发现浑浊引入系统性标注误差,提出用特权信息与标注者集成改善质量。
ArtLang:面向关节式3D驱动的结构化语言-运动学绑定
提出ArtLang框架,将开放词汇语言映射到关节3D模型,通过语义-运动学图与图匹配实现连续关节控制,支持模糊指令。
HistReNeRF:当代神经辐射场重建中的历史图像重定位
HistReNeRF框架以DINOv2特征匹配NeRF光线,嵌入空间自适应,使平移/旋转误差平均降11%/16%。
JoLT:用于上下文引导的高分辨率分块生成的联合潜变量轨迹
JoLT联合去噪低高分辨率潜变量,低分辨率控布局,高分辨率控细节,生成细节丰富且美观的高清图像
AlignJEPA:面向遥感基础模型的预测式视觉-语言对齐
提出AlignJEPA,用轻量预测网络将遥感视觉特征与语言对齐,高效实现基础模型跨模态检索。
AlloEgo-VLM:消解视觉-语言模型中的异我中心与自我中心参照系歧义
为消解视觉-语言模型对异我/自我中心参照系的歧义,构建数据集并提出AlloEgo-VLM框架,经机器人实验验证有效。
空间锚定的流匹配:图像生成的结构化源分布
提出StructFlow,将空间局部性编码进源分布,像素共享噪声,改善局部编辑、结构保持与语义插值,并适配预训练模型。
CrossView:视觉语言模型能否跨摄像头推理?
多摄像头视频问答基准CrossView揭示,现有模型在跨视角推理上准确率低,开源模型与专有模型差距大。
EA-LiteUNet:面向边界敏感皮肤镜图像分割的边缘自适应高效U-Net
提出轻量U-Net(EA-LiteUNet),通过边界感知、注意力调制和资源自适应策略,在ISIC 2018上HD95降至12.89像素,Dice达92.08%,仅0.29M参数。
GLaQ:将潜在查询锚定于视觉证据以实现多模态推理
GLaQ:固定查询锚定视觉令牌,替代自回归潜变量,提升细粒度多模态推理,性能领先。
基于同步感知跨模态稀疏注意力的高效音视频生成
提出同步感知的稀疏注意力加速框架,保护关键令牌计算,在提升音视频生成效率的同时保持画质、音质与同步。
捕获视频-LLM问答中的幻觉引用:一种自验证流水线与验证器消融研究
提出自验证流程,以小型自然语言推理模型复核视频问答中的时间戳引用,捕获79%伪造引用且不误伤真实引用。
RigidBench:评估视频生成模型中的刚体物理
提出刚体物理评估基准,十项指标分离误差,发现无模型全胜,结构相似度越高轨迹误差越大。
PoseAdapter:面向复杂多物体场景的双流2.5D可控图像生成
提出轻量框架,以实例描述、边界框和三维角度为条件,双流表示实现高保真2.5D可控生成,消除属性泄漏。
EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input
RRFC:通过反馈条件化的递归细化实现迭代图像到图像生成
提出RRFC反馈条件化迭代细化,实验显示重建/身份任务有提升,语义布局任务下降
面向甚高分辨率遥感图像的分层自适应特征细化网络
提出分层自适应细化网络,结合阶段自适应融合、频率残差与类别先验解码,提升多个高分遥感分割数据集精度。
WorldRover:用于带丰富标注的世界探索的可扩展合成视频数据引擎
提出一个可扩展合成视频数据引擎,生成带深度、相机轨迹、光流等丰富标注的长时程世界探索数据,支持多视角。
可扩展的图像黑盒模型归因
提出原始块归因方法,以轻量网络在黑盒下高精度识别生成模型;数据高效、鲁棒,特征可迁移以适配新模型。
Gaussian-JEPA:面向3D高斯溅射的联合嵌入预测学习
提出高斯联合嵌入预测方法,从可见上下文预测高斯块特征,不重建属性;在重采样、部分观测下更鲁棒,优于重建预训练。
BASeg:结构惩罚的边界感知遥感分割
提出MABL损失与BASeg框架,增强边界形状一致性,建立10城市基准,提升遥感分割精度。
面向体育视频分析的无训练长期多目标跟踪
提出免训练的McByte++跟踪框架,提升体育视频中身份保持与速度,HOTA/IDF1显著提高。
健康与病理情况下的胎儿脑MRI自动生物测量
胎儿脑核磁自动测量:定位22个解剖标志,测11项指标;新网络误差更低,脑室肥大分类更准确。
反事实敏感度不等于可修复性:视频证据重放探针审计
CARVE:DESTROY较SHAM改答案多29.3个百分点;选538题增准3.26;作路由信号。