TRACE:基于有形重建和几何对齐上下文视频掩蔽的高保真3D场景编辑
TRACE:网格引导的3DGS编辑,几何对齐与视频掩蔽实现高保真、多视角一致的场景编辑。
Dynamic Execution Commitment of Vision-Language-Action Models
Leveraging Image Generators to Address Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping
评估GeoAI解释与卫星洪水制图中领域知识的一致性
提出一种评估框架,用量化方法检验深度学习解释与遥感领域知识的一致性,提升模型可解释性。
CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding
MolSight:面向统一化学图像理解的图感知视觉-语言模型
提出图感知视觉语言模型MolSight,融合分子拓扑与语义对齐,显著提升化学图像理解性能。
Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution
MI-CXR:多时间区间胸部X光纵向推理基准
提出MI-CXR基准,评估多访视胸部X光纵向推理,含三类任务;14个视觉语言模型平均准确率仅29.3%,暴露时序组合推理缺陷。
多模态扩散Transformer中概念遗漏的诊断与纠正
通过线性探针发现文本嵌入中的“遗漏信号”,提出OSI放大该信号,显著缓解多模态扩散模型的概念遗漏。
反提示:针对文本引导的图像到视频生成的图像保护
提出Anti-Prompt方法,注入不可感知扰动破坏文本引导视频生成,利用模型对文本依赖,实现高效跨模型保护。
戏剧小册子的大规模字体统计比较分析
提出量化历史书籍字体相似度的统计方法,应用于17世纪西班牙戏剧小册子,实现印刷商归属的新发现与修订。
Drawing-Recode:从光栅2D CAD图纸生成参数化CAD代码的标注接地框架
提出Drawing-Recode框架,提取几何与标注并显式接地,生成参数化CAD代码,优于现有方法,适用于工业扫描图纸。
无配对跨模态医学分类的共享语义码本蒸馏
提出共享语义码本蒸馏,无配对跨模态对齐,提升学生模型性能,两项医学分类任务优于基线
PanDent:迈向牙科放射学中全面的牙齿级结构-语言一致性
介绍PanDent基准,含9524张全景X光片及专家牙齿级标注;现有大模型报告流畅但临床一致性差,微调后显著改善。
ProgFormer:用于纵向脑MRI预测的层次化体素扩散Transformer
提出层次化体素扩散Transformer,粗路径预测整体结构,细路径细化局部变化,无需自编码器,直接生成未来脑部MRI。
VETO:保护图像免受前沿AI编辑篡改
提出VETO防御机制,干扰现代图像编辑模型读取源图像,并发布VetoBench基准,在双重评估中优于现有防御。
IGME:高效链式方法集成用于可迁移语义分割攻击
IGME以单一源模型链式集成攻击组件,共享梯度并使用积分梯度路径平均,高效实现可迁移语义分割攻击。
VideoCoCo:通过智能体双引擎系统,以代码为思维链实现物理一致的视频生成
VideoCoCo以Blender代码为思维链,双引擎生成物理一致视频,两大基准最优。
OVEarth-Bench:评估开放词汇对地观测的类别广度与查询多样性
提出OVEarth-Bench基准,扩展类别广度与查询多样性;评估发现现有方法性能有限,多模态大模型最优,专用方法落后。
Bunraku:将单张插画转化为可编辑的Live2D角色
首个从单张插画生成完整Live2D资产(分层、网格、动画)的系统,采用分层扩散与联合预测实现。
MPIE-Bench:面向解剖合理的多人交互编辑基准测试
新基准MPIE-Bench用网格重建评估多人交互编辑,解剖与接触轴分数低,VLM评估过饱和。
学习色彩分级,无需照片共享:面向个性化图像增强的联邦美学偏好学习
提出联邦美学偏好学习框架,无需共享照片,用轻量评分器指导调色,在保真与自然间取得平衡。
MeshFM:二维特征足以实现三维形状理解
MeshFM将2D基础模型特征蒸馏至3D,免3D标注,前馈预测,下游任务媲美3D监督方法。
ZMIS-SAM:小波变换增强的浮游动物显微图像实例分割模型
提出ZMIS-SAM,结合SAM与小波,解决浮游动物显微分割的三大问题并达最优性能。
目标对齐的直接答案监督微调用于鲁棒多帧医学视觉问答
目标对齐直接答案微调是医学视觉问答最强鲁棒方法,提升准确率,稳定可校准可迁移,胜过复杂方法。
BlindPSNR:低光图像增强的无参考保真度预测器
提出BlindPSNR无参考预测器,融合增强图与低光输入估计PSNR,将配置选择准确率从54.4%提至89.5%,泛化强。
MedXplore:迈向医学影像中可靠且无偏的广义类别发现
提出MedXplore框架,从感知与决策层面优化医学图像广义类别发现,提升病变敏感表示,缓解旧类偏差,平均精度提升8.5%,显著降低假旧错误。
多模态大模型越界上下文评估综合基准MMOOC
提出MMOOC基准,含4.1万图像-问题对,评估多模态大模型在上下文偏移下的拒答与鲁棒回答能力,发现现有模型难以平衡两者。
推理时智能体决策规则优于更长演化搜索的多图像医学推理
多图像医学推理中简单顺序投票规则优于复杂搜索,延长演化搜索无益,正确决策规则更重要。
4DHumanDiff:直接文本到4DGS生成,实现一致360度动态人体
文本直接生成360度一致的4D动态人体,免视频预生成,推理提速超10倍。
JigShape:通过拼图评估视觉语言模型中的视觉-几何推理
提出拼图基准JigShape,发现VLM零样本几何推理薄弱,更大网格上性能骤降,构成开放挑战。
见证证据组合:闭合多模态答案的单次预填充风险检测
WEP方法利用白盒预填充逐层估计视觉证据,融合置信度,在3模型4基准上错误AP平均提升0.134。
PrintAnything:学习面向3D打印G代码生成的中间表示
提出新框架,直接由点云生成G代码,免网格重建,采用切片投影与几何规划图。
RefineSVG:视觉反馈驱动的强化学习用于图像到SVG生成
RefineSVG提出视觉反馈闭环框架,通过渲染对比与强化学习自纠错,实现高保真图像到SVG生成。
推理前先校准:面向VLM语义漂移的稳健视觉令牌缩减
提出CaRe框架,推理前校准视觉表示以抗语义漂移,剪除94.4%令牌仍保96.4%性能,速度提升2.3倍。
基于静止状态观察的关节物体重建
从静止状态重建铰接物体,用网格融合多模型输出,借视频扩散合成运动假说并验证,实现无运动观测的关节估计。
通过身份解耦与几何保持的面部蒸馏实现私有面部识别训练数据集发布
提出身份解耦与几何保持的面部蒸馏框架,降低源身份关联性并保持代理身份几何,提升私有FR数据集发布的效用。
EgoGVAE:基于引导变分自编码器的自我身体网格重建
仅凭头部姿态重建全身网格;利用引导变分自编码器潜空间对齐分布,单步采样比扩散法快五十倍以上。
CXR-Retrieve:胸部X射线摄影中的组合式文本到图像检索
提出CXR-Retrieve基准与标签感知对比微调,在联合查询和否定查询上显著提升胸部X光检索精度。
DS@GT ARC 参加 ImageCLEFmedical 2026:医学图像分析中概念检测的架构多样性与字幕预测的基础模型扩展
任务1集成夺冠(F1=0.579),KNN免训练媲美;任务2微调Gemma-3第三(0.357)。
FDDWAN:面向水印攻击的频率解耦扩散网络
提出频率解耦扩散水印攻击网络,经小波分解与残差扩散细化,在抑制水印与保持视觉保真间取得更优平衡。
EEG-EditBench:用受控图像编辑探查EEG-图像检索模型的视觉信息
提出EEG-EditBench基准,通过受控编辑探查EEG-图像检索模型,细粒度属性最难,揭示隐藏行为。
思考一次便足:高分辨率视觉问答的中间层证据路由
免训练单次视觉,路由中间层证据,不额外编码即提升高分辨率视觉问答,均分约+3,内存降。
SPFM-Net:语义先验引导的频率约束Mamba用于隐形水印攻击
提出SPFM-Net,以语义先验引导频率约束Mamba,通过掩码重建与全局状态空间建模捕捉全局水印依赖,多级约束下兼顾攻击效果与视觉保真。
SAFViT:基于视觉Transformer的细胞核分割与分类的空间注意力融合门控
提出SAF门控替代跳跃连接,提升Dead类检测,PanNuke上mPQ最高达0.471。
纵向医学视觉问答综合基准LoMeVQA
提出纵向医学VQA基准LoMeVQA,含20.6万问答对,覆盖五任务;现有MLLM表现差,新模型MedLong-8B达最优。
VCP-DCN:超越视觉隐藏属性,通过深度协作网络实现伪装目标检测
提出VCP-DCN深度协作网络,通过原型嵌入、双注意力及自适应注入,分阶段对齐交互融合RGB-D特征,提升伪装目标检测性能。
FeatFix:通过局部精确特征校正复用已验证内容,加速缓存扩散推理
在稀疏层-时间步处用已验证精确特征替换草稿输出,修正残差,加速缓存扩散推理,提速6.7倍且质量几乎不变。
基础模型与大型语言模型在少样本医学图像分割中的基准评测
提出FAME基准,评估少样本医学图像分割模型,发现直接视觉适应优于提示策略,语义迁移比域适应更难。
幻觉留下接地签名:验证器引导解码用于选择性对象纠正
提出基于内在接地签名的验证器引导解码,选择性纠正对象幻觉,保留真实覆盖,达SOTA效果。