文本照明:面向语言引导医学图像分割的空间对比Retinex学习
提出文本照明Retinex网络,以文本嵌入调制特征,正负照明图对齐前景背景,多尺度监督,达医学分割SOTA。
CSD:内容感知的投机解码以实现高效图像生成
提出内容感知投机解码CSD,通过熵概率松弛与最优重采样动态调整接受率,加速图像生成并提升质量。
ScaLe-INR:尺度与学习隐式神经表示
ScaLe-INR通过多分支架构和方向边缘引导损失消除频谱串扰,在图像、音频、3D重建中显著超越现有方法。
可控的组织病理学图像合成:无需训练的结构初始化和纹理调制
提出CHIS框架,通过结构初始化和纹理调制,让无标注预训练扩散模型生成符合先验掩膜的高保真组织病理图像。
面向O(2)离散子群等变的视觉Transformer统一框架
提出O(2)离散子群等变ViT统一框架,理论保证子群嵌入与表达能力,构建D6模型,实验表明等变提升识别准确率。
OrthoTryOn:基于几何正交化的无冲突统一时尚生成
OrthoTryOn通过正交子空间投影与Fisher引导负梯度,消除任务间冲突,实现统一时尚生成并超越独立模型。
带有遮挡恢复的局部和全局人体运动长期预测
提出非自回归时空注意力Transformer,实现局部和全局人体运动预测,并具备遮挡恢复能力。
A Multi-Attribute Latent Space for Visual Analysis of Watches
去而复返:面向多曝光融合的灵活帧数Transformer
提出FreeMEF,首个灵活帧数Transformer,通过递归状态空间和全局特征引导,实现任意数量曝光帧的无缝融合。
课程引导的变化检测训练:迈向精准的冰塔崩塌监测
提出课程学习框架,利用太阳角差距和结构相似性度量难度渐进训练,提升变化检测鲁棒性,优于均匀采样。
ReScene:多视图捕获下的结构化室内场景重建
ReScene通过多视图几何与关系感知组装,实现物理一致的高质量场景重建,精度提升且速度比先前方法快10倍。
使用Token激活图理解多模态大语言模型如何描述艺术品
TAM揭示MLLM描述艺术品的视觉依据因语义类别而异,作品识别准确率有差异,并与SAM比较。
指挥世界:基于组合式人-摄像机控制的快速自回归视频生成
提出快速自回归框架,解耦人运动与摄像机控制,以快慢记忆训练实现长程稳定、高视觉质量的视频生成。
基于蒙特卡洛树搜索的潜在视觉扩散推理
提出LVDR框架,用MCTS建模可视化推理,提升技能评估准确性与可解释性。
HumanMoveVQA:视频多模态大模型能否推理人类运动?
提出HumanMoveVQA基准,评估视频模型对全局轨迹和方向推理,发现能力差距,但微调可显著提升。
EMOSH:用于人体动画的表现性运动与形状解耦
EMOSH通过显式解耦形状与姿态,实现高保真可控人体视频生成,解决形状泄露并增强表情手势控制。
TempAct: 通过规划器-执行器强化学习提升自回归视频生成的时间合理性
TempAct采用规划器-执行器强化学习,通过分层探索与奖励机制,提升自回归视频生成的时间一致性与质量。
AirGroundBench:异构多视角具身协作下多模态大模型的空间智能探测
提出AirGroundBench,评估异构空-地多视角空间智能,发现模型跨视角对齐与推理薄弱,双视角虽提升但距人类仍有差距。
RPM-Distill: 生理引导的自适应跨模态蒸馏用于鲁棒的远程生理测量
利用雷达辅助视频,通过频谱知识蒸馏提升远程生理测量的鲁棒性,在挑战条件下MAE降低81%,相关性提升21%。
TextDS:分布偏移下场景文本检测的参数高效表示对齐
TextDS提出参数高效框架,含双编码器与逐步LoRA,仅4.9M参数实现分布偏移下鲁棒场景文本检测。
利用测试时自适应学习拓扑感知的异常分割表示
提出TopoTTA框架,将拓扑持久同调融入测试时自适应,增强异常分割结构一致性,在多个基准上平均F1提升15%。
通过去噪器响应的谱耦合进行扩散模型归因
利用去噪器谱几何特征提取稳定签名,SDS方法以99.9%准确率非侵入式归因扩散模型。
基于级联扩散先验和UV空间可微着色的单目虚拟人像重建
用级联扩散先验和UV空间可微着色,从单张图高效重建4K可重光照虚拟人像。
Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training
EchoSonar-R: 一种支持多视角推理的超声心动图疾病分类与报告生成模型
EchoSonar-R通过多视角推理与强化学习两阶段训练,显著提升超声心动图疾病分类与报告生成的准确性和可解释性。
RSICCLLM:一种用于遥感图像变化描述的多模态大语言模型
提出RSICCLLM后训练框架,以差异感知微调和双负偏好优化,7B参数超越大规模模型。
尺度空间度量的稳定性研究
研究高斯尺度空间度量的稳定性,量化对几何变形和噪声的鲁棒性,引入旋转不变版本并给出高效算法。
增强共封装光学硅光子安全保证的硬件指纹技术
在硅光子芯片填充区嵌入光子晶体,产生独特光学签名,实现低成本高分辨率硬件指纹认证。
DIM-WAM:具有多样化历史事件记忆的世界-动作建模
提出记忆增强模型,融合多尺度历史与任务进度,长程任务成功率从28.4%提升至69.8%。
感知准则:将多模态评估校准至人类感知
提出感知准则框架,通过双流准则与门控评分揭示模型脆弱性,验证严格感知保真度是可靠生成的前提。
翻译作为桥接动作:将操作技能从人类迁移到机器人
提出桥接动作表示(相对手腕平移),从人类数据迁移技能到双臂机器人,比6DoF更有效且可扩展。
StructSplat:基于未标定稀疏视图的可泛化三维高斯泼溅
提出结构化表示与像素对齐特征注入,无需相机参数即可泛化重建三维高斯泼溅,性能大幅领先。
PIAA-ZWFS的可微设计:一种逼近基本极限的灵活波前传感器
提出PIAA-ZWFS波前传感器,采用可微设计逼近基本极限,性能优于传统ZWFS,且不牺牲动态范围。
基于生物物理皮肤反演的RGB光谱次表面散射
本文提出光谱光学反演,从RGB反照率预测皮肤全光谱散射参数,用于路径追踪渲染。
从损坏观测中训练清洁扩散模型的期望最大化算法
EMDiffusion通过期望最大化迭代重建与优化,从损坏观测训练扩散模型,在成像逆任务上达新SOTA。
跨越极端复杂度和质量尺度的增强型神经视频表示压缩
提出NVRC++编码器,以轻量INR多特征网格实现跨复杂度稳定性能,解码速度提升7.6倍。
MVGS:多视图正则化高斯泼溅用于新视角合成
提出多视图训练范式,结合交叉内参引导与稠密化策略,提升3D高斯泼溅的重构精度与视角合成质量。
基于Gershgorin盘对齐的图展开与采样用于过渡视频关键帧选择
通过Gershgorin盘对齐快速图采样,线性时间选出关键帧,性能相当或更优,复杂度显著降低。
VLM引导的视觉地点识别用于行星尺度地理定位
提出VLM引导混合框架,结合检索与重排序,在街道和城市级别分别提升4.51%和13.52%,实现可扩展、鲁棒的高精度地理定位。
细粒度行为与车道约束引导的轨迹预测方法
提出BLNet双流架构,通过并行注意力融合行为意图与车道约束,提升轨迹预测精度。
基于图像的机器人地理定位:黑盒视觉语言模型是否已就绪?
黑盒VLM零样本地理定位:粗定位有效,细粒度定位因现实变化而不可靠。
Web2Grasp:从手-物交互的网络图像中学习功能性抓取
利用网络手-物交互图像,通过3D重建与交互模型学习功能性抓取,仿真和真实实验成功率分别达75.8%和77.5%。
SurgXBench:用于手术的可解释视觉-语言模型基准
评估手术视觉语言模型零样本性能,发现其依赖弱上下文而非临床证据,需加强视觉推理监督。
StableMotion: 基于扩散先验的单步运动估计
StableMotion利用扩散先验实现单步运动估计,在图像矫正任务中达到SOTA,速度提升超100倍。
DIVER:强化扩散打破端到端自动驾驶中的模仿瓶颈
DIVER用强化学习引导扩散生成多样轨迹,打破模仿学习瓶颈,提升端到端自动驾驶泛化能力。
SRMA-Mamba: 面向MRI体积中病理性肝脏分割的空间反向Mamba注意力网络
提出SRMA-Mamba网络,利用空间解剖Mamba和反向注意力机制,实现MRI体积病理性肝脏高效分割,超越现有方法。
QuantV2X: 面向协同感知的全量化多智能体系统
QuantV2X首次实现全量化多智能体协同感知,在低比特下精度媲美全精度,延迟降低3.2倍,mAP30提升9.5。
让语言约束几何:视觉-语言模型作为3D生成的语义与空间评判器
VLM3D利用视觉-语言模型的双查询批评信号,优化语义对齐和空间一致性,显著提升3D生成质量。
基于高级模态条件与交互的文本到有声视频生成控制
提出HVGC解耦字幕框架和BridgeDiT双塔扩散变换器,实现跨模态同步,达到SOTA性能。