免标定孔径衍射的紧凑型快照光谱成像
提出免标定快照光谱成像法:仅用衍射透镜、二元掩膜和拜耳传感器,实现全分辨率重建,并设计高效重建框架。
OPUS-V2:弥合稀疏点与稠密体素之间的差距
OPUS-V2引入轻量点-体素变换模块,将稀疏预测映射为稠密体素,消除手工启发式,提升精度,适应任意分辨率,实现实时最优性能。
基于贝叶斯优化的超像素-GrabCut可追溯视盘分割
提出可追溯可训练视盘分割流程,结合超像素与GrabCut,贝叶斯优化超参,Dice达0.9536,媲美深度学习,透明可审计。
RLG-TPV:雷达与激光雷达引导的三视角融合用于相机-雷达3D目标检测
RLG-TPV:雷达激光引导三视角融合,相机-雷达3D检测,mAP0.4981,NDS0.5959。
面向三维场景重建的无约束图像集合地面-卫星定位
提出层次化跨视角定位,结合SfM约束与核密度估计,实现无约束图像到卫星定位,支持尺度估计与重建合并。
泛化超越记忆:面向单图像多视角合成的泛化感知扩散适配
泛化超越记忆框架:场景分离验证与扩散适配,单图多视角合成夺冠,证小数据下验证设计与训练轨迹控制关键。
PERSIST:用于镜头边界检测的持久状态判别
提出持久状态判别方法,将镜头边界检测转为语义判别,大幅削减误检并保持召回,与最强检测器表现持平。
QCell:重组与对齐细胞查询用于重叠实例分割
针对显微镜下重叠细胞分割,提出QCell模型,通过实例重组与对比查询对齐,在多个基准上超越现有方法。
先定位后阅读:基于紧凑视觉语言模型的统一PCB工程图纸解析
采用先定位后阅读课程,令紧凑视觉语言模型直接解析整页印刷电路板图纸,免检测器,定位指标显著提升。
LightFuse:基于多扫描融合与二维高斯光线追踪的可重光照交互式场景重建
提出LightFuse,用2D高斯与光线追踪分解材质光照,支持交互重光照,重建质量最优。
RAGDiffusion++:从宏观检索到微观保真对齐的服装生成
提出RAGDiffusion++,用强化学习与对抗正则解决高频纹理崩溃和伪影,实现服装微观保真。
3D-MRL:基于套娃表示学习的嵌套多模态三维表示
提出3D-MRL,用套娃学习对齐点云与CLIP嵌入,单模型支持多维度表示,零样本和少样本识别性能提升。
AGRICAM:轨道式作物授粉监测机器人
提出轨道式作物授粉监测机器人AGRICAM,在蓝莓农场部署验证,成功绘制授粉时空分布,支持授粉管理决策。
基于证据融合与冲突折扣信念聚合的不确定性感知多模态反无人机检测
多模态证据融合用于反无人机,但冲突折扣因基准低冲突无效;精度略优,定位失败检测弱于空间方差。
像素空间扩散Transformer的弹性词元压缩
提出RTI:按希尔伯特序切割特征骤变处,池化为区域词元,随机区域数,两倍速保质量。
DARD:零样本退化感知Retinex引导扩散用于低光图像增强
提出零样本退化感知Retinex引导扩散,用于低光增强,性能优于现有零样本基线。
基于诊断引导的候选回收实现视频扩散模型测试时扩展
无训练框架GEARS,通过诊断引导回收低分候选,循环编辑修复,以1.3B模型性能比肩14B,超越现有视频TTS方法。
GenFirst:重建前生成,实现稳定的端到端潜空间生成建模
提出先生成后重建的GenFirst,避免潜空间崩溃,实现稳定端到端生成,图像与文生图均优。
神经视频编解码器质量评估数据集与基准
提出大规模主观数据集,涵盖神经与传统视频编解码器,众包成对比较评分,用于质量指标基准测试。
FISICA:基于本体推荐的可部署足底压力与姿态评估服务
FISICA生产级体态评估服务,双照片测足压与姿态,规则控制推荐,语言模型解释,3D虚拟人验证脊柱指标。
Hyper3-CLIP:层级条件双曲视觉-语言训练
融合层级条件双曲空间与查询条件池化,实现全局-局部对比学习,提升跨模态检索与多标签分类性能。
GSPotential:面向稀疏视角三维高斯泼溅的相机势场
提出GS势场法,量化视角监督不均,引导相机采样与保守高斯更新,实现稀疏视角高保真高效重建。
思考、审视与修正:多模态大模型中的不一致感知视觉自我校正
提出ReVISE框架,让多模态大模型验证工具输出、检测错误并动态恢复,通过训练与强化学习减少空间偏差,提升复杂视觉推理表现。
Sketch2Inspire:产品检索的结构敏感评估
提出草图灵感基准,区分类别与结构检索,多模态融合最优,支持结构敏感评估。
AOI-Net:用于自闭症谱系障碍检测的结构性面部AOI引导眼动轨迹表征学习
提出面部AOI引导网络,融合时间与结构特征,缓解类别不平衡,临床大数据上优于现有方法,实现可解释ASD筛查。
FiLM-GPNet:面向大型时间序列InSAR堆栈的几何感知伪监督相位恢复与零样本泛化
提出几何感知伪监督FiLM-GPNet,利用特征调制和几何描述符恢复相位,经闭合一致性约束,降低时间残差与闭合误差,零样本泛化强。
文本引导的扩散模型对胸部X光图像的对抗性攻击
提出文本引导扩散对抗框架,通过图像先验而非像素扰动攻击CXR分类器,性能下降最大且图像保真度高,揭示人机判读差异。
穿透极端视觉稀疏性:从单个随机视觉补丁理解表面
提出SSUF双任务框架,用四种预训练模型在10%可见图像下重建和分类;Swin分类最佳,MAE重建最佳,ViT均衡。
FuncRoom-Agent:顺序前馈式三维功能性室内场景生成
提出功能房间生成新任务,用递归DSL与前馈构建免迭代修复,结合执行过程奖励达最优。
GATE:面向视觉-语言模型免训练测试时自适应的可靠性门控高斯证据融合
提出GATE,免训练融合文本与图像高斯证据,经可靠性门控校正,显著提升视觉-语言模型测试时自适应精度。
零样本异常检测中基于跨类别迁移的协同进化提示优化
提出CoEvoAD,用进化算法搜索离散自然语言提示,引入跨类别迁移,提升零样本异常检测,达SOTA。
Polis:城市尺度3D自监督学习
提出Polis,城市尺度三维自监督,城区基准领先,但地面局部数据反转。
自动化无损评估图像分析的视觉问答模型
提出面向无损评估的视觉问答模型,结合深度特征提取与语言生成,支持交互式问答,提升检测效率与准确性。
前视声纳与3D声纳的标定及对比分析用于增强水下目标识别
提出两种声纳模态自动标定滤除噪声,自动标定较手动提升5%,滤波使特征提取相对原始点云提升超40%。
GeoAgent:通过具身导航评估视觉语言模型的地理定位能力
GeoAgent基准:智能体通过具身导航细化地理定位;VLM难辨区域模式,导航提升精度,且存地区偏见。
ARMOR:数据稀缺下用于对抗鲁棒航空目标检测的流形导向训练
提出ARMOR,用流形导向训练(掩码背景+注入补丁)提升数据稀缺航拍检测对抗鲁棒性,干净性能超九成。
基于艺术史智能体的绘画风格分析
提出AI框架,用视觉Transformer和稀疏字典学习提取画作特征,经大语言模型生成风格描述,实现自动化风格分析。
nnMNet:火星地形语义分割的基线模型
提出新基线nnMNet,融合线性注意力与轻量卷积,引入SAFB,在三个火星数据集上达到最优。
见变化,守连贯:基于频谱-时间表征学习的无监督动作分割
提出频谱-时间表示学习框架SpecT-OT:频谱投影器与时序正则化增强最优传输伪标签,无监督动作分割,15项指标中13项最优。
SnapBench:面向移动交互的即拍即问多模态检索基准
首个即拍即问多模态检索基准,含53种退化条件,发现图像退化严重影响检索,提出自适应融合方法。
MotionSync:非因果精化因果跟踪器,赋能标签高效3D感知
MotionSync在因果跟踪器上加非因果细化,25%标签即达96.9%全监督mAP,并可自训练改进。
TRINITY:个人风格视频高光检测的多视角基准
提出TRINITY基准,将视频高光分解为事件、情感、自然三维度,多分支架构并行预测,显著优于基线。
CineForge:面向长时程视频生成的自我改进智能体
CineForge通过跨故事策略演进实现自我进化,将视频生成指标从4.024提至4.380,并减少37%审查调用。
大型视觉语言模型中的护栏无关社会偏见评估
提出去耦评估法规避护栏拒答,揭示LVLM在人物无关任务滥用人口统计信息,闭源偏见较低。
SPLG-Mamba:面向光学遥感图像显著性目标检测的结构保持局部-全局Mamba网络
提出SPLG-Mamba,集成平滑细节重校准、局部-全局Mamba和门控跨尺度融合,在三个数据集上取得最优且结构更完整。
NepScript Genesis:用于手写天城文数字合成的神经架构搜索
提出NAS框架自动生成手写天城文数字,FID降76.19%,数据增强提升分类准确率5.5个百分点。
低资源语言能互相借鉴什么?
提出PSMC框架,融合跨语言专家,提升低资源OCR识别率,在10种印度文字上平均提高2%。
重新审视长时程流式三维重建中的局部上下文
提出ABot-Recon,仅缓存11帧KV特征预测局部点图与位姿,组合恢复全局,减少漂移,长序列基准精度显著提升。
ShiftSplit-AD:在基础特征视觉异常检测中分离域偏移与缺陷
将残差分解为低秩与行稀疏,仅用稀疏分量评分;能提升域偏移下性能,但会损伤干净样本检测,存在权衡。
VidParse:专业级在线解析第一人称操作流程
无需训练,基于图约束与时序相似性在线解析第一人称视频步骤,精度提升10倍。