基于信念自蒸馏的用户模型提取
BSD框架通过自蒸馏学习可读写的用户信念表示,揭示拒绝取决于模型推断的用户意图,且跨模型几何一致。
不学停止而学会停止:自监督置信度训练提升推理效率
自监督置信度微调无需优化长度或早停,即可在保持精度下减少最多25%推理token。
游戏竞技场:竞争环境中的大语言模型战略评估
推出Kaggle游戏竞技场,以象棋、扑克、狼人杀等对抗游戏动态评估大模型的战略规划与不确定性适应能力。
针对CLIP中隐蔽嵌入空间后门的区域级黑盒防御
CLIPGuard通过分段嵌入扰动检测并语义修复可疑区域,黑盒防御CLIP嵌入空间后门。
软件架构中什么仍将属于人类?一项焦点小组报告
焦点小组探讨AI辅助软件架构,认为架构决策、问责与护栏制定仍属人类,提出治理工程与认知债务概念。
域偏移下以教师为锚的训练后量化模型选择
研究域偏移下标签缺失或稀少时的量化模型选择,教师锚定可降低小标签预算下的选择遗憾,标签增多后优势消失。
编码智能体还不够!面向智能体化云调查的企业安全大脑评估
Sola安全大脑在28项云安全调查任务中覆盖率达0.693,远超通用编码智能体的0.387,成本更低。
多智能体在析取型与补偿型任务上的规模化扩展
任务结构决定多智能体扩展:析取型任务中投票难兑现潜力,补偿型任务平均仅减误差6%。
"AI 是(不是)新的……":生成式 AI 文化影响的诊断性类比框架
提出诊断框架,从认知场域、治理逻辑、技术机制三坐标分析生成式AI文化影响,区分结构与偶然后果。
INRs 能走多远?面向脑部 MRI 的跨域参数高效 INR 语义分割
探究INR脑MRI分割跨域表现:低参数下优势显著;提出分层架构HierINRSeg,Dice最多提升8.2个百分点。
MedHal:用于医学幻觉检测的合成数据集
提出大规模医学幻觉检测数据集MedHal,覆盖内在与外在幻觉,可训练检测模型,优于通用方法,助力医学AI发展。
残差流的有效深度
提出“有效深度”指标,量化残差流表示相似度随层距的衰减;16个大模型多低于理论参考,源于残差更新相关而非深度未用。
UQ-LOB:不确定性感知的限价订单簿中间价预测
提出UQ-LOB不确定性量化模块,为任意LOB编码器输出校准置信度,选择性预测大幅提升方向F1。
面向可解释关键安全视野评估的结构化推理智能体框架
提出结构化推理智能体框架,以场景图与子准则验证分解CVS评估,实现可解释判读,mAP达68.1%。
提示词最小化:在不牺牲输出保真度的前提下减少输入冗余
研究提示词最小化,将提示压缩至最简信息密集形式,在保持输出保真度的同时降低计算开销与延迟,揭示输入冗余。
OC-GS:面向不规则转台采集的高斯泼溅重建
OC-GS以共享运动模型联合优化图像几何与视角,显著提升稀疏不规则转台采集的重建质量。
Aurora-X:专为极端时间序列预测打造
Aurora-X:十亿级时间序列基础模型,渐进课程与统一架构,支持概率预测、测试时缩放,多基准达SOTA。
通过启发式适配与超词元学习实现语言模型中的分词器灵活性
提出启发式分词器移植与超词元学习,降低重训成本、提升压缩,效果优于ReTok等。
VLAA-GUI:知道何时停止、恢复与搜索——面向 GUI 自动化的模块化框架
模块化 GUI 智能体框架,融合完备性验证、循环打破与按需搜索,OSWorld 达 77.5%,单次即超人类
GraphWrit3R:端到端三维场景图生成
GraphWrit3R以点云或高斯泼溅为输入,端到端输出JSON三维场景图,免真值标注,在3DSSG上达SOTA。
神经表征相异性的流匹配框架
流匹配统一多种神经表征距离度量,将其视为不同速度约束下的杰弗里斯散度,便于复杂分布估计和设计新度量。
基于Fisher信息几何的贝叶斯优化:梯度界与信赖域方法
从信息几何视角研究贝叶斯优化,用Fisher度量拉回得梯度上界,解释高维梯度消失,提出信赖域方法FITR。
从捷径学习到离散神经插入排序
针对捷径学习提出离散神经插入排序;长度16训练在64/128达100%排序准确率,但需全局内循环状态监督。
SAGE:面向物种分布建模的采样感知全球评估基准
提出SAGE基准,按采样强度与多度分组评估5771种植物;深度学习仅对少记录物种更优,需偏差校正。
迈向自动化词典编纂:面向学习型词典的释义生成与评估
研究学习者词典释义自动生成,提出基于大模型评判的评估方法与迭代简化生成法,实验验证其高分且用词简单。
NaijaNLP:尼日利亚低资源语言综述
首次综述尼日利亚豪萨、约鲁巴、伊博三大低资源语言NLP研究,指出新资源不足、形态等挑战,呼吁协作共建
FreshLatent:面向资源受限具身VLM感知的信道感知潜空间适配
冻结VLM、仅训练轻量信道感知潜适配器,0 dB下分割精度显著提升,参数与能耗远低于重型编解码方案。
面向情感支持对话的情感流语言模型
提出AFlow,将多轮情感支持建模为情感效用流,用AFPO传播偏好优化策略,实验提升对齐、多样性与生成质量。
利用有限音频弥合语音-文本鸿沟,实现基于LLM的ASR高效领域自适应
少量语音即可弥合LLM-ASR模态差距,混合批处理仅用10%目标域语音便媲美全量微调。
FuseReg:正则化层融合缓解表征自编码器中的重建-生成差距
FuseReg以随机编码器层子集训练正则化融合,单解码器适配多融合,缩小重建-生成差距,gFID降29%。
取证双生:面向AI生成图像取证的自监督残差学习
提出自监督残差学习框架,仅用真实图像训练,可零样本检测27种未见AI生成器,AUC达97.99%。
对数线性复杂度的块稀疏注意力
PISA用金字塔Top-K分层选键,实现O(N log N)块稀疏注意力,语言建模相当、检索更优。
为何更好的跨语言对齐不能带来更好的跨语言迁移:以编码器为例
跨语言对齐未必提升下游迁移;对齐指标不可靠,对齐与下游梯度常近乎正交,需关注目标兼容性。
VkVIO:基于Vulkan的跨平台GPU加速视觉惯性里程计
首个基于Vulkan的跨平台GPU加速视觉惯性里程计VkVIO,多设备实时高精度,性能超越CUDA方案。
构造对抗者:一种结构感知的攻击方法
提出结构感知优化框架,将频率对抗攻击表述为加权ℓ2投影,跨架构生成高效攻击。
WALT:为自动驾驶学习世界模型对齐的潜在轨迹
提出WALT:将原始轨迹映射到紧凑潜空间,与冻结驾驶世界模型对齐,提升NAVSIM规划性能并降低30.5%算力。
分布式学习即服务:开发者视角
从开发者视角展示DLaaS:经管理面板声明式启用差分隐私、拆分学习等机制,端到端演示智能家居唤醒词任务。
CRNDiff:基于化学反应网络的计数原生扩散框架
CRNDiff用化学反应网络实现计数原生扩散,结合罕见亚群条件采样,在单细胞数据上条件保真度高。
WorldTS:面向多模态协变量感知时间序列预测的世界建模
WorldTS以两阶段世界建模将多模态协变量融入潜在状态动态,在21个真实数据集上验证有效。
用于多维时间序列异常检测的融合物理信息预测先验的贝叶斯张量自编码器
提出融合物理信息预测先验的贝叶斯张量自编码器,利用张量结构与低秩分解提升多维时序异常检测。
StraTA:以策略性轨迹抽象激励智能体强化学习
提出StraTA框架,为智能体强化学习引入轨迹级策略,联合训练策略生成与动作执行,提升样本效率与性能。
Human-1(Josh Talks):基于真实对话的印地语全双工对话建模框架
首个开放可复现的印地语全双工对话系统,以2.6万小时真实对话训练Moshi,可自然实现打断、重叠与轮替。
基于未训练神经先验的相位图像重建
提出两阶段投影框架,融合傅里叶相位、空间支撑与未训练神经先验,重建显微图像优于仅约束基线。
仅凭像素能否揭示图像来源?被动溯源的极小极大极限与可学习接口
仅凭像素溯源存在极小极大极限,公开验证器在对抗编辑下可被绕过,需分评估统计上限与接口信息。
基于交互中心建模,实现双指夹爪操作的统一跨域表征
交互中心框架统一双指夹爪表征,融合VLM与流匹配Transformer,实现跨本体零样本仿真到现实迁移。
自适应多分辨率高斯过程:利用天然数据稀疏协方差矩阵实现可扩展精确推断
提出自适应多分辨率高斯过程,用样本锚定的稀疏协方差矩阵实现精确推断,训练O(n log²n)、预测O(log^d n)。
面向动态无人机网络的威胁感知高能效部署:多智能体强化学习方法
提出威胁感知多智能体强化学习框架,通过聚类、匹配与MATD3优化无人机部署及资源分配,兼顾能效、安全与泛化。
非典型听觉下的音频情感识别
探索非典型听觉下的音频情绪识别,聚焦自闭症听觉过敏,以LoRA微调CLAP大模型,借效价—唤醒数据实现小样本情感泛化。
自动驾驶潜空间监控器的审计
审计发现自动驾驶帧级故障可预测,但潜空间特征相较可观测输入输出无显著增益,并提出评估协议。
SkillFlow:可扩展且高效的智能体技能检索系统
首个开放多阶段技能检索系统,从约3.5万技能中筛选,使编码任务通过率提升78.3%。