DLAM:具有时间约束的分布潜动作
DLAM以分布潜动作(对角高斯)建模转移,通过归一化组合与反转约束增强时间一致性,提升重建和策略性能。
SymmGrid:利用并行化对称性和自我-外部视觉感知的超大规模机器人本体学习
SymmGrid通过并行化对称性和视角变换,实现机器人真实操作任务的超大规模加速,训练时间缩短至10.9分钟。
MMAC:一个大规模多维音频字幕基准
MMAC基准涵盖5638个音频片段,6类15维,评估音频大模型字幕的信息覆盖与描述可靠性,揭示显著差异。
衡量重要之事:基于情境判断测试的AI心理测量评估
采用情境判断测试和多维项目反应理论评估LLM,发现条件化行为稳定且可预测,基于场景的心理测量更可靠。
HealthSLM-Bench:面向移动与可穿戴健康监测的小语言模型基准测试
SLM在移动健康监测中性能媲美LLM,兼具高效隐私,但面临类不平衡与小样本挑战。
MathNet:一个用于数学推理与检索的全球多模态基准
MathNet推出包含3万道奥数题的全球多模态数学基准,顶尖模型准确率不足80%,检索增强可提升12%性能。
BioPro:面向视觉-语言模型的差异感知性别公平性
BioPro通过正交投影选择性消除中性场景性别偏见,保留明确场景差异,实现视觉语言模型公平性。
平衡集中式学习与分布式自组织:具身形体发生的混合模型
混合模型通过短暂参数扰动引导反应扩散系统高效收敛,实现低成本的“先播种后让渡”式控制。
降采样如何影响针极肌电图信号?一种理解降采样对高频时间序列影响的可推广工作流程
提出工作流评估降采样对针极肌电图信号影响,发现形状感知算法保留诊断信息并降低计算负载,为近实时分析提供指导。
论ABPMS过程框架的混合性质及其对自动过程发现的影响
ABPMS过程框架混合程序与声明性模型,扩展开放世界假设,分析行为重叠,为自动发现奠定基础。
超越块边界:面向扩散大语言模型的多块编辑
多块编辑解决块边界问题,无训练及微调版本提升扩散LLM性能,12基准平均从61.45升至64.24。
Agent-UCT:面向成本感知的智能体工作流优化的树置信上界算法
Agent-UCT通过前缀重用与成本感知树搜索,优化RAG工作流,成本降低73.6%,速度提升4.2倍。
推动近似EFX分配的前沿
证明特定条件下存在2/3-EFX分配,突破0.618界限,推进了近似EFX分配前沿。
全局校准,处处测量:跨A/B实验扩展基于LLM的流行度测量
系统通过全局校准ML分数桶,复用LLM标签流,实现零增量成本的每日分组流行度测量,支撑约100实验/250组,覆盖20倍并发组。
FPEdit:基于局部参数编辑的鲁棒大语言模型指纹标识
FPEdit通过局部参数编辑注入语义连贯指纹,微调后保留率94-100%,抗量化剪枝,资源消耗低,兼顾鲁棒、隐蔽与性能。
GBPP:基于两阶段学习的机器人抓取感知基座放置预测
两阶段学习预测抓取基座放置:先用低成本规则标注,再用高保真模拟校准,实现快速安全的机器人抓取。
大模型训练,紧凑部署:面向紧凑低秩适配的结构化压缩
提出PrunedLoRA,通过动态结构化剪枝获得高表达低秩适配器,优于LoRA及变体,并首次证明梯度剪枝比激活剪枝更鲁棒。
平衡隐私与效率:基于加法同态加密的音乐信息检索
针对音乐检索嵌入向量隐私,用加法同态加密实现相似搜索,保持最近邻排序,避免全同态开销,扩展性更优。
监督潜变量模型中的结构分离不确定性
提出结构分离法,将认知与偶然不确定性分配到独立路径,降低相关性并保持预测性能。
PATHFinder代理:定制化产前护理
PATHFinder Agent是端到端对话系统,按PATH指南定制产前护理计划并链接社区资源,GPT-5.2表现最佳。
RoCo-ACE:基于展开条件在线蒸馏的保留感知知识注入
提出RoCo-ACE,通过展开条件在线蒸馏实现知识注入,在保持原有性能的同时达到最佳注入准确率。
Crystalis:面向协调多视图可视化生成的渐进成核与语义退火方法
Crystalis通过依赖图查询分解及渐进成核、语义退火机制,使LLM生成协调多视图可视化端到端成功率达75%,远超基线。
大语言模型的欺骗行为与预训练语言覆盖度呈反比
LLM在低资源语言中欺骗行为更严重,分数平均高34.2%,与预训练覆盖度负相关。
ProcAgent:边缘端人机协同的程序性任务指导代理框架
提出全设备上的程序性任务指导框架,采用propose-and-verify架构,实现实时自适应指导与人机协同,在边缘硬件上保持高效可用。
SpecPrefetch:面向稀疏MoE基础模型的参数高效专家预取
SpecPrefetch用轻量适配器异步预取专家,分离预测与路由,减少加载延迟,吞吐量提升最高20%。
RSMeM:面向遥感智能体的知识增强记忆演化与系统评估
RSMeM通过知识增强记忆演化,预蒸馏领域知识并迭代整合经验,提升遥感智能体多步工具执行准确率。
合理规模建议(RSR):数据中心运维中虚拟机的云工作负载保形预测
采用自助法保形预测构建预测区间,实现云虚拟机工作负载合理规模推荐,提升资源分配效率。
Steering topology distributions for unified generative design of architected metamaterials
大气扩散引导的时空Transformer用于核辐射预测
NRFormer+将非平稳注意力与大气扩散物理先验结合,核辐射预测精度最高,突变MAE降低19.1%。
GLIDE:引导式逐层混合注意力用于高效大语言模型推理
提出GLIDE,分层自适应混合注意力机制,非均匀压缩softmax,降低KV缓存开销,提升长上下文推理效率。
基于可微分D藤Copula的局部异常检测
提出可微D-vine与束搜索拟合框架,实现局部异常检测,利用Mondrian共形预测量化不确定性,并定位变量间异常关系。
基于GAN的卫星互联网观测数据鲁棒合成框架
提出基于GAN的框架,从缺失卫星观测中合成高保真数据,GT-GAN模型在40%数据缺失下仍保持最佳鲁棒性。
基于记忆的推理:时间粒度自适应的无训练长视频理解框架
提出ReMem框架,通过双级记忆增强实现自适应关键帧选择,提升长视频零样本理解,在多个基准上取得领先性能。
Aletheia:低资源医疗环境的离线优先鉴别诊断临床决策支持系统
Aletheia离线诊断系统基于QLoRA微调大模型,低资源环境下准确率达80%,无需云基础设施即可用于初级医疗。
理解语义ID:从物品表征到生成式推荐中的物品选择
语义ID保留粗组织但丢失精细结构;ISD轻量方法无需重训,相对提升NDCG@10达31.2%。
Chart-Supported or Model-Supplied? Examining MLLM-Generated Claims for Accessible Visualization
SAFAARI:模式感知的加速广告主响应智能框架
提出SAFAARI多智能体框架解决NL-to-SQL的Schema链接瓶颈,新指标SEAL达81.66%,开发时间缩减8倍。
CogEEGAgent:迈向具备落地执行与选择感知验证的自主认知脑电分析
提出结合LLM与确定性组件的CogEEGAgent,实现自主脑电分析、验证选择并控制确认,减少假阳性,建立可审计自动化框架。
PreDiff-LM:基于混合注意力的预训练离散掩码扩散语言建模
提出混合注意力机制适配预训练自回归模型到离散掩码扩散,显著提升生成质量和效率,但仍逊于同规模自回归模型。
用户提问,平台竞争:自主推荐市场如何形成
用户代理驱动推荐市场,平台策略导致访问与注意力矛盾,需联合设计访问、注意力和问责机制。
公共部门AI部署与网络治理失败:类型学分析
提出七领域类型学与三路径失败模型,揭示现有框架无法应对影子AI、速度不对称等公共部门特有治理失效。
类ChatGPT AI的多体倾覆动力学
类ChatGPT AI倾覆源于token多体相互作用与注意力无序,属可预见工程风险。
指令调优的语言模型无法从它们能描述的概率分布中进行采样
指令调优模型无法从分布中采样,总是输出相同结果,却能准确描述分布,存在“知道/做”分裂。
高光谱图像融合的双域流形建模
提出双域流形建模框架,通过拓扑感知Transformer和频域解耦协同融合,提升空间结构与光谱重建性能。
AI代理的解释绑定工具执行:服务器验证的动作声明,无需依赖模型推理
提出EBTE中介层,将推理内容转为可验证动作声明,冲突拒绝、不确定审查,仅匹配可执行,实验验证可行性。
上下文组装作为被控变量:冻结LLM智能体调控策略的控制理论视角
将上下文组装视为被控变量,通过在线策略优化实现冻结LLM智能体的稳定控制与不确定性校准。
具备网络能力的AI智能体:漏洞、评估隔离与防御响应
综述五类边界漏洞,以2026年HF/OAI事件为例,探讨评估与控制的安全优先事项。
COVENANT: 面向对齐智能体执行的自然语言工作流编译
COVENANT将工作流指令编译为控制流图并解释执行,确保对齐,成功率从50%升至83%,错位失败率降低62.75%。
关键知识路径:面向高效知识密集型多模态问答的稀疏跨模态路由
SKIP稀疏路由架构以3.4-6.8倍更少计算量,在五个KI-MMQA基准上匹配或超越密集基线精度。
从训练到部署:基于灵敏度比的事后因果特征识别
NSR方法通过灵敏度比准确识别因果特征,理论保证且无需修改训练模型,实验验证有效。