通过LF-IBIS的全贝叶斯强化学习
提出LF-IBIS算法,结合ABC与IBIS实现无似然函数的全贝叶斯强化学习,在线更新信念并量化策略不确定性。
Pmeta-TLA:基于元学习和音色泄露攻击的语音分类模型后门攻击
提出Pmeta-TLA多后门攻击,利用元学习和音色泄露,实现高效、隐蔽且鲁棒的语音分类后门攻击。
MedStreamBench:一个面向流式与主动式医疗视频理解的时间感知基准
MedStreamBench是首个评估医疗视频回答时机的基准,实验显示模型在流式和主动场景下性能显著下降。
SAB-LVLM:面向大型视觉-语言模型的显著性感知二值化
提出显著性感知二值化方法SAB-LVLM,通过Hessian矩阵和空间显著性图识别跨模态权重重要性,实现约1比特压缩下性能领先。
轻量级安全强化学习用于端到端无人机导航
提出安全约束的轻量强化学习框架,结合安全PPO和课程学习,实现高效安全的无人机导航。
混合并行策略:面向专家混合模型的高效内存训练栈
MoP混合并行训练栈在12节点H200上高效训练万亿参数百万上下文,吞吐量比FSDP2提升4.7-8.2倍。
关于代码仓库中LLM生成代码与注释的探索性研究
研究发现LLM生成代码随时间减少,多出现于测试用例且存在大量克隆;公司仓库比例更高,但仅少数bug与之相关。
这个检查点被去拒了吗?一项双信号审计及其失效图谱
提出双信号审计法,结合激活拒绝差与权重恢复能量,高效检测被移除拒绝机制的检查点,并映射两种失败模式。
支持航路空中交通管制的解空间路径规划
针对航路空中交通管制,提出可解释、高效的解空间路径规划算法,SSPPV配合区域冲突检测可达平均3.69毫秒。
建设性对齐:在人类-AI互动中引导偏好动态变化
AI对齐旨在引导人类偏好演化,而非静态满足,通过控制价值轨迹确保其连贯、自主、理性且抗操纵。
Seed2.0模型卡:面向现实复杂性的智能前沿
Seed2.0模型系列构建评估系统,攻克长尾知识与复杂指令跟随,具备领先推理、视觉与搜索能力,初步处理现实复杂任务。
有限道德:界定道德计算的空间
提出有限道德框架,从广度和深度分析道德计算,资源限制下伦理理论为局部策略,定义道德遗憾与进步。
MMM数据模型——可去中心化知识共同体中知识互操作性的规范说明
MMM数据模型结合规范约束与自由文本标签,实现跨学科知识互操作,无需语义收敛,具备可行性和可用性。
让失败变得安全:一个用于开放网络数据收集的约束性、可验证智能体框架
提出约束可验证智能体框架,通过类型化JSON配置和静态执行,实现零LLM开销的可复用、确定性数据收集。
中文标题:具有双向信息不对称的上下文赌博机监督博弈
中文摘要:研究双向信息不对称下的人机监督博弈,给出团队最优与近视规则的差距,揭示可避免伤害区间与不可信沟通代价。
构建认知AI素养:检测学生与AI协同编程中的认知目标与过程
认知AI素养框架揭示学生-AI协同编程中78.8%互动缺乏认知目标,仅11.1%有高认知参与。
从信号到结构:记忆架构如何驱动LLM智能体中的语言涌现
LLM智能体在信号游戏中,记忆架构比通道容量更关键,带笔记本可稳定协调达0.867,无状态智能体则随容量增大退化。
运行时管理自主:基于齿轮的单/多智能体信息物理系统安全与治理
提出五档执行齿轮系统,实现单/多智能体CPS安全与治理,异常检测99.6%,延迟降低3.5倍。
Mnemosyne:用于验证和修复AI生成工作流的智能体事务处理
提出ATP事务模型,将AI生成动作视为不可信提议,经约束集验证后才提交,实现安全修复且开销低于6%。
中文标题:演化环境中具身智能体的多尺度世界模型混合
中文摘要:MuSix框架通过尺度感知路由与演化机制,解决专家混合在具身智能中的尺度缺失和更新不均问题,显著提升多尺度推理与动态适应能力。
PHREEQC-MCQ-200:面向工具增强型科学模拟器代理的诊断基准
提出PHREEQC-MCQ-200基准,评估工具增强科学模拟代理,发现工具提升准确率但非单调,输出协议影响性能,需端到端诊断。
AI原生游戏:综述与路线图
本文定义AI原生游戏为核心循环依赖生成式AI,提出G/N双轴分类法,分析53款游戏,指出语义开放性是关键设计问题。
HARC:耦合有害性和拒绝方向实现鲁棒安全对齐
HARC微调方法耦合提示与响应位置的有害性和拒绝方向,实现强鲁棒安全对齐且不损通用能力。
面向代理式RAG流水线的贝叶斯不确定性传播:多跳问答的概念验证研究
提出贝叶斯不确定性传播用于代理式RAG,多跳问答评估显示HotpotQA更有效,StrategyQA暴露上游信号不可靠问题。
可验证规则的智能体生成:确定性自扩展反应分类
多智能体LLM自动生成可验证反应规则,将分类从68类扩至14073类,分类率达97.7%,实现自扩展符号系统。
自主实验室编排器的最优资源利用
两步法:约束规划优化调度,状态依赖稳健执行,实现资源最优利用。
从“字符串”到“事物”:面向个人知识图谱的LLM三元组抽取在推荐系统中的评估
提出用轻量LLM从对话数据提取用户偏好三元组构建个人知识图谱,评估发现部分模型抽取与下游推荐性能俱佳。
UltraFlux: 数据-模型协同设计,实现跨多种宽高比的高质量原生4K文本到图像生成
UltraFlux通过数据-模型协同设计,结合共振2D RoPE、VAE后训练、SNR感知Huber小波损失和阶段式美学课程学习,实现稳定保细节的4K文生图,超越开源模型并媲美Seedream 4.0。
拓扑空洞分析:知识空间系统性技术创新发现的数学框架
TVA框架通过三元组条件识别知识空洞,在约14万文档中生成2128候选,端到端通过率0.05%,发现非明显技术连接。
无基质的人格:体制依赖性与大语言模型个体化问题
四个实验揭示跨体制共指假设错误,提出载体与体制对作为身份单元。
面向具身智能的内存原生非地面网络
提出MemNTN范式,利用长期上下文优化系统,双内存架构,在卫星具身问答中表现优越。
PRA-RAG: 面向检索增强生成中对抗检索污染的可证明鲁棒聚合
提出PRA-RAG可证明鲁棒聚合算法,防御检索污染,攻击成功率降至1%,准确率71%。
SkillSelect-Serve:面向小型LLM智能体的预算可控且QoS感知的技能服务推荐与组合
提出预算可控、QoS感知的SkillSelect-Serve框架,通过双粒度效用建模提升技能服务推荐组合的召回与效用。
GRACE-RAG: 受控检索架构用于规范证据合成,实现闭域机构轻量部署
GRACE-RAG通过图增强检索外化结构推理,避免碎片化证据,轻量部署于闭域机构,质量提升20%。
利用稀疏自编码器将句子嵌入与人类概念对齐
提出用稀疏自编码器解耦句子嵌入为可解释概念,激活引导干预检索,实现透明可控的神经信息检索。
比较大型语言模型在Scrum认证问题上的表现:准确性、稳定性和错误模式
评估三个LLM在Scrum认证问题上的表现,Gemini准确性最高,错误呈现系统性模式。
基于人类演示的接触力引导的灵巧操作学习
提出CHORD框架,用物体中心接触力引导强化学习,在4739个任务中成功率达82.12%,可迁移到真实世界。
就Scrum认证问题提示GPT-5:一项实证准确性研究
GPT-5回答Scrum认证问题准确率超85%,引用提示最佳达89.1%,错误集中于范围外和过时解读。
AGE:面向图检索增强生成的图嵌入自适应掩码
AGE采用掩码自监督学习对齐图文特征,聚焦非关键节点预测,提升图问答任务精度。
SWE-Router:多轮自主软件工程任务中的路由选择
SWE-Router利用部分轨迹决策路由,提升任务成本效率并保持强模型性能。
用于RIS辅助跟踪与功率控制的主动感知:一种混合神经进化与监督学习方法
提出混合神经进化与监督学习的双代理主动感知框架,在RIS辅助跟踪和功率控制中精度与鲁棒性超越传统滤波与机器学习方法。
AlgoBench:代码生成中算法适应性的基准测试
AlgoBench通过约束变换生成新算法问题,用复杂度指标测试模型算法适应能力,发现模型表现大幅下降,错误主因是算法而非实现。
土耳其语和阿拉伯语中的仇恨言论检测:一项综合研究
提出含土耳其语5类及阿拉伯语1类话题的仇恨言论数据集,并开发基于BERT的多维度仇恨分析模型。
SLIM-RL:基于风险预算的随机掩码强化学习,用于扩散大语言模型且无需轨迹切片
SLIM-RL通过风险预算解码器控制提交风险,采用无迹随机掩码目标,在更少训练样本下超越现有方法。
SEFORA:学生论文与反馈语料库及大语言模型反馈评估框架
SEFORA包含564篇论文和8240条教师反馈,UniMatch评估框架显示LLM生成反馈F1低于0.4,难以匹配教师重点。
基于大语言模型的意图驱动网络拓扑设计框架
提出LLM框架,通过约束管道从自然语言生成合规且弹性的网络拓扑,评估结构与弹性,为AI网络设计提供基准。
统一引导框架增强流匹配,实现高效鲁棒语音合成
统一引导框架通过数据增强与模型优化,加速流匹配推理近3倍,提升语音合成效率与鲁棒性。
隐藏因素至关重要:利用视觉语言模型识别规划关键的被遮挡对象
引入PKL度量,VLM识别关键遮挡,微调小模型性能提升30%,实现高效风险评估。
当AI遇见量子信息:综合评述
AI与量子信息双向赋能:AI助力量子系统学习与设计,量子信息提升AI性能,但面临可重现性、可扩展性等挑战。
DiscoLoop:循环离散嵌入与连续隐状态实现多跳推理
混合离散与连续通道的循环架构,解决多跳推理中表示对齐问题,实现近完美准确率。