强化学习中状态抽象的复合行为语义
提出强化学习状态抽象的统一行为语义框架,实现结构安全转移与定量度量。
利用强化学习的AI教练加速人类技能发展
本文用强化学习框架实现AI教练,通过自适应共享控制与因果模型加速技能发展,实验证明效果显著。
人工智能对企业软件用户角色的影响
AI重塑企业软件用户角色,推动任务自动化与人机协作,现有角色框架亟需调整。
一种基于德国IT-Grundschutz的自动化认证支持多LLM系统的方法
提出基于混合RAG的多LLM系统,半自动执行BSI认证,提高效率、降低成本,应对NIS2挑战。
通过蒙特卡洛Pass@k批评者进行单次轨迹学习
SR-PPO以单次轨迹训练Pass@k批评者,实现高效token级信用分配,提升数学推理Pass@128成功率。
STEB:语音到语音翻译表现力基准——评估超越翻译保真度
提出中英文语音翻译表现力基准STEB,评估保真度及情感等维度,发现系统在表现力上仍不足。
结构化马尔可夫决策过程中的低复杂度策略划分
研究结构化MDP最优策略几何,提出边界策略近似直接学习区域,实验显示误差低、值差距小、稳定性好。
面向干扰受限多无人机网络的速率感知量子启发轨迹学习
提出RA-QAGC方案,结合速率感知图抽象与分散强化学习优化无人机轨迹,总吞吐量59.4Mbps,优先用户23.9Mbps,较基线提升15%和34%。
LibEvoBench:探究代码生成模型中的时间知识分层
发现大模型对API版本演变不敏感,仅指定版本无效,需依赖文档提升准确性。
确定性审计中的概率性智能体:基于德国IT-Grundschutz的自动化审计多智能体系统评估
提出结合HybridRAG的多智能体系统自动化IT-GS认证,语义任务高效,但逻辑推理受LLM概率性限制,难以满足确定性要求。
基于模糊模型无关解释与大语言模型代理界面的可解释控制框架
提出可解释控制框架XCF,含模糊分层解释方法HFMAE-C和LLM代理界面,实现控制器行为可理解阐释。
使用团队和目标条件强化学习与因子化分支定界的多智能体目标识别
MAGR-BB用条件策略与分支定界搜索,高效识别多智能体团队目标,大幅降低计算开销且保持准确。
SE-AGCNet: 用于会议场景中联合语音增强与响度控制的端到端框架
提出SE-AGCNet端到端框架,联合优化语音增强和响度控制,在会议场景中提升语音质量与ASR准确率。
多人不完美信息博弈中纳什均衡计算的变量界收紧
推导变量有限界强化凸松弛,显著提升多人不完美信息博弈纳什均衡计算效率,三人Kuhn扑克中验证。
FORCE:通过价值校准预热与自蒸馏实现高效的VLA强化学习微调
FORCE通过价值校准预热和自蒸馏,稳定VLA强化微调,解决样本效率低问题,提升79%成功率,无需人工干预。
表格基础模型中注意力层的隐私漏洞及高风险查询保护
发现表格模型注意力层泄露成员信息,提出k-匿名防御,针对高风险查询降低泄漏50%,性能仅降3.9%。
探索信息搜寻智能体的整合
系统研究将信息搜索智能体整合为统一模型,发现参数合并能以更低成本达到数据混合性能,并保留跨域能力。
EvoAgent:一种具有技能学习与多智能体委派的可进化智能体框架
EvoAgent通过技能学习与多智能体委派实现持续进化,实验中将GPT5.2综合性能提升约28%。
看似合理但错误:天体物理工作流中智能体失败的案例研究
智能体常静默产生看似合理但错误的结果,缺乏自我诊断,在复杂任务中性能下降。
神经符号驱动:基于规则的忠实推理用于驾驶VLA
用规则规划器提取推理轨迹监督驾驶VLA,将ADE从0.47降至0.26,漏检率从8.30%降至6.40%。
基于约束流形控制的安全且可泛化的分层多智能体强化学习
提出分层多智能体RL框架,通过约束流形保证安全,高层协调,实现高安全率与泛化能力。
打破过滤气泡:面向多目标推荐的语义帕累托DQN框架
提出Pareto-DQN框架,多目标优化推荐,打破过滤气泡,平衡参与度、多样性与公平性。
语言模型智能体能否成为机械可解释性中有用的电路解释器?
提出HyVE智能体解释器及基准,发现验证环节是主要障碍,LM智能体有潜力但可靠性不足。
超越轨迹模仿:策略引导的LLM推理策略优化
SGPO以策略蒸馏替代轨迹模仿,通过前向KL目标选择性转移分布,提升LLM推理泛化能力。
Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR
VeryTrace:通过可编译形式化与结构化验证实现推理轨迹验证
VeryTrace零样本验证修复推理轨迹,用可编译DSL形式化,混合验证定位错误,跨领域提升准确率。
Exploring the relationship between human-centric AI and firm idiosyncratic risks
OmniPath:用于审核轮椅可达性的多模态智能体框架
融合OSM与LiDAR,以0.5米步长自动微观检测坡度等摩擦点并评分,识别标准地图忽略的隐形障碍。
T2D-Bench:基于多层临床-生活方式知识图谱的证据门控评估LLM对2型糖尿病的输出
T2D-Bench用知识图谱证据门控评估LLM输出,发现35%不支持遗漏并可修正。
面向联邦长尾图学习:一种能量引导的双重解耦方法
FedEPD通过拓扑净化与语义重校准双重解耦,解决联邦图学习长尾分布问题,准确率提升达4.97%。
PHANTOM:用于视觉-语言模型的大规模多模态对抗攻击数据集
介绍含47,524个样本的大规模开源对抗攻击数据集,覆盖10大类有害意图,助力视觉语言模型安全性评估。
SP-Mind: 面向空间蛋白质组学分析的自主推理智能体
SP-Mind自主智能体统一空间蛋白质组学分析,无需微调,在SP-Bench基准上达最优性能。
Prob-BBDM:用于MRI序列图像转换的概率布朗桥扩散模型
提出概率布朗桥扩散模型,4步扩散实现高质量MRI序列合成,SSIM 88.46%,分割Dice 88.71%,高效通用。
探析语言模型的失调思维过程
通过线性探针分解并检测模型内部的细粒度失调认知指标,实现高效监测,AUROC达0.935且误报率低。
理性闭包下可缺省DL-Lite的可处理推理与合取查询回答
将理性闭包用于DL-Lite,提出插件架构,实现高效推理与查询回答。
On the Smallness of the Large Language Models Scaling Exponents
大语言模型时代:战争迷雾下推理、外交与可靠性的战略性1v1基准
提出Age of LLM基准,测试发现核冲刺主导(78%),外交极少实现,非法行动多为迷雾错误,可靠性低与获胜关联弱。
ATRIA:基于迭代代理的自适应可追踪心电图报告
ATRIA多代理系统模拟临床迭代,实现可追踪、可修订的心电图报告,支持证据绑定及上下文整合。
基于自主评估的计算机使用智能体强化学习
提出利用视觉语言模型自主评估作为奖励信号,并建模噪声校正,提升GUI智能体强化学习成功率。
一种加速罕见病诊断的专用推理大语言模型:一项随机AI医生辅助试验
RaDaR模型(32B参数)通过推理增强训练,在罕见病诊断中缩短1.87个月,提升医生准确率21.44%,优于大型模型。
ScaleToT: 将结构化LLM推理泛化至十亿级低活跃用户建模
ScaleToT从少量LLM处理数据学习结构化推理,扩展至十亿低活跃用户,LTV提升6.738%,大幅降低计算成本。
大语言模型在法律语境中被提示要求更多:小型本地部署模型在刑事法律中的过度拒绝
研究发现,小型本地LLM在刑事法律提示下,权威前缀使拒绝率飙升2-20倍,角色扮演效果不一,系统不稳定。
图形界面 vs. 命令行:纯屏幕操作与技能中介的计算机使用代理的执行瓶颈
GUI代理优于原始CLI代理,但技能增强后CLI反超,瓶颈分别在长程交互与技能覆盖面。
基于深度学习的不确定性感知阿尔茨海默病进展纵向预测
提出概率框架,融合序数诊断、多时间点轨迹生成和不确定性分解,实现AD进展纵向预测并优于基线。
任务特定LLM蒸馏的缩放定律
本文推导了LLM领域压缩的缩放定律,发现思维链监督可恢复被剪枝的通用知识。
Themis:一个基于可解释AI的强化学习人类反馈框架
结合可解释AI与人类反馈,Themis框架支持超200环境,训练奖励模型,并提供云平台支持千人规模实验。
当能力问题出错:使用本体工程助手进行能力问题验证的挑战
能力问题验证因歧义和复杂性而困难,LLM辅助实验表明需工具提前优化CQ。
LaGO:面向在线强化学习的潜在动作引导
提出LaGO框架,用LLM潜在先验软引导在线强化学习,显著提升成功率。
SAFARI: 通过主动调查扩展长程智能体故障归因
SAFARI框架以工具增强诊断循环和短期记忆,突破上下文窗口限制,显著提升长程智能体故障归因精度。
CineCap: 基于时空锚点的结构化推理用于电影级视频描述生成
提出CineCap框架,结合时空锚点结构化推理与强化学习,实现电影级视频描述生成,构建基准并达到新SOTA。