DocMaster:一种层次结构感知的文档分析系统
DocMaster通过层次文档树和结构感知语义索引,实现精准文档筛选与深度分析。
ProjAgent:面向仓库级代码生成的程序相似性检索
ProjAgent引入程序相似性检索,分解目标步骤检索相似函数,结合语义检索与静态分析反馈,显著提升代码生成性能。
SMetric: 基于平衡会话中心调度的LLM代理服务调度再思考
SMETRIC通过首个请求负载均衡、后续缓存感知的会话调度,提升集群TPS 10-34%并保持KV重用。
双维度难度课程学习用于直接偏好优化
提出提示复杂度和成对区分度构成的二维难度空间,并开发自步学习框架,实现高效鲁棒的大模型对齐。
面向能效领域特定人工智能模型与智能体的愿景
提出从高能耗大模型转向轻量领域特定智能体,硬件能效需提升超千倍,实现低功耗推理决策。
SimRPD:通过基于模拟器的数据评估与选择优化招聘主动对话代理
提出SimRPD框架,利用模拟器合成数据并多维评估筛选,优化招聘对话代理,性能优于现有策略。
RetailBench:评估大语言模型代理在真实零售环境中的长周期自主决策与策略稳定性
RetailBench评估LLM在超市运营中的长周期决策,仅少数模型存活,最强模型远落后于最优策略,源于信息不足和策略不稳定。
科技学术会议知识图谱与精准画像构建
本文综述构建科技学术会议知识图谱与精准画像的关键技术,包括实体识别、语义相似度等,辅助研究者高效获取信息。
专家学者的科技资源检索
针对专家科技资源与社会需求脱节问题,构建专家库与检索服务,并从四方面梳理相关工作。
可解释人工智能(XAI)对AI安全开发与认证的贡献:基于专家的分析
XAI方法能揭示模型偏见与故障,助力安全开发,但认证需全面准确信息,其贡献有限。
自适应生成针对大语言模型的偏见诱发问题
提出反事实框架自动生成开放式问题,构建CAB基准,发现所有LLM在特定场景下存在持久偏见。
曲率加权容量分配:面向层自适应大语言模型优化的最小描述长度框架
提出曲率感知的MDL框架,用层增益量化冗余,经凸优化分配算力或剪枝,实验验证有效。
CoCo-Fed:无线边缘中内存和通信高效的联邦学习统一框架
CoCo-Fed框架通过降投影和正交叠加解决内存与通信瓶颈,理论保证收敛,非独立同分布下表现优异。
GenDA:基于无分类器扩散引导的复杂城市区域生成式数据同化
GenDA框架用图扩散从稀疏传感器重建风场,降低误差25-57%,提升结构相似性23-33%。
Self-EvolveRec:基于LLM定向反馈的自进化推荐系统
提出Self-EvolveRec,利用LLM定向反馈与模型诊断协同进化,显著提升推荐性能与用户满意度。
XFACTORS: 通过对比监督实现解耦的信息瓶颈
提出XFACTORS框架,基于解耦信息瓶颈,利用对比监督和KL正则化解耦表示,达到SOTA性能。
通过结构感知掩码和GRPO实现高效思维链蒸馏的课程学习
三阶段课程学习框架:结构理解、GRPO优化与针对性改写,在GSM8K上提升准确率11.29%,缩短输出长度27.4%。
模型不确定性下因果效应的稳健加权三角测量
提出结合模型可测试性与半参数理论的因果效应三角测量框架,避免模型选择,实现稳健推断。
MasFACT:基于几何感知后验迁移的持续多智能体拓扑学习
提出MasFACT,通过几何感知后验迁移保留历史拓扑知识,解决持续任务中的拓扑遗忘,提升准确率。
利用大语言模型预测金属有机框架合成的放大
ScaleMOF数据集与正无标签学习微调LLM,93.5%准确率,实现MOF放大候选排序。
StateLinFormer:状态化训练增强导航中的长期记忆
StateLinFormer通过状态化记忆训练线性注意力模型,实现导航长期记忆并显著超越基线。
基于策略Hessian分解的折扣MDP的二阶演员-评论家方法
提出高效二阶演员-评论家方法,利用Hessian-向量积和两时间尺度实现折扣MDP的稳定加速收敛。
用于开发模糊认知图的大语言模型
利用本地大语言模型从评论文本提取数据构建模糊认知图,通过酒店评论测试验证其满意度预测能力。
混合专家模型真的有助于消费级和边缘硬件上的推理吗?一项实证研究
MoE在边缘硬件上推理速度慢、能耗高,因总参数量和内存带宽受限,稀疏激活优势无法发挥。
训练与评估长上下文长度的扩散策略
本文首次细致研究扩散策略上下文长度,发现简单扩展并不脆弱,并提出了联合多长度训练以减少样本复杂度。
扩散生成推理重排序器
提出Diffusion-GR2,通过转换微调、在策略蒸馏和强化学习弥合精度差距,实现2.4-3.5倍解码加速。
Grokking中标度律的随机几何理论
提出Grokking的随机几何理论,揭示解空间壳-核拓扑,推导学习率、批大小和L2正则化标度律并验证。
学习社会规范提升动态人机协作中的兼容性
提炼结果可预测、价值对齐、优势意识三条规范,AI融入后协调效果提升近四倍,超越人际协调43%。
用于ARC-AGI-1抽象推理和泛化的经济型智能体架构
提出两种经济型智能体架构,在无微调下将ARC-AGI-1基线提升约52个百分点,最高67.25% pass@2,成本仅0.62美元每任务。
上下文搜索何时有帮助?反思驱动推理的采样复杂度理论
当反思可靠定位早期错误时,上下文搜索以多项式尝试实现指数级成功率提升,否则无渐近优势,且增益鲁棒可学习。
评估SageMath增强的LLM代理在计算与实验数学中的应用
提出ReAct式SageMath增强代理,评估显示平均解决率提升9.7个百分点,最高达75.2%,缩小了模型差距。
编排效应:编排设计如何设定企业代理AI的代币经济学
编排层设计可降低任务成本41%、时间44%、Token消耗38%,质量持平,是代理AI代币经济学的关键杠杆。
在紧凑世界模型中锚定空间关系:指令泄露与无目标动力学修复
研究发现目标条件预测存在指令泄露(转录指令而非感知),通过将目标排除于动力学外并监督读取路径,可恢复真实的空间关系锚定。
超越人类尺度的智能测量
提出用模型生成公共挑战的相对测量范式,构建可扩展的对抗性心理评级系统,衡量超人智能。
从原子操作到标准作业程序:面向自进化LLM代理的迭代工具优化
提出EvoSOP框架,将原子操作合成为标准作业程序并迭代优化,显著提升LLM代理任务成功率并减少交互轮次。
InductWave:知识图谱上的归纳式多跳逻辑查询回答
InductWave是一种基于小波的归纳嵌入方法,用更少资源在大型知识图谱逻辑查询中达到与基线相当或更优性能。
MIRA-Math:面向最小信息请求与数学推理的基准测试
MIRA-Math评估模型在缺失一个原子事实时请求信息并推理,发现请求成功与答案准确性可分离。
智能体数据环境
智能体数据环境作为执行基底,增强自主智能体能力并保障安全,将数据系统从被动存储转为主动执行基底。
AI理解成像吗?计算成像任务中具身AI的系统基准测试
提出ImagingBench基准,涵盖20项计算成像任务,发现具身AI在物理成像中远逊于专业方法。
少推理,多验证:确定性门机制恢复工具型LLM代理中一种无声的违反策略的失败模式
确定性预执行门机制可预防LLM代理无声违反策略,成功率提升约12个百分点。
搜索、失败、恢复:一种面向纠错感知推理的训练框架
提出Pyligent框架,通过验证搜索树训练模型学会回溯恢复,在多个推理任务上成功率提升高达72.7个百分点。
中文标题:当智能体记忆过多:大语言模型智能体的记忆投毒攻击
中文摘要:提出GhostWriter攻击,利用记忆子系统投毒,成功率98%,激活率60%;AM-Sentry防御有效降低威胁。
LLM生成的技能是否让AI数据科学家更出色?数据科学工作流的组件消融研究
LLM生成的技能在数据科学工作流中无法可靠提升性能,组件消融实验证实无显著改进。
Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops
强化学习后训练构建组合推理策略
RL后训练能选择性组合原始技能形成高阶策略,优于拒绝微调。
SkillCenter:面向自主AI智能体的最大规模源扎根技能库
最大开源技能库含21.6万结构化技能,通过SkillGate管道确保每个技能可追溯至原始来源。
强化学习能否高效发现价格操纵?
中等波动下,强化学习无需模型知识即可发现价格操纵,且优于有模型方法;大波动均无效,小波动模型更优。
SmartHomeSecure:使用大型语言模型自动检测和修复智能家居配置错误
结合程序分析与大模型自动检测修复智能家居配置错误,准确率100%,修复成功率87%-93%。
非接触式实时心率测量:基于普通摄像头与AI代理的图像处理方法
使用普通摄像头和深度学习面部检测,通过滑动窗口去噪实现非接触实时心率测量,与Apple Watch对比验证。