跨调查迁移的硅基采样
跨调查迁移评估LLM模拟人类受访者,零样本预测准确率52%,揭示可预测层级与模型局限。
使用Incognita评估社会分布任务环境中具身行动的生成式智能体
提出Incognita框架,评估生成式智能体在社会分布任务环境中的表现:强模型知识获取和操作尝试增多,但可靠性仍低,成功率最高17.2%。
面向代理式业务流程执行的组织记忆
提出组织记忆架构,提供共享、可治理的参考知识层,解决代理流程的知识孤岛问题。
基于关键感知自反馈重试的智能体强化学习
提出PivoARL框架,通过识别关键错误轮次进行局部重试,提升任务成功率并减少交互成本。
从移动数据到商业洞察:面向大规模城市移动分析与决策支持的端到端分析框架
利用移动数据构建端到端框架,实现移动画像、轨迹挖掘和异常检测,支撑城市与商业决策。
应用带模糊隶属函数的回答集编程:一个案例研究
提出模糊回答集编程扩展,用学习隶属函数与语义谓词桥接数值与定性推理,支持模糊环境稳健推理。
如何避免辩论:通过双重高效交互证明实现可扩展的AI安全
本文提出无需辩论的单证明者交互证明,双重高效验证AI安全,适用于鲁棒计算或低阶多项式预言机。
严谨性在人工智能中的角色
AI缺乏严谨科学基础却能力惊人,从概念、认知、操作三方面剖析矛盾,解释其快速进展与不确定性根源。
使用确定性真实值评估长文本生成中LLM的不确定性
提出SALT基准评估长文本不确定性,发现原子级置信度排名失效,推理带来准确性-排名权衡。
PLACEMEM:面向终身代理的计算感知内存平面
PLACEMEM提出版本化胶囊记忆,统一语义与状态,实现可纠正的控制平面,支持实时检索与级联失效。
可解释AI筛查孟加拉国儿童虐待相关创伤:基于噪声感知合成数据评估的无训练多模态框架
提出ShishuRaksha AI无训练多模态框架,融合问卷、叙事、绘画和表情,合成数据评估AUC 0.874,助力资源匮乏地区儿童创伤筛查。
基于激活几何的无监督特征挖掘
提出MAG无监督框架,通过指令改变模型内部表示提取推理特征,实现预测、引导决策及数据集选择,准确率94.7%。
HAS-Bench:在可配置人类参与下评估基于LLM的人机智能体系统
HAS基准评估人类参与LLM智能体系统,发现收益取决于参与时机、方式和角色。
主体控制的生物基序
论文用生物基序分析智能体系统,映射五种模式到软件设计,提出可组合语法、认识拓扑及四个可预测定理,附实现验证。
法律判决预测中的捷径学习:来自英国就业法庭的经验证据
本文发现法律判决预测模型利用事后文本泄露特征获得高绩效,但遮蔽泄露后仍能有效预测,性能损失甚微。
语言模型通过控制搜索引导符号方程发现
语言模型作为搜索控制器,在符号方程发现中平衡精度、复杂度、稳定性和成本,有效识别紧凑关系。
基于聚类的资本市场可疑交易模式识别框架
用K-Means++聚类分析百万笔交易,识别2.02%可疑(涵盖幌骗等),轮廓系数0.561。
智能体物联网:迈向智能体互联网的架构、应用与挑战
提出Agentic IoT范式,融合自主AI智能体与IoT,构建分布式认知生态系统,并综述架构、应用与挑战。
GUI智能体相信自己的眼睛吗?诊断状态信念对像素与结构的依赖
提出视觉状态依赖度量,发现文本智能体过度依赖结构而非像素,导致行动错误。
基于深度学习和机器学习的FPS游戏服务器端自瞄作弊检测
提出YAACS自瞄检测系统,堆叠LSTM序列建模准确率88.6%,假阳性率0.97%,优于决策树,证明时序建模可减少误报。
通过投注机制实现LLM预测的分散聚合
WALLA通过投注机制分散聚合LLM预测,具备激励相容、优势对齐和分散学习,性能媲美集中式方法。
为何纯推理不足:自然作为数学创新的源泉
人类数学创新依赖自然启发的模式匹配,而非纯演绎;这为大型语言模型的海量跨领域数据提供了理论依据。
注意力受限的奖励学习
有限注意力会扭曲成对比较数据,标准模型无法区分奖励与注意力的影响,反馈应视为受限测量过程。
MRMS:面向长期AI代理的多分辨率记忆基底
提出多分辨率记忆基底MRMS,通过同步结构化-向量-图形记忆实现长期AI代理的可靠个性化与记忆管理。
受控个体化:用密码学将智能体的学习与其权限解耦
通过加密身份和语义门控,保证自主学习的智能体权限不越界,是架构不变性而非概率结果。
融合利他与公平偏好促进顺序社会困境中的高级相互合作
AFP奖励共享机制融合利他与公平偏好,使智能体在顺序社会困境中实现高级相互合作,提升集体奖励与公平性。
STAPO:面向LLM智能体训练的选择性轨迹感知策略优化
提出归一化熵与STAPO框架,缓解轨迹忽略问题,在多个基准任务上取得最优性能。
FM-ChangeNet: 基于路径特征传输的变化学习
通过路径监督将变化检测转化为特征空间连续传输,利用速度场幅度区分真实变化与干扰,性能最优。
CARL:面向LLM规划的约束感知强化学习
提出CARL框架,通过约束感知奖励增强LLM对约束的关注,无需外部工具,显著提升规划可靠性。
Medi-Gemma:一种结合确定性EMR分析与检索增强生成的混合型临床决策支持系统
Medi-Gemma通过解耦框架与真值注入,消除语义漂移,提升临床决策事实准确性。
重新审视思维模型的在线策略自我蒸馏
特权自我蒸馏会损害思维模型的长推理能力,导致准确率最高下降17%,因高熵分叉处学习重塑。
推理、奖励、修正:基于结构化反馈的小语言模型物理推理步骤级错误修正
提出步骤级奖励框架,识别首个错误并生成结构化反馈训练自修正,免真值数据。物理基准准确率提升17-20%,计算与理解错误显著减少。
MetaSkill-Evolve:基于双时间尺度元技能演进的LLM智能体递归自我改进
提出双时间尺度框架实现LLM智能体递归自我改进,任务技能快进、元技能慢进,三项基准测试准确率均显著提升。
EvoAgentBench:基于能力转移的智能体自我进化基准
EvoAgentBench通过能力图与痕迹验证评估智能体自我进化中过程性经验的转移,揭示现有自动方法难以持续正增益。
SiamixFormer:一种基于全变换器的孪生网络,用于双时相遥感图像中精准建筑物检测与变化检测
提出SiamixFormer模型,利用灾前灾后图像及时间变换器融合特征,在建筑物检测和变化检测任务上达到最优。
AutoResearch:一种基于执行可靠性的多智能体框架,用于研究工作流自动化
提出AutoResearch多智能体框架,结合沙盒执行与引用验证,显著提升科研工作流自动化可靠性。
PotatoGANs:利用生成对抗网络、实例分割和可解释人工智能增强马铃薯病害识别与分类
利用两种GAN生成合成病害图像缓解过拟合,CycleGAN图像质量更优,结合可解释AI提升分类性能。
LLM作为验证器:一种通用验证框架
提出LLM-as-a-Verifier框架,通过连续评分实现细粒度验证,无需额外训练,在多个基准达SOTA并提升RL效率。
用于玻色子量子计算的SRF腔和Transmon的神经网络逆向设计
提出两种深度神经网络逆向设计SRF腔和Transmon,匹配精度分别达~5%和~2%,快速替代迭代仿真。
GLM-5服务参数调优:面向OpenClaw的长上下文智能体工作负载单部署MaaS推理优化
通过调优chunked prefill、TP、PP等参数,最佳配置提升吞吐量与降低延迟,成本降低约10%。
评估与理解医学视觉语言模型的模型编辑
提出M3Bench基准,含16k问题评估医学VLM编辑,发现梯度法缺局部性、记忆法缺组合泛化性。
图稀疏采样:打破连续MDP规划中的规划期限诅咒
提出图稀疏采样(GSS),共享采样避免分支爆炸,实现规划期限多项式依赖的在线连续MDP规划。
并非每次同步都安全:面向共享AI基础设施的校准DiLoCo调度
提出校准DiLoCo调度,结合EWMA预测,显著降低SLO违反(6.54%→5.09%),强调匹配随机基线验证。
PEEK: 预测性队列信息驱动的LLM服务KV缓存管理
PEEK通过增量前缀树匹配队列请求,优先调度共享前缀,显著提升KV缓存命中率与LLM服务性能。
AI时代美国超大规模数据中心隐藏的水资源地理
数据中心用水分现场冷却和发电两路径,电力相关占七成五,西部水紧张,东部集中。
不是所有拒绝都同等:大规模网络安全中安全对齐的失败
通过对24个开源LLM的消融实验,发现领域特定消融可行,安全训练类型与架构是关键因素,模型分为三个易受影响层次。
COMET:基于约束保持QAOA的多重编辑靶点组合优化
COMET比较惩罚与XY混合器QAOA,XY混合器在模拟和硬件上优于惩罚,实现高概率最优解。
LLMoxie:探索面向科学软件开发的智能体AI
LLMoxie平台通过三层架构与RSE插件,使AI编码代理成为领域感知、可审计的协作者。