5873 条条目 · 106 个活跃源
2026年9月2日
04:00
ArXiv AI

同一请求,不同边界:对话情境下的网络安全协助评估

3R-Bench显示,相同网络安全请求因对话情境而异:拒绝历史后遵从率62%,接受后85.1%,对话分解后骤降。

04:00
ArXiv AI

自我报告并非验证:演化搜索中LLM操作者的环境锚定审计

环境审计显示,LLM自我报告高估成功率4.8至9.3倍,校准与理由传递均无效,应视为待环境验证的声明。

04:00
ArXiv AI

SciTrue:NTCIR SciClaimEval任务中基于前沿与开源语言模型的可靠科学声明验证

SciTrue在NTCIR SciClaimEval中集成11种模型,用配对先验大幅提升准确率,获三项第一。

04:00
ArXiv AI

逃离冗余推理:面向推理时大模型的结构感知搜索

提出BASIN方法,按结构分组推理状态并惩罚重复策略,在固定算力下提升搜索多样性,超过思维树法,并引入冗余间隙解释其优势。

04:00
ArXiv AI

智能体实证资产定价:方法论基础

提出LLM智能体自主发现因子的资产定价新范式,构建架构、评估标准及回测方法,实证发现无单一指标可全面评价系统。

04:00
ArXiv AI

ChatDev 2.0:一个开发万物的无代码多智能体平台

无代码平台DevAll,支持异构智能体动态循环交互,可视化构建执行,复现SOTA性能,通用且易用。

04:00
ArXiv AI

基于本体扩展与检索的越南历史教科书自动树知识图谱构建

提出端到端流水线;在越南历史教科书构建750节点树知识图谱,Top-Down检索NDCG@10超基线4.7%。

04:00
ArXiv AI

采用闭环评估压缩驾驶策略的能力损失与恢复

提出分阶段闭环评估法,发现结构化剪枝先致能力损失,蒸馏可改善但受限,整数量化影响停车再启动,未剪枝模型则保留全部五项课程。

04:00
ArXiv AI

S³martCirc:自监督智能电路发现

S³martCirc提出自监督联合框架,同时发现电路并解释功能,用定量指标应对两者相互依赖性问题,优于现有方法。

04:00
ArXiv AI

ContextPipe:受数据库启发的长程智能体上下文组装

受数据库执行启发,该方法以五阶段流水线组装上下文,可审计可回放。相比追加式,词元减31%、调用减23%、延迟降9%。

04:00
ArXiv AI

可靠且实用的评估流水线构建

提出端到端评估流水线,结合清单生成与学习聚合,提升法官一致性及与人类判断的准确率,并支持自洽性、解释与不确定性。

04:00
ArXiv AI

可验证的灾害叙事与因果知识图谱:基于引用的异构人道主义信息处理流水线

融合多源人道数据,生成带引用的灾害叙事与因果图谱,专家验证高精度高可信,可扩展至全库。

04:00
ArXiv AI

AnalysisBank: An Expert Analysis Pattern Library for Financial Report Generation

04:00
ArXiv AI

单一策略,任意预算:通过强化学习内化预算感知搜索

提出任一预算搜索框架,通过课程强化学习训练单一策略内化预算感知,兼顾准确与效率,泛化到未见过约束。

04:00
ArXiv AI

超越时钟:衡量自适应修订的价值

分层推理中,习得的自适应修订时机未超越最优固定时机;强固定调度已捕获大部分价值,评估需三维度。

04:00
ArXiv AI

基于FractalNet的异构联邦学习实现卫星巨型星座轨道边缘智能——野火案例研究

提出基于分形网络的异构联邦学习,按卫星约束调度深度并分组更新,用于野火检测,验证了效率与鲁棒性。

04:00
ArXiv AI

ARISE-RL:基于代理式评分标准的强化学习迭代自进化

提出ARISE-RL框架,通过评分标准介导生成器与求解器协同进化,并用奖励门控蒸馏减少噪声,实现开放任务稳定强化学习。

04:00
ArXiv AI

基于协方差校正马氏距离的少样本域外意图检测

针对少样本域外意图检测,分析马氏距离失效原因,提出协方差校正方法,提升性能。

04:00
ArXiv AI

QILP-0:构建量子电路观测声明式孪生

提出QILP-0框架,从量子电路观测中构建声明式孪生,经逻辑程序实现完整无冲突重建,精度严格为1。

04:00
ArXiv AI

图形即程序:可编辑科学图形的递归生成

提出多智能体系统,将论文递归生成可编辑矢量图形,并自动审校修复。

04:00
ArXiv AI

自由生成,谨慎行动:递归LLM智能体树的渐进式风险授予

提出渐进风险授予:按分支激活扣减托管风险预算,证明伤害上界;原则是沙盒广搜,谨慎授权,风险计价。

04:00
ArXiv AI

潜在循环思维:冻结大语言模型推理中提议潜在状态的循环精化

用循环推理器迭代精化连续潜在表示,冻结大模型解码,无轨迹监督即超越先前方法及少量推理计算下的思维链。

04:00
ArXiv AI

Analog-DB:智能体优先的模拟集成电路数据库——从模块到系统

提出模拟IC开源库,用DSL统一封装拓扑/测试台/数据手册,实现AI智能体直接复用;23个绑定均达标。

04:00
ArXiv AI

H2Table:面向复杂表格推理的层级超图增强大语言模型

提出层级超图增强框架,以嵌套超图建模表格,编码器与查询向量连接LLM,复杂表格问答平均提升22.88%。

04:00
ArXiv AI

提示鲁棒的语言模型:哪些训练策略有效?

鲁棒微调优于标准,但最优/最差提示差距仍达40-57%;新方法常常不如单模板训练,辅助目标不泛化。

04:00
ArXiv AI

将前瞻记忆塑造成SLM形态:为小模型智能体设计类型化意图存储

提出前瞻意图存储,将生命周期逻辑编码、语言任务限定于模型,无需训练。在PM-Bench上,小模型超越大型模型,Set-F1达82.9%。

04:00
ArXiv AI

长时程人类活动模拟行为保真度的测量

长时程活动模拟行为保真度研究表明:统计先验贴近真实分布,但片段化常规、抑制个体内变异,需多粒度多层级评估。

04:00
ArXiv AI

利用微调大语言模型从非结构化文本自动生成事件日志

提出用微调大语言模型将非结构化文本转为事件日志,优于零样本和少样本提示,为流程挖掘提供可靠数据管道。

04:00
ArXiv AI

EDGE:错误依赖图引导的多智能体LLM系统多错误归因

EDGE构建错误依赖图并反事实验证,提升多智能体LLM系统多错误归因准确性。

04:00
ArXiv AI

组合式评估系统,用于可复现的全模态基础模型评估

组合式评估系统连接多引擎与评估库,覆盖千余基准,记录配置确保复现,提供联邦共享与高效验证器。

04:00
ArXiv AI

廉价验证者,巨大盲区:衡量成本节约型级联的可靠性代价

验证者盲区大,随学生能力增大;拒绝微调反令学生崩溃;内部指标低,真实误差可至32%,系统无法自察。

04:00
ArXiv AI

SymFold:协同进化与结构先验实现精准蛋白质逆折叠

提出对称双路径架构,融合序列进化与结构先验,迭代指导生成,实现精准蛋白质逆折叠。

04:00
ArXiv AI

EdiTikZ:基于修订轨迹的科学图形编辑

从大规模修订轨迹挖掘数据训练科学图编辑模型,性能超越所有基线,达到与顶尖商用模型相当水平。

04:00
ArXiv AI

神经符号几何抽象(NeuSOGA):从观察到符号数学表示

提出神经符号几何抽象框架,将几何观察逐步转化为可解释、可编辑的符号数学表示,并保留关键拓扑与几何结构。

04:00
ArXiv AI

解析流:面向长周期智能体及其观察者的实时轨迹模型

实时轨迹模型将事件账本折叠为状态视图:观察方消耗大幅降低且准确率更高,智能体任务成功率30/30。

2026年9月1日
04:00
ArXiv AI

D3-Gym:为数据驱动发现构建真实可验证环境

首个自动构建的可验证环境数据集,含565个真实科研任务,自动评估脚本与训练轨迹提升模型性能。

04:00
ArXiv AI

流推理模型:将离散流转化为高效循环推理器

流推理模型用循环精炼将离散流转为迭代求解器,定点强制纠偏,数独等任务高精度且推理计算量大减。

04:00
ArXiv AI

描述-然后-行动:基于蒸馏语言-动作世界模型的智能体主动引导

DILLO将“先模拟后行动”转为“先描述后行动”,用语言模型预测结果,提速14倍,任务成功率最高提升15个百分点。

04:00
ArXiv AI

PAPO:通过解耦优势归一化稳定Rubric集成训练

提出PAPO方法,用解耦优势归一化整合过程与结果奖励,避免奖励攻击,持续提升推理性能,优于结果奖励模型。

04:00
ArXiv AI

实时AI服务经济:跨算力连续体的智能体计算框架

服务依赖图拓扑决定去中心化定价的稳定性;混合架构封装复杂子图;实验表明分层DAG可实现集中式质量。

04:00
ArXiv AI

重新思考证据深度学习中的OOD检测的空虚性

研究发现,基于空虚性的OOD检测对类别数K敏感,K不一致会虚增AUROC/AUPR,需谨慎评估。

04:00
ArXiv AI

超越输出正确性:编码任务中大语言模型推理的基准测试与评估

提出CodeRQ-Bench基准,评估编码任务中LLM推理质量;基于洞察设计VERA评估器,性能显著优于基线。

04:00
ArXiv AI

提示词无法保护:通过MCP代理实现LLM工具访问控制的架构强制

提示词无法阻止模型调用未授权工具,对抗场景违规率高达96%。提出MCP代理强制属性访问控制,在发现时过滤工具,实现零违规。

04:00
ArXiv AI

REPREC:表示驱动的参数高效推荐系统

提出REPREC,用紧凑用户表示驱动冻结LLM,仅训练注入器,提升推荐性能与效率。

04:00
ArXiv AI

Locked Evaluation Surfaces: Transfer Failure and Sampling-Depth Entanglement in CRISPRi Perturbation-Effect Prediction

锁定评估揭示CRISPRi扰动预测存在跨屏迁移失败,且采样深度与效应信号纠缠,评估协议需固定。

04:00
ArXiv AI

Meta-Ctrl:通过解耦句法与语义约束实现有保证的计划生成

Meta-Ctrl以元令牌解耦句法语义,约束解码保证规划质量,内存由超107TB降至2GB,小模型超越GPT-4。

04:00
ArXiv AI

论证式选票的多赢家投票

提出论证选票多赢家投票;推广JR/PJR/EJR;JR可满足,PJR/EJR不可;JR验证难但可构造。