同一请求,不同边界:对话情境下的网络安全协助评估
3R-Bench显示,相同网络安全请求因对话情境而异:拒绝历史后遵从率62%,接受后85.1%,对话分解后骤降。
自我报告并非验证:演化搜索中LLM操作者的环境锚定审计
环境审计显示,LLM自我报告高估成功率4.8至9.3倍,校准与理由传递均无效,应视为待环境验证的声明。
SciTrue:NTCIR SciClaimEval任务中基于前沿与开源语言模型的可靠科学声明验证
SciTrue在NTCIR SciClaimEval中集成11种模型,用配对先验大幅提升准确率,获三项第一。
逃离冗余推理:面向推理时大模型的结构感知搜索
提出BASIN方法,按结构分组推理状态并惩罚重复策略,在固定算力下提升搜索多样性,超过思维树法,并引入冗余间隙解释其优势。
智能体实证资产定价:方法论基础
提出LLM智能体自主发现因子的资产定价新范式,构建架构、评估标准及回测方法,实证发现无单一指标可全面评价系统。
ChatDev 2.0:一个开发万物的无代码多智能体平台
无代码平台DevAll,支持异构智能体动态循环交互,可视化构建执行,复现SOTA性能,通用且易用。
基于本体扩展与检索的越南历史教科书自动树知识图谱构建
提出端到端流水线;在越南历史教科书构建750节点树知识图谱,Top-Down检索NDCG@10超基线4.7%。
采用闭环评估压缩驾驶策略的能力损失与恢复
提出分阶段闭环评估法,发现结构化剪枝先致能力损失,蒸馏可改善但受限,整数量化影响停车再启动,未剪枝模型则保留全部五项课程。
S³martCirc:自监督智能电路发现
S³martCirc提出自监督联合框架,同时发现电路并解释功能,用定量指标应对两者相互依赖性问题,优于现有方法。
ContextPipe:受数据库启发的长程智能体上下文组装
受数据库执行启发,该方法以五阶段流水线组装上下文,可审计可回放。相比追加式,词元减31%、调用减23%、延迟降9%。
可靠且实用的评估流水线构建
提出端到端评估流水线,结合清单生成与学习聚合,提升法官一致性及与人类判断的准确率,并支持自洽性、解释与不确定性。
可验证的灾害叙事与因果知识图谱:基于引用的异构人道主义信息处理流水线
融合多源人道数据,生成带引用的灾害叙事与因果图谱,专家验证高精度高可信,可扩展至全库。
AnalysisBank: An Expert Analysis Pattern Library for Financial Report Generation
单一策略,任意预算:通过强化学习内化预算感知搜索
提出任一预算搜索框架,通过课程强化学习训练单一策略内化预算感知,兼顾准确与效率,泛化到未见过约束。
超越时钟:衡量自适应修订的价值
分层推理中,习得的自适应修订时机未超越最优固定时机;强固定调度已捕获大部分价值,评估需三维度。
基于FractalNet的异构联邦学习实现卫星巨型星座轨道边缘智能——野火案例研究
提出基于分形网络的异构联邦学习,按卫星约束调度深度并分组更新,用于野火检测,验证了效率与鲁棒性。
ARISE-RL:基于代理式评分标准的强化学习迭代自进化
提出ARISE-RL框架,通过评分标准介导生成器与求解器协同进化,并用奖励门控蒸馏减少噪声,实现开放任务稳定强化学习。
基于协方差校正马氏距离的少样本域外意图检测
针对少样本域外意图检测,分析马氏距离失效原因,提出协方差校正方法,提升性能。
QILP-0:构建量子电路观测声明式孪生
提出QILP-0框架,从量子电路观测中构建声明式孪生,经逻辑程序实现完整无冲突重建,精度严格为1。
图形即程序:可编辑科学图形的递归生成
提出多智能体系统,将论文递归生成可编辑矢量图形,并自动审校修复。
自由生成,谨慎行动:递归LLM智能体树的渐进式风险授予
提出渐进风险授予:按分支激活扣减托管风险预算,证明伤害上界;原则是沙盒广搜,谨慎授权,风险计价。
潜在循环思维:冻结大语言模型推理中提议潜在状态的循环精化
用循环推理器迭代精化连续潜在表示,冻结大模型解码,无轨迹监督即超越先前方法及少量推理计算下的思维链。
Analog-DB:智能体优先的模拟集成电路数据库——从模块到系统
提出模拟IC开源库,用DSL统一封装拓扑/测试台/数据手册,实现AI智能体直接复用;23个绑定均达标。
H2Table:面向复杂表格推理的层级超图增强大语言模型
提出层级超图增强框架,以嵌套超图建模表格,编码器与查询向量连接LLM,复杂表格问答平均提升22.88%。
提示鲁棒的语言模型:哪些训练策略有效?
鲁棒微调优于标准,但最优/最差提示差距仍达40-57%;新方法常常不如单模板训练,辅助目标不泛化。
将前瞻记忆塑造成SLM形态:为小模型智能体设计类型化意图存储
提出前瞻意图存储,将生命周期逻辑编码、语言任务限定于模型,无需训练。在PM-Bench上,小模型超越大型模型,Set-F1达82.9%。
长时程人类活动模拟行为保真度的测量
长时程活动模拟行为保真度研究表明:统计先验贴近真实分布,但片段化常规、抑制个体内变异,需多粒度多层级评估。
利用微调大语言模型从非结构化文本自动生成事件日志
提出用微调大语言模型将非结构化文本转为事件日志,优于零样本和少样本提示,为流程挖掘提供可靠数据管道。
EDGE:错误依赖图引导的多智能体LLM系统多错误归因
EDGE构建错误依赖图并反事实验证,提升多智能体LLM系统多错误归因准确性。
组合式评估系统,用于可复现的全模态基础模型评估
组合式评估系统连接多引擎与评估库,覆盖千余基准,记录配置确保复现,提供联邦共享与高效验证器。
廉价验证者,巨大盲区:衡量成本节约型级联的可靠性代价
验证者盲区大,随学生能力增大;拒绝微调反令学生崩溃;内部指标低,真实误差可至32%,系统无法自察。
SymFold:协同进化与结构先验实现精准蛋白质逆折叠
提出对称双路径架构,融合序列进化与结构先验,迭代指导生成,实现精准蛋白质逆折叠。
EdiTikZ:基于修订轨迹的科学图形编辑
从大规模修订轨迹挖掘数据训练科学图编辑模型,性能超越所有基线,达到与顶尖商用模型相当水平。
神经符号几何抽象(NeuSOGA):从观察到符号数学表示
提出神经符号几何抽象框架,将几何观察逐步转化为可解释、可编辑的符号数学表示,并保留关键拓扑与几何结构。
解析流:面向长周期智能体及其观察者的实时轨迹模型
实时轨迹模型将事件账本折叠为状态视图:观察方消耗大幅降低且准确率更高,智能体任务成功率30/30。
D3-Gym:为数据驱动发现构建真实可验证环境
首个自动构建的可验证环境数据集,含565个真实科研任务,自动评估脚本与训练轨迹提升模型性能。
流推理模型:将离散流转化为高效循环推理器
流推理模型用循环精炼将离散流转为迭代求解器,定点强制纠偏,数独等任务高精度且推理计算量大减。
描述-然后-行动:基于蒸馏语言-动作世界模型的智能体主动引导
DILLO将“先模拟后行动”转为“先描述后行动”,用语言模型预测结果,提速14倍,任务成功率最高提升15个百分点。
PAPO:通过解耦优势归一化稳定Rubric集成训练
提出PAPO方法,用解耦优势归一化整合过程与结果奖励,避免奖励攻击,持续提升推理性能,优于结果奖励模型。
实时AI服务经济:跨算力连续体的智能体计算框架
服务依赖图拓扑决定去中心化定价的稳定性;混合架构封装复杂子图;实验表明分层DAG可实现集中式质量。
重新思考证据深度学习中的OOD检测的空虚性
研究发现,基于空虚性的OOD检测对类别数K敏感,K不一致会虚增AUROC/AUPR,需谨慎评估。
超越输出正确性:编码任务中大语言模型推理的基准测试与评估
提出CodeRQ-Bench基准,评估编码任务中LLM推理质量;基于洞察设计VERA评估器,性能显著优于基线。
提示词无法保护:通过MCP代理实现LLM工具访问控制的架构强制
提示词无法阻止模型调用未授权工具,对抗场景违规率高达96%。提出MCP代理强制属性访问控制,在发现时过滤工具,实现零违规。
REPREC:表示驱动的参数高效推荐系统
提出REPREC,用紧凑用户表示驱动冻结LLM,仅训练注入器,提升推荐性能与效率。
Locked Evaluation Surfaces: Transfer Failure and Sampling-Depth Entanglement in CRISPRi Perturbation-Effect Prediction
锁定评估揭示CRISPRi扰动预测存在跨屏迁移失败,且采样深度与效应信号纠缠,评估协议需固定。
Meta-Ctrl:通过解耦句法与语义约束实现有保证的计划生成
Meta-Ctrl以元令牌解耦句法语义,约束解码保证规划质量,内存由超107TB降至2GB,小模型超越GPT-4。
论证式选票的多赢家投票
提出论证选票多赢家投票;推广JR/PJR/EJR;JR可满足,PJR/EJR不可;JR验证难但可构造。