GENCO:嵌入开发框架的电网稳态分析统一神经求解器
提出统一神经求解器GENCO,集成于GridFM框架,高效求解潮流、最优潮流与状态估计,较经典方法提速数十倍,且抗噪鲁棒。
AI生成虚假信息治理中的协同激励
三方博弈表明,监管奖惩、企业声誉损失与用户激励需协同超阈值,方能稳定遏制虚假信息。
经验敏感型游戏学习:人类与语言代理的行为研究
研究反复游戏中人类与语言代理的行为变化:人类由局部贪心转向全局策略,自进化代理提升短暂且不稳定。
基于《反人类卡片》的跨模型幽默偏好建模
含理由的行为证据使跨模型幽默偏好预测准确率从极低升至八成以上;角色指令与模型身份增益有限,属操作非表征心智理论。
如何向AI提问:面向大语言模型提示的用户视角综述
从用户视角综述提示原则与组织,提供评估策略、工作流演示及动态开源项目,降低提示门槛。
驾驭丰裕:人类与生成式AI协作的生成性视角
从生成性视角提出“生成性契合”机制,揭示丰裕对人机创意协作的双刃剑效应及转化路径。
懂你即一切:LLM智能体在社交媒体模拟中实现近乎完美的画像一致性反应预测
完整画像下LLM预测准确率最高96.68%,且能零样本泛化新帖,优于监督模型;仅人口统计信息无预测力。
CASE框架:治理企业智能体AI的多学科控制架构
将智能体治理分为个体控制、集体涌现、人机监督、工程运维四层;实证显示82%故障跨层,存在涌现鸿沟。
用于生成LLM攻击的GFlowNet方法
提出用GFlowNets自动化红队测试,以一大模型攻击另一大模型,生成更有效英文攻击,并首创土耳其语攻击输入生成。
TRACE:可信检索增强对话引擎
检索质量决定公共服务对话系统可靠性,TRACE框架提升约束满足、减少幻觉。
后验稀疏编码视觉语言模型代理间潜在通信
研究视觉语言模型代理间潜在通信压缩,稀疏编码使传输量降128倍,七任务精度几乎不变,显示强可压缩性。
利用语义站点嵌入增强的强化学习缓解公交串车
LLM离线生成语义站点嵌入,改进Q学习公交控制,使车头时距波动降32%、串车降69%、等待降24%。
迈向评估型AI的论证基础
主张用计算论证为评估型AI提供形式化可计算基础,支持可解释、可质疑的决策,迈向分布式人本AI。
当LLM智能体进行谈判:供应链中的私人信息与动态议价
九大LLM智能体谈判9840轮:能力强则价值高但延迟损耗21-34%;供应商身份决定分配;提示词成战略杠杆。
结构理论中的确定性化:基于闭包、可比性和联合可采纳性的统一框架
提出结构理论统一框架,区分三种确定性层次,以闭包或选择实现确定性化,并应用于幻觉分析。
NL2SHACL-Bench:自然语言到SHACL翻译的基准套件
提出NL2SHACL-Bench基准,评估四个大语言模型:可生成语法正确的SHACL,但复杂语义约束仍难。
不漂移的AI科学家:四足导航研究循环中的品味、结构与可证伪发现
结构约束防止漂移,品味oracle决定探索方向,使AI科学家验证假设而非局部优化。
TREAT:评估等价数学表示下形式知识的获取
提出TREAT基准,评估模型在等价数学变换下识别定理身份,最佳准确率仅60.73%,显示形式知识获取脆弱。
CMU-Drive 与 V2V-VLA:面向推理基准和车对车视觉-语言-动作模型的多智能体协同统一驾驶
提出协同驾驶基准与V2V-VLA模型,实现多车统一感知推理规划,奠定端到端协同自动驾驶基础。
TeXFix-Bench:面向大语言模型文档源码修复的实证多格式基准
构建TeXFix-Bench多格式文档修复基准,基于实证故障分类,评估7个LLM,发现编译成功不代表修复质量,Typst更难。
持续LLM智能体中的受控记忆干扰
提出受控记忆干扰框架,揭示关系性干扰抑制可塑性、毒化依赖权威线索,并提供对抗干扰的学习样本。
基于多层组合融合的上下文价值对齐
提出多层组合融合框架,利用多智能体扩展与约简,提升上下文价值对齐,超越现有基线。
从单一聊天机器人到受治理的智能体生态系统:面向关键任务医院信息管理系统的智能体AI模式目录与编排框架
提出合规优先代理AI框架,将医院信息系统从单一聊天机器人转向受治理代理生态,降低成本,确保治理与审计。
一种智能体AI框架克服大语言模型在眼底照片青光眼检测中的根本局限
智能体框架整合LLM与专用工具,青光眼检测准确率提高16-47个百分点,一致性近完美。
AndroidReality:移动智能体距离真实世界还有多远?
构建AndroidReality扰动基准,从状态/转移/动作三轴评估鲁棒性,揭示显著差距并提出免训练TTIR缓解。
CliniCARE-Bench:电子健康档案中临床医疗推理的校准审计
首个面向临床部署的智能体基准,评估真实纵向EHR调查、证据 grounding、政策遵循与校准弃权;原始准确率常高估质量,无缺陷准确率重排榜单。
法官不应裁决之时:证据锁定、非补偿性选择约束推理流水线中的LLM法官失误
推理流水线中法官决策取决于规则而非准确性;证据锁定非补偿选择可提升准确率并约束失误,优于多数投票和裸法官。
SurgLAT:用于深度感知机器人腹腔镜控制的外科潜意注意力追踪
SurgLAT在线追踪外科潜意注意力,实现机器人腹腔镜自主控制,经真实视频与物理平台验证,抗遮挡与快速运动。
反事实基准测评与训练:增强大语言模型在异构知识上事实一致性与顺序鲁棒的接地推理
提出TKFQA基准与ORLF训练框架,评估并增强大模型在异构知识上反事实推理的事实一致性与顺序鲁棒性。
广推理而非深推理:将推理溢价摊销为蒸馏技能
将推理过程蒸馏为技能,非推理模型以少量令牌恢复55%-100%性能,且无需推理轨迹。
TelemetrySuffBench:智能体遥测是否足以诊断故障起源?
提出遥测充分性基准,发现智能体遥测能检测故障却难以定位源头,须引入决策-来源关联与弃权机制。
GRACE:面向可扩展混合数据聚类的LLM语义度量空间
提出GRACE,基于LLM语义空间实现可扩展混合数据聚类,精度与可解释性优于11种方法。
ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration
TongGuOCR:面向中文历史文档的布局感知与令牌增强OCR框架
提出通古OCR框架,结合布局感知与令牌增强,改善中文历史文档识别,效果领先。
REIN:通过反思与弃答对齐弥合推理与可靠性之间的差距
REIN通过反思与弃答对齐,先反思再作答,不确定时弃答,减少幻觉,提升选择性准确率,保持高覆盖率。
CyberAGENTS:网络安全中代理化游戏化学习的结构化自主性
提出CyberAgents框架,用本体验证和模式控制实现结构化自主,提升网络安全游戏化学习的参与度与信任。
思维级束搜索用于推理
提出Gambit算法,通过思维级束搜索动态分配算力至最有希望的推理轨迹,提升精度与吞吐,降低计算消耗。
多用户冲突中的权威预期效应
研究显示LLM中权威信号改变判断,存在权威预期效应:参照依赖、证据重构、方向敏感。
使用人工智能自主代理的法律责任
AI代理失控致损引发责任归属难题,可用Promise Theory下游原则扩展责任,并以政策限制代理自由。
SkillSmith:通过自动技能构建与进化增强本地部署智能体
SkillSmith通过云-端协作,自动构建并进化技能知识,弥补本地小模型环境知识不足,使其任务效果媲美云端大模型,并大幅减少操作步数。
决策在上游,写入在后期:定位与定价多语言MoE的跨语言拒绝回路
多语言拒答不均非检测失败,而由后期电路写入,干预成本因方式而异。
JustLLMGRPO:面向胸部X光生成的放射学控制
仅优化LLM提示策略并冻结生成器,用GRPO保持对齐,将RadDINO-FID降低50.6%,实现SOTA。
CORDA:大型语言模型中层级化以伤害为中心的道德推理基准
提出CORDA基准,评估大模型在道德冲突中按指定优先级排序的能力,发现模型默认回避直接伤害但难以灵活调整。
代数图构造的神经符号发现
神经符号方法无需微调,结合数学软件发现图代数构造;百个对称图全部成功,找到最小反例。
说服与顺从倾向预测人类与语言模型的群体决策
语言模型群体互动中,说服倾向无益,顺从倾向促进合作但利于伪装,需纳入安全评估。
大语言模型量化退化:信号-噪声视角
量化退化取决于误差如何产生及跨层累积,受位宽、任务、方法和规模影响,可用信噪比解释。
Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expensive Evaluation Budgets
面向智能交通系统的大型多模态代理:架构、证据与部署挑战
综述42项研究,区分多模态与代理,证据显示其适合语义与协调,关键决策须专业系统,支持受限编排。
面向风险敏感溯因的最小κ-τ逻辑
提出最小κ-τ逻辑,以假设交互(κ)和承诺阈值(τ)治理风险敏感溯因中的承诺,非推断强制,支持合成与分析双模式。
长SKILL合规作为逻辑推理:闭包约束检测与缩放引导的在线策略蒸馏
SkillCDG以双层约束依赖图表示长SKILL,通过两级检索与闭包实现合规检测,F1升12.8%、token降64.3%,并利用缩放趋势指导小模型蒸馏。