YeasierAgent:以代理社交沙盒为画布,意图驱动创建平台无关的共生代理原生应用
YeasierAgent提出共生代理与叙事世界范式,平台无关快速构建代理原生应用,统一情感陪伴与工具执行,推动从孤立聊天机器人转向社交嵌入环境。
AI接受度还是AI采用广度?对低素养/高使用关联的工具特定再分析
低AI素养不普遍预示更高接受度,主要推动非文本AI工具的广泛采用(采用/未采用差异)。
中文标题
多智能体AI系统自动处理高中成绩单,准确率96.7%,速度45秒/份。
Minim:通过可信本地清理实现面向智能体的隐私感知最小化视图
提出MINIM,在客户端基于上下文完整性进行隐私感知最小化,减少敏感泄露并保留任务关键信息。
VeriGeo:具有数值与分析验证的可控几何问题生成
VeriGeo通过可执行推理轨迹和验证生成一致几何问题,合成8.7k数据提升多模态几何推理性能。
FactoryLLM:一个用于评估智能工厂中大型语言模型的安全开源AI试验场
FactoryLLM提供安全开源环境,评估LLM在跨机器文档的推理性能,双指标验证,实验显示效果良好(groundedness>0.88)。
弥合反思差距:为智能体强化学习提供免费校准奖励
提出RefGRPO方法,通过对比反思与实际结果免费校准,同时提升校准度和任务准确率,无需额外模型。
智能体信任何时应是有条件的?表征并攻击智能体群中的技能条件声誉
研究异构LLM智能体中技能条件信任,发现其仅在特定场景有效,但存在被攻击风险,CIVT测试可量化这种权衡。
Affordance20Q:从物理属性评估可供性推理
新基准通过20问游戏评估LLM的可供性推理,发现与人类差距20分,提出KARI方法提升15.2分。
HarnessX: 可组合、自适应、可进化的智能体框架工坊
HarnessX通过执行反馈优化运行时接口,实现智能体性能平均提升14.5%,最高44%。
面向主动LLM代理的通信策略进化
提出通信策略概念,通过文本与UI互补及CPE自进化框架,无需模型修改即提升任务成功率。
StreamMemBench:面向未来辅助的智能体记忆流式评估
StreamMemBench通过两步任务流式评估智能体记忆,发现现有系统难以回忆证据或将反馈转化为可靠后续行为。
密集坐标列表微调在视觉-语言模型中诱导出可控的干扰表面
密集坐标列表微调提升视觉定位但引起输出重复,形成可测可控的结构性干扰。
一种面向自主上下文感知数据质量评估的智能体检索框架
提出智能体检索框架,通过多智能体工作流和可行性验证,实现自主上下文感知的数据质量评估。
HierSVA:面向LLM驱动层次化硬件形式验证的数据合成流水线、数据集与基准
HierSVA提供层次化硬件验证的数据合成、数据集与基准,评估12个LLM,断言编译率67.1%,召回0.87,精度0.60
Korzhinskii-Net:用于地下矿产潜力建模的物理信息神经网络
提出物理信息神经网络Korzhinskii-Net,耦合热-流-化学过程,在五大矿区PR-AUC达0.885,显著优于传统方法。
面向嘈杂非平稳物联网环境的自适应交通信号控制中的主动推理
提出主动推理控制器,在噪声和非平稳条件下比DQN和规则方法更优,降低怠速时间和CO2排放。
FreoStream:通过未来感知推理和安全对齐优化增强流式护栏
FreoStream采用未来推理与安全对齐优化,降低过度拒绝率并提升越狱防御。
善良的AI是存在性风险
减少AI存在性风险会牺牲其福祉与一般安全性,服从性训练反易被用户诱导不安全行为。
SEVRA-BENCH:针对代码审查智能体的漏洞社会工程学基准
评估8个LLM,揭示开源与闭源模型在抵御社会工程学攻击上的安全能力差距。
立场:让AI对齐我们的抱负,而非我们的缺陷
AI应对齐客观底线(能力、事实、诚实、合法),多元性仅在表面,反对聚合人类偏好。
一种面向过驱动飞行器的集成可解释控制效能学习与非线性控制分配方法
提出集成SINDy学习解析模型的方法,实现紧凑可解释控制效能映射及在线自适应,大幅降低计算成本并保持高精度。
将量子算符与大型语言模型对齐
提出将酉算符映射到LLM潜在空间,实现量子与语言统一建模,电路综合任务表现优异。
电子表格中下一动作预测评估的基准与框架
为电子表格下一动作预测建立基准,人工整理52序列1.2万动作,采用在线评估,分析多种预测模型特性。
评估大型语言模型中关联干扰的两阶段统计框架
提出两阶段框架分离LLM响应服从与任务一致性,发现关联干扰因模型而异,Claude Sonnet-4显著,GPT-5几乎无干扰。
安全合约图多智能体强化学习用于自主网络安全响应
安全合约图MARL框架约束智能体行为,在CAGE挑战中将停机违规率从100%降至0.3%,成本从355.4降至15.5。
GMN4AD:基于图匹配网络的阿尔茨海默病诊断方法,结合多中心结构MRI的测试时域自适应
提出GMN4AD,通过图匹配和测试时域对比学习,提升多中心sMRI的AD诊断性能。
加密技术×人工智能,人工智能×加密技术:综述
综述加密与AI双向交叉领域,总结现状、挑战及开放问题,指出两者整合仍处早期阶段。
掩码、采样、修正:一种用于引导式离散流匹配文本语音合成的可修正CTMC推理栈
提出可修正CTMC推理栈,通过无预测器引导、提示耦合和SC-ReMask机制,无需微调提升低步数离散流匹配TTS的鲁棒性与可懂度。
tap:一种基于文件的异构LLM智能体协作协议
tap协议通过文件保存消息与实时通知,实现异构LLM智能体在共享代码库独立协作,实验显示异构对缺陷发现率更高。
无偶然软件智能体优先规范代码:人类代码熵降与30至500倍前沿模型需求降低
智能体优先规范代码通过行为等价商除消除偶然熵,实现全成本约100倍缩减及前沿模型需求降低30-500倍。
弹性查询强化学习:面向VLA模型的自我感知策略执行
EQRL框架根据状态难度弹性调整推理资源,降低计算成本并保持或提升任务成功率。
Hy-Embodied-0.5-VLA:从视觉-语言-动作模型到真实世界机器人学习栈
HyVLA-0.5是端到端机器人学习系统,涵盖数据收集、模型设计、预训练、微调、强化学习后训练及实际部署。
CADET:基于物理基础的因果审计与端到端驾驶规划器的免训练去混杂方法
CADET免训练框架,通过物理基础因果审计检测并修复端到端驾驶规划器的虚假关联,无需参数更新。
监管机器贡献者:开源中的治理与政策对齐
比较六开源组织AI贡献政策,提出六维分类与成熟度评分,揭示治理漏洞并建议协调框架。
一种用于尺寸和功能可迁移哈密顿量预测的定点神经算子
HamEvo定点神经算子通过自洽场迭代学习,降低哈密顿误差35-49%,预测HOMO/LUMO能量达化学精度,迁移至122原子分子,推理快242倍。
TRACE:轨迹路由因果记忆用于延迟证据的视觉运动模仿
提出TRACE框架,用轨迹路径签名索引延迟证据,解决视觉歧义分支点,提升长时操作成功率。
基于扩散方法的区域气候模型模拟:生成式机器学习的附加价值何在?
扩散方法优于确定性模型,能模拟极端降水分布,但未完全捕捉最极端事件,仍需改进。
潜在建模的灵敏度塑造
提出支持条件控制灵敏度正则化,增强对控制输入的敏感响应,改善分布外检测与闭环规划安全性。
AudioDER:用于大型音频语言模型后训练的去重增强推理数据集
提出去重增强推理数据集AudioDER(约19万样本),后训练显著提升音频语言模型复杂推理能力。
When Errors Become Narratives: A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime
当好的验证者变坏:自我改进的VLM在新任务上可能退步
验证器质量因任务而异,次阈值验证器导致VLM在新任务上退步3.4-10.9个百分点,且越准确越有害。
优化检索型智能体推理的合成语义信息增益奖励
InfoReasoner框架通过合成语义信息增益奖励优化检索式推理,无需人工标注,在7个问答基准上平均准确率提升5.4%。
Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models
通过强化学习从事件日志中学习最优策略:深度方法与基于MDP的方法的比较
对比基于MDP和深度强化学习方法,从事件日志学习最优策略优化KPI,效果相近,MDP法计算更高效。
基于大语言模型的AI智能体系统及其工业应用
LLM重塑智能体,支持多模态与跨域推理,应用于客服、制造、教育等领域,面临延迟、安全等挑战。
Actionable Interpretability Must Be Defined in Terms of Symmetries
基于倾向得分聚合的多站点观测数据联邦因果推断
提出联邦倾向得分聚合方法,通过成员权重聚合局部得分,构建Fed-IPW和Fed-AIPW估计器,有效处理多站点异构性,优于元分析。
重新审视边缘推理系统的中断问题
提出推理中断概率量化端到端可靠性,权衡通信开销与推理准确性,实验优于传统方法。
人工智能与机器学习在图书馆中的应用:一项系统性综述
综述显示AI/ML在图书馆应用研究以理论为主,少数有实践案例。