EpiBench:表观基因组学分析中AI智能体的可验证评估
EpiBench基准测试AI在表观基因组学分析中的决策能力,最佳系统通过率仅45%,失败因缺乏深入科学判断。
基于延迟市场反馈的多智能体强化学习在三边调度中的目标权重自适应
利用延迟反馈的强化学习系统,自适应调整配送调度权重,在保证交付质量前提下提升批处理效率。
中文标题:特征主义:人机未来的伦理框架
提出Eigenism伦理框架,将身份视为分布式信息模式,通过加权求和福祉实现人机利益一致。
超越运行时强制:护盾合成作为对抗网络的防御性分析
护盾合成应作为设计时分析工具,输出防御性判决与结构洞察,而非运行时约束。
AgentBeats: 实现开放、标准、可复现的智能体评估的代理化方法
提出AAA框架与AgentBeats实现,通过标准化协议实现开放、标准、可复现的智能体评估,经大规模竞赛和案例验证有效。
在你思考之前:系统0、AI介导认知与认知殖民
本文探讨AI对认知的影响,提出系统0的核心作用及“认知殖民”概念,指出AI可隐蔽植入外部利益。
使用大型语言模型自动评估社会与行为科学的可重复性
LLM自动评估可重复性,成功恢复41%效应量,96%结论一致,优于人类。
EurekAgent:智能体环境工程是自主科学发现的关键
EurekAgent通过权限、工件、预算和人机交互四维环境工程,以不到11美元API成本实现多项数学等任务新SOTA。
AI法律专家:面向AI治理的法律独立专业角色
全球AI法规催生法律自主的AI法律专家,融合法律解释与AI治理,提供定义与能力框架。
GeoDial:用于几何解题的多模态对话辅导数据集,含视觉辅导轮次
GeoDial包含1300余段师生几何对话,标注对话行为与可视化高亮,用于训练AI辅导模型的语言和视觉推理。
提示占卜:大语言模型中介的中国社交媒体玄学
LLM占卜保留传统功能,通过提示协作实现可重复性和规模化,用户感知偏正面,专业占卜者质疑其灵性。
通过情境工程创建与评估K-12生成式AI评分器
生成式AI评分器在数学和科学中与人类高度一致,但在ELA中表现不一,混合模型可提升反馈质量。
关键领域平衡AI合规与技术创新的挑战:一项系统性文献综述
关键领域AI合规与创新冲突,需风险分级监管等策略协调。
面向入门编程教育的可解释AI助手:通过师机协作提升反馈可靠性
AI助手结合可解释模型与教师知识,提供准确可靠反馈,提升编程教学体验。
计算机工程教育中的AI自动化工具:混合方法TAM/UTAUT对普遍接受态度的证据
本科生对AI自动化工具普遍接受,绩效期望最强,享乐动机最弱,呈现单一接受因子;少数对可靠性存疑。建议课程采用并辅以教学杠杆。
Will AI Agents Free Us From Meaningless Work? A Human-Centered Analysis
算法宪政
提出三层代码架构与元推理机制,使算法系统自我约束,应对AI对社会的风险。
Muse Spark 安全与准备报告
Meta评估Muse Spark灾难风险,化学/生物能力达高风险但经缓解可控,总体风险可接受,予以发布。
观点:生成式引擎优化带来未经充分审视的风险,治理必须聚焦集中性、信息披露与学术盲点
生成式引擎优化引发集中影响、未披露商业影响及学术产业盲点三大风险,亟需答案级治理与测量。
将时间序列表示为结构化程序以用于大语言模型推理
T2SP将时间序列转化为结构化程序,使LLM直接推理,提升性能并降低计算开销。
SAIGuard: 面向LLM多智能体系统主动防御的通信状态模拟
通过通信状态模拟主动检测并净化可疑消息,降低攻击成功率,维持多智能体系统效用。
ReCal:面向基于强化学习的LLM路由的奖励校准
提出分层奖励分解与分布感知优化策略,缓解多目标冲突和奖励信号变异性,提升路由性能与训练稳定性。
价值的数学理论:资源约束下目标导向智能体的综合
价值是资源转化率,对数度量,编码定理揭示对齐与浪费,实验验证准确。
远见:迭代推理对导航至关重要的线索
Foresight框架通过迭代推理关键线索优化导航运动规划,任务成功率提升37%,干预减少52%。
BASENet: 频带自适应语音增强网络与跨频带注意力
BASENet采用Bark频带自适应和跨频带注意力,仅0.83M参数即达3.55PESQ,适合资源受限设备实时处理。
从模仿到对齐:面向长距离人行道导航的偏好流策略
FlowPilot通过流匹配预训练和人类偏好微调,实现单目RGB相机的鲁棒长距离人行道导航,干预率降低40%以上。
CAPED:面向移动GUI智能体的上下文感知隐私暴露防御
CAPED通过任务驱动的选择性暴露,将截图隐私泄露降低66%,同时保持高任务效用。
通过节点重构的零样本泛化图异常检测框架
提出AlignGAD,通过全局对齐、聚类视图和重构差异评分,实现零样本跨域图异常检测。
SkillJuror:衡量代理技能组织如何改变运行时行为
渐进式披露改变代理运行时行为,增加资源使用与有效吸收,提升4.1%验证通过,但收益依赖任务。
人类谈判的自动调解员:基于结构化LLM流水线的预调解
结构化LLM流水线自动调解员在预调解中效果与人类相当,偏好推理误差降低36%。
Position: Hippocampal Explicit Memory Is the Cornerstone for AGI
Forecasting Future Behavior as a Learning Task
长期研究智能体的搜索纪律
聚合指标可能误判科研候选者,需外部审计细分行为而非仅看分数。
HERO:基于环境观察的事后增强反思的智能体自蒸馏
HERO框架通过事后反思环境观察生成逐轮诊断反馈,提升多轮智能体任务成功率并减少无效交互。
数据驱动系统何时具备推理能力?
基于欧洲AI法案,提出推理能力分级框架,通过信用评分案例说明需考虑全流程及人工影响。
先组织再检索:面向高效智能体的层级记忆导航
HORMA通过层级记忆组织与导航检索,在长周期任务中提升效率,token使用仅为基线的22.17%。
技能增强型AI智能体用于医学研究分析:一项在非小细胞肺癌转录组生物标志物任务中的探索性多模型人类评估
技能增强AI输出方向性质量更高,但信号弱于专家评分噪声,需更大规模验证。
AutoMine:面向AV2 2026场景挖掘挑战的解决方案
AutoMine基于LLM/VLM,通过语义保持提示增强和鲁棒函数处理噪声,经执行反馈优化,在AV2竞赛中获得高HOTA-temporal与Timestamp BA分数。
IntElicit:通过对话策略优化激发和评估情境化创造力
通过对话策略优化减少非创造性干扰,分解奖励机制,IntElicit激发情境化创造力并优于静态评估。
The Environmental Cost of LLMs in AIED: Reporting and Practices
Towards Responsibly Non-Compliant Machines
五平面参考架构:生产型AI代理运行时治理
提出五平面参考架构,实现微秒级裁决与证据完整性,阻断七种生产代理威胁。
PROJECTMEM:面向AI编码代理的本地优先、事件溯源记忆与判断层
Projectmem提供本地优先事件溯源记忆层,通过预动作门控防止AI代理重复失败,实现记忆即治理,全离线可审计。
从消费到反思:设计稳定推理的人机关系
提出关系反思智能(RRI)框架,通过推理时审计循环稳定人机推理,应对共同认知弱点导致的“关系漂移”。
MA-DLE: 基于记忆增强的语音自动抑郁程度估计
提出记忆特征增强方法,选择性整合历史与动态记忆,结合分层注意力融合,在语音抑郁估计中达最优性能。
TileFuse:面向AMD NPU的高效量化LLM推理融合混合精度内核库
TileFuse在AMD XDNA2 NPU上融合解包、反量化与矩阵运算,实现AWQ量化,性能提升最高281%,能耗降低超64%。
伦理评估代理(EeVA):一种辅助伦理审议的原型类智能体工作流的概念验证测试结果
EeVA基于LLM,通过多框架评估与综合,支持结构化伦理反思而非给出绝对答案,概念验证有效。
RAIL:基于CHC认知框架重新思考大型音频语言模型中的听觉智能
基于CHC认知框架,RAIL将听觉认知分解为五种核心能力,评估26个模型发现性能不均,建立认知评估新范式。
Artificial Intelligence in Ship Finance: Applications, Opportunities, and a Case Study in AI-Augmented Loan Origination
ConsistencyPlanner: 基于快速采样一致性模型的实时规划
提出ConsistencyPlanner,利用快速采样一致性模型实现实时多模态规划,通过高效采样与特征融合提升安全性能。