治理行动而非智能体:机构认证作为自主AI系统的治理模型
提出通过独立认证关键行动条件来治理自主AI,不监控推理,保留自主但限制高风险执行权。
COrigami:一种用于协同设计可平折且视觉可识别的折纸的AI流水线
提出COrigami端到端AI流水线,从自然语言生成可平折折痕模式,结合算法优化与美学评估,辅助人类艺术家协同设计。
估计分类器性能的不确定性:在大语言模型与嵌套数据中的应用
评估社会科学文本分类中置信区间方法,发现默认方法不准确,推荐调整有效样本量和特定区间估计。
工具增强的LLM代理在真实能源分析任务中的表现如何?
评估工具增强LLM代理在真实能源市场分析中的表现,涵盖243个专家问题与多维评分。
数据驱动的机器学习无法达到符号级逻辑推理——尺度定律的极限
数据驱动机器学习因训练数据不完整及端到端映射矛盾,无法实现严谨符号逻辑推理,即使准确率达100%仍会出错。
可解释集成学习机器学习模型检测丙型肝炎患者的肝硬化
采用四种集成学习模型检测丙肝患者肝硬化,极端随机树最优:准确率96.92%,召回率94%,精确率99.81%,AUC 96%。
面向低通道脑电智能体的边界感知上下文锚定
分离数值引擎与语言层,利用边界感知上下文校准低通道EEG智能体的接受与拒绝,提升结果可靠性。
NeuraDock视觉认知负荷代理教程:面向Alpha动态与实时应用的质量门控开源EEG工作流
本教程提供NeuraDock代理的逐步指导,实现从EEG到实时认知负荷的质量门控工作流,验证了任务相关后部Alpha抑制。
PMDformer:面向长期预测的补丁均值解耦信息Transformer
提出PMDformer模型,通过补丁均值解耦分离趋势与形状,结合注意力机制提升长期预测精度与稳定性。
基于内容的大语言模型智能邮件分发器
本文提出基于大语言模型的智能邮件分发系统,自动分析内容并转发至相关群组,无需标注数据,提升效率。
A Multi-Level Validation and Traceability Framework for AI-Generated Telescope Scheduling Decisions
EvoOptiGraph:基于图结构生成的弱点驱动协同进化用于优化建模
EvoOptiGraph以图生成弱点驱动数据-模型协同进化,两阶段训练提升优化建模准确性、可执行性与泛化。
基于大语言模型的检测服务反馈中新兴主题的方法
结合大语言模型与人工审核,检测服务质量新兴主题,提升分析准确性与可靠性。
用于高维物理系统自主科学发现的苏格拉底式智能体
提出AHOIS多智能体,通过苏格拉底诘问实现高维物理系统自主发现,验证随机干涉编码并提升实验有效性。
中文标题:基于潜在ODE的电影心脏MRI时空建模方法
中文摘要:提出潜在ODE模型建模全周期心室运动,结合心率感知神经ODE与网格自编码器,预测心衰性能优于传统指标。
科学发现作为元优化:一个组合优化案例研究
提出元优化框架,用共识目标聚合优化评估标准,应用于3-SAT算法发现并大幅加速。
EGG:面向内核生成的专家引导智能体框架
EGG框架通过专家引导的两阶段分解(算法结构设计+硬件调优),实现GPU内核生成正确高效,较PyTorch提速2.13倍。
能力前沿:基准测试遗漏了82%的模型性能
现有基准测试低估LLM能力,通过多模型多生成样本的Pareto前沿发现,真实性能可提升82%,成本降低85%。
AgentX:迈向智能体驱动的工业推荐系统自我迭代
AgentX多智能体系统自主完成推荐实验的生成、实现、评估与学习,实现闭环自我迭代。
爱因斯坦世界模型
爱因斯坦世界模型(EWM)通过在推理中插入视觉-时间展开,增强LLM对反事实事件的推理能力。
诊断语言代理的任务不敏感性
语言模型在相似任务中忽视指令,导致泛化弱。通过任务扰动优化提升任务敏感性,稳定注意力。
LCAi:大数据融合与检索增强生成辅助解释的生命周期评估
提出视角条件RAG框架,融合多源数据,缓解幻觉,将LCA影响结果转化为战略路径,支持实施决策。
学习从多任务合并模型中恢复任务专家
提出ReTeX,预测参数偏移消除多任务合并干扰,从单检查点恢复专家性能,SVD子空间标识任务,恢复超95%性能并提升泛化。
思维链训练收益在基于LLM的智能体中的落脚点
研究发现CoT训练主要提升直接动作预测而非推理优势,后期更依赖提示,掩码动作监督可改善泛化。
自然语言分类器对进化生成的对抗文本的脆弱性
提出GAversary遗传算法生成对抗文本,黑盒攻击使准确率从76.8%降至5.8%,但扰动词数多、语义相似度略降。
一种将传统工作流提升为智能体BPM的过程驾驭机制:设计与实现(CUGA FLO)
提出过程驾驭机制,通过TDF模型将LLM推理策略化注入工作流控制点,实现传统流程向智能体BPM的无缝升级。
TOPS:基于第一性原理的视觉令牌剪枝:构建令牌最优保留集以实现高效MLLM推理
TOPS基于三原则构建令牌最优保留集,无需训练即可剪除78%视觉令牌,且保持100%性能。
询问而非评判:二元问题实现可解释的LLM评估与自我改进
BINEVAL框架将评估分解为二元问题,生成可解释多维分数,匹配人类判断,避免天花板效应,并支持提示优化。
大型语言模型自动简历筛选中的提示注入:单注入与多注入场景
提示注入在少数候选人使用时有效,普及则失效;异质质量下可能颠覆排名,引发公平问题。
基于语言的老年人认知辅助数字孪生
提出基于语言模型的数字孪生框架,模仿老年人对话,实现非侵入式认知监测。
结合语言模型何时有帮助?跨67个前沿模型的共同失败上限
多模型系统增益受共同失败率β上限限制,β远高于相关性估计,增益源于模型在不同问题出错,而非增加模型数量。
生成式AI与版权侵权:基于美国法典第17编的AI音乐生成系统法律-技术分析
分析AI音乐生成中歌词侵权与声音模仿的法律差异,指出联邦法对歌词保护强而对声音模仿保护不足。
Lacuna:机器学习研究图谱
Lacuna利用大模型将论文转为结构化研究图谱,检索Recall达0.538,超OpenScholar;深度报告生成质量也优于GPT-Researcher。
多尺度退出-加入动力学:战术共识与战略联盟形成
提出多尺度联盟模型耦合战略重组与战术共识,揭示低转换障碍阻碍战略收敛却促进全局共识的悖论。
Dot-Flik:一种用于分布式昆虫监测的可扩展边缘AI架构
提出运动帧过滤与分布式边缘架构,实现低成本、实时30FPS、节能22.6%的昆虫监测,支持多流并发。
减少全切片图像补丁中的冗余以实现可扩展的索引与检索
提出ARReST方法,通过去除跨类别冗余补丁压缩索引,实现3%-60%存储节省且不损检索性能。
参数化广义自适应矩特征(PG-AMF)用于轴承故障诊断与机器健康监测
提出PG-AMF自适应特征提取框架,融合多类互补矩特征,显著提升轴承故障诊断准确性与泛化能力。
TEMPO-扩散:时间暴露的恶意投毒扩散模型
提出TEMPO-Diffusion后门框架,将恶意分布偏移定位到时间性分布内暴露,支持多子图像后门和时间条件触发器,实现高攻击成功率。
Play2Perfect:灵巧操作预训练中影响精密装配的关键因素
通过玩耍预训练获取操作先验,微调后高效完成精密装配,样本效率提升33倍,零样本迁移成功率达60%。
Closing the Loop to Discover Psychological Theories with an Automated Cognitive Scientist
从杂乱环境中的点云学习运动可行性
从点云直接学习运动可行性,新基准与点云Transformer模型实现高精度快速预测。
深度学习程序故障诊断中的评估策略差距
研究发现DL故障诊断在程序内与跨程序评估间存在0.190准确率差距,曲率特征有助于未见程序检测,优化器特征仅对已见程序有效。
风险感知选择性多模态驾驶员监控与驾驶员状态世界建模
提出成本感知选择性推理框架,结合RGB-生理学生和门控,降低不安全假阴性至5%,保持实时性。
上下文模型预测生成:从语言模型到物理的开放词汇运动合成
ICMPG框架融合语言模型规划与物理反馈,通过闭环预测生成语义忠实且物理合理的运动。
TRUSTMEM: 为具有长期记忆的大语言模型代理学习可信记忆巩固
提出TrustMem框架,通过验证与强化学习优化记忆更新,显著提升可靠性与效用,降低三类错误率。
临床医生的否决权:在自主AI处方中应对信任、责任与不确定性
自主AI处方需校准信心、区分不确定性并透明推理,临床医生支持监督机制以限制AI自主权。
面向通用推理的可迁移性:多领域RLVR自动课程
提出TAC算法,利用梯度对齐自动调整多领域训练课程,显著提升跨领域推理迁移性能。
全感知策略优化用于多模态情感推理
提出OPPO强化学习框架,优化多模态感知,提升情感推理中的模态利用与忠实性,达到SOTA。
物理约束基础模型的智能体进化
提出物理约束多智能体发现引擎,自主进化压缩方法,部署235B模型内存降75%、精度仅损0.64%。
航天器容错控制真正有效的方法:学习与经典方法的诚实定闸基准
航天器容错控制基准测试:结构化估计-控制对执行器符号/增益故障超94%,恒定偏置需扰动观测器,传感器偏置需融合。