5431 条条目 · 106 个活跃源
2026年6月26日
04:00
arXiv cs.AI

治理行动而非智能体:机构认证作为自主AI系统的治理模型

提出通过独立认证关键行动条件来治理自主AI,不监控推理,保留自主但限制高风险执行权。

04:00
arXiv cs.AI

COrigami:一种用于协同设计可平折且视觉可识别的折纸的AI流水线

提出COrigami端到端AI流水线,从自然语言生成可平折折痕模式,结合算法优化与美学评估,辅助人类艺术家协同设计。

04:00
arXiv cs.AI

估计分类器性能的不确定性:在大语言模型与嵌套数据中的应用

评估社会科学文本分类中置信区间方法,发现默认方法不准确,推荐调整有效样本量和特定区间估计。

04:00
arXiv cs.AI

工具增强的LLM代理在真实能源分析任务中的表现如何?

评估工具增强LLM代理在真实能源市场分析中的表现,涵盖243个专家问题与多维评分。

04:00
arXiv cs.AI

数据驱动的机器学习无法达到符号级逻辑推理——尺度定律的极限

数据驱动机器学习因训练数据不完整及端到端映射矛盾,无法实现严谨符号逻辑推理,即使准确率达100%仍会出错。

04:00
arXiv cs.AI

可解释集成学习机器学习模型检测丙型肝炎患者的肝硬化

采用四种集成学习模型检测丙肝患者肝硬化,极端随机树最优:准确率96.92%,召回率94%,精确率99.81%,AUC 96%。

04:00
arXiv cs.AI

面向低通道脑电智能体的边界感知上下文锚定

分离数值引擎与语言层,利用边界感知上下文校准低通道EEG智能体的接受与拒绝,提升结果可靠性。

04:00
arXiv cs.AI

NeuraDock视觉认知负荷代理教程:面向Alpha动态与实时应用的质量门控开源EEG工作流

本教程提供NeuraDock代理的逐步指导,实现从EEG到实时认知负荷的质量门控工作流,验证了任务相关后部Alpha抑制。

04:00
arXiv cs.AI

PMDformer:面向长期预测的补丁均值解耦信息Transformer

提出PMDformer模型,通过补丁均值解耦分离趋势与形状,结合注意力机制提升长期预测精度与稳定性。

04:00
arXiv cs.AI

基于内容的大语言模型智能邮件分发器

本文提出基于大语言模型的智能邮件分发系统,自动分析内容并转发至相关群组,无需标注数据,提升效率。

04:00
arXiv cs.AI

A Multi-Level Validation and Traceability Framework for AI-Generated Telescope Scheduling Decisions

04:00
arXiv cs.AI

EvoOptiGraph:基于图结构生成的弱点驱动协同进化用于优化建模

EvoOptiGraph以图生成弱点驱动数据-模型协同进化,两阶段训练提升优化建模准确性、可执行性与泛化。

04:00
arXiv cs.AI

基于大语言模型的检测服务反馈中新兴主题的方法

结合大语言模型与人工审核,检测服务质量新兴主题,提升分析准确性与可靠性。

04:00
arXiv cs.AI

用于高维物理系统自主科学发现的苏格拉底式智能体

提出AHOIS多智能体,通过苏格拉底诘问实现高维物理系统自主发现,验证随机干涉编码并提升实验有效性。

04:00
arXiv cs.AI

中文标题:基于潜在ODE的电影心脏MRI时空建模方法

中文摘要:提出潜在ODE模型建模全周期心室运动,结合心率感知神经ODE与网格自编码器,预测心衰性能优于传统指标。

04:00
arXiv cs.AI

科学发现作为元优化:一个组合优化案例研究

提出元优化框架,用共识目标聚合优化评估标准,应用于3-SAT算法发现并大幅加速。

04:00
arXiv cs.AI

EGG:面向内核生成的专家引导智能体框架

EGG框架通过专家引导的两阶段分解(算法结构设计+硬件调优),实现GPU内核生成正确高效,较PyTorch提速2.13倍。

04:00
arXiv cs.AI

能力前沿:基准测试遗漏了82%的模型性能

现有基准测试低估LLM能力,通过多模型多生成样本的Pareto前沿发现,真实性能可提升82%,成本降低85%。

04:00
arXiv cs.AI

AgentX:迈向智能体驱动的工业推荐系统自我迭代

AgentX多智能体系统自主完成推荐实验的生成、实现、评估与学习,实现闭环自我迭代。

04:00
arXiv cs.AI

爱因斯坦世界模型

爱因斯坦世界模型(EWM)通过在推理中插入视觉-时间展开,增强LLM对反事实事件的推理能力。

04:00
arXiv cs.AI

诊断语言代理的任务不敏感性

语言模型在相似任务中忽视指令,导致泛化弱。通过任务扰动优化提升任务敏感性,稳定注意力。

04:00
arXiv cs.AI

LCAi:大数据融合与检索增强生成辅助解释的生命周期评估

提出视角条件RAG框架,融合多源数据,缓解幻觉,将LCA影响结果转化为战略路径,支持实施决策。

04:00
arXiv cs.AI

学习从多任务合并模型中恢复任务专家

提出ReTeX,预测参数偏移消除多任务合并干扰,从单检查点恢复专家性能,SVD子空间标识任务,恢复超95%性能并提升泛化。

04:00
arXiv cs.AI

思维链训练收益在基于LLM的智能体中的落脚点

研究发现CoT训练主要提升直接动作预测而非推理优势,后期更依赖提示,掩码动作监督可改善泛化。

04:00
arXiv cs.AI

自然语言分类器对进化生成的对抗文本的脆弱性

提出GAversary遗传算法生成对抗文本,黑盒攻击使准确率从76.8%降至5.8%,但扰动词数多、语义相似度略降。

04:00
arXiv cs.AI

一种将传统工作流提升为智能体BPM的过程驾驭机制:设计与实现(CUGA FLO)

提出过程驾驭机制,通过TDF模型将LLM推理策略化注入工作流控制点,实现传统流程向智能体BPM的无缝升级。

04:00
arXiv cs.AI

TOPS:基于第一性原理的视觉令牌剪枝:构建令牌最优保留集以实现高效MLLM推理

TOPS基于三原则构建令牌最优保留集,无需训练即可剪除78%视觉令牌,且保持100%性能。

04:00
arXiv cs.AI

询问而非评判:二元问题实现可解释的LLM评估与自我改进

BINEVAL框架将评估分解为二元问题,生成可解释多维分数,匹配人类判断,避免天花板效应,并支持提示优化。

04:00
arXiv cs.AI

大型语言模型自动简历筛选中的提示注入:单注入与多注入场景

提示注入在少数候选人使用时有效,普及则失效;异质质量下可能颠覆排名,引发公平问题。

04:00
arXiv cs.AI

基于语言的老年人认知辅助数字孪生

提出基于语言模型的数字孪生框架,模仿老年人对话,实现非侵入式认知监测。

04:00
arXiv cs.AI

结合语言模型何时有帮助?跨67个前沿模型的共同失败上限

多模型系统增益受共同失败率β上限限制,β远高于相关性估计,增益源于模型在不同问题出错,而非增加模型数量。

04:00
arXiv cs.AI

生成式AI与版权侵权:基于美国法典第17编的AI音乐生成系统法律-技术分析

分析AI音乐生成中歌词侵权与声音模仿的法律差异,指出联邦法对歌词保护强而对声音模仿保护不足。

04:00
arXiv cs.AI

Lacuna:机器学习研究图谱

Lacuna利用大模型将论文转为结构化研究图谱,检索Recall达0.538,超OpenScholar;深度报告生成质量也优于GPT-Researcher。

04:00
arXiv cs.AI

多尺度退出-加入动力学:战术共识与战略联盟形成

提出多尺度联盟模型耦合战略重组与战术共识,揭示低转换障碍阻碍战略收敛却促进全局共识的悖论。

04:00
arXiv cs.AI

Dot-Flik:一种用于分布式昆虫监测的可扩展边缘AI架构

提出运动帧过滤与分布式边缘架构,实现低成本、实时30FPS、节能22.6%的昆虫监测,支持多流并发。

04:00
arXiv cs.AI

减少全切片图像补丁中的冗余以实现可扩展的索引与检索

提出ARReST方法,通过去除跨类别冗余补丁压缩索引,实现3%-60%存储节省且不损检索性能。

04:00
arXiv cs.AI

参数化广义自适应矩特征(PG-AMF)用于轴承故障诊断与机器健康监测

提出PG-AMF自适应特征提取框架,融合多类互补矩特征,显著提升轴承故障诊断准确性与泛化能力。

04:00
arXiv cs.AI

TEMPO-扩散:时间暴露的恶意投毒扩散模型

提出TEMPO-Diffusion后门框架,将恶意分布偏移定位到时间性分布内暴露,支持多子图像后门和时间条件触发器,实现高攻击成功率。

04:00
arXiv cs.AI

Play2Perfect:灵巧操作预训练中影响精密装配的关键因素

通过玩耍预训练获取操作先验,微调后高效完成精密装配,样本效率提升33倍,零样本迁移成功率达60%。

04:00
arXiv cs.AI

Closing the Loop to Discover Psychological Theories with an Automated Cognitive Scientist

04:00
arXiv cs.AI

从杂乱环境中的点云学习运动可行性

从点云直接学习运动可行性,新基准与点云Transformer模型实现高精度快速预测。

04:00
arXiv cs.AI

深度学习程序故障诊断中的评估策略差距

研究发现DL故障诊断在程序内与跨程序评估间存在0.190准确率差距,曲率特征有助于未见程序检测,优化器特征仅对已见程序有效。

04:00
arXiv cs.AI

风险感知选择性多模态驾驶员监控与驾驶员状态世界建模

提出成本感知选择性推理框架,结合RGB-生理学生和门控,降低不安全假阴性至5%,保持实时性。

04:00
arXiv cs.AI

上下文模型预测生成:从语言模型到物理的开放词汇运动合成

ICMPG框架融合语言模型规划与物理反馈,通过闭环预测生成语义忠实且物理合理的运动。