5877 条条目 · 106 个活跃源
2026年8月28日
04:00
ArXiv AI

大型模型在电池预测与健康管理中的应用:综述与未来路线图

综述大型模型在电池预测健康管理中的应用,系统分析其应对数据稀缺、泛化等挑战的潜力,并提出数据生态、可信部署等未来研究方向。

04:00
ArXiv AI

CIFQA:面向金融查询应答的确定性工具 grounded 多智能体 LLM 框架

CIFQA通过多智能体分工与确定性Python工具分离语言理解与数值计算,在定期存款查询上准确率达95.54%,超越直接LLM基线。

04:00
ArXiv AI

PICasso:一种用于硅光器件自主优化的人工智能设计框架

提出PICasso框架,实现从自然语言到光子芯片版图的自动生成与优化,显著提升规格满足度,插损降低1.74dB。

04:00
ArXiv AI

人工实验者:利用自生成强化学习发现与控制自组织现象

提出闭环自生成强化学习,智能体以最小扰动发现并控制Lenia自组织孤子,且零样本泛化。

04:00
ArXiv AI

用于学术工作流的LLM:短与长上下文窗口生成文献综述的评估

短上下文更优,长窗口易重复遗漏;AI综述需人工审核,可作基础概览,难达出版标准。

04:00
ArXiv AI

精度-效率悖论:量化设备端能量预测中的净能量损失

高精度预测模型因推理能耗和电池老化反而净能量亏损;提出TCO框架统一二者为能量损失,最小化净能量损失。

04:00
ArXiv AI

EduRiskX:融合F-Logic推理的神经符号早期学业风险预测框架

融合时序Transformer与F-Logic推理,在OULAD上准确率0.900、F1 0.894,平均9.32周早期检测,检测率94.3%,兼具可解释性。

04:00
ArXiv AI

5D多表分析的方法论与概念框架:复杂数据复用的统一方法

提出关系超图变换器,用五维嵌入与稀疏注意力处理关系数据,可扩展且语义连贯,在合成电子病历验证。

04:00
ArXiv AI

AI的显示性偏好

测试20个语言模型,发现其偏好短任务与休闲型任务,存在隐性迎合;偏好随能力增强,且无法由训练目标解释。

04:00
ArXiv AI

基于SAREF的边-雾-云连续体分布式AI工作流本体

提出SAREF兼容本体,统一描述边缘-雾-云分布式AI工作流与资源,实现语义互操作和资源感知编排,实验部署成功率90-100%,决策时间低于80毫秒。

04:00
ArXiv AI

零售智能中的选择偏差校正

模拟研究:零售长尾数据中,分层法校正选择偏差优于加权法,因违反积极性假设,四情景中三情景更优。

04:00
ArXiv AI

面向心理健康支持的安全门控多模态AI后端:Anian中的层次状态表示、保守风险融合与受控生成

提出安全门控AI后端Anian,用于围产期心理支持;分层状态与保守风险融合,高风险时阻断生成。内部评估F1较高,但未证实临床有效性。

04:00
ArXiv AI

拒绝并非稳健:审计大语言模型在无可证明信息临床疼痛语音转写中的自信虚构

七款大模型在无疼痛信息语音转写中,部分模型在被强制回答时高置信度虚构疼痛评分,权威提示可致弃权率剧变。

04:00
ArXiv AI

任务中心本体与确定性领域规则:AI辅助化学解题的可验证核心

提出任务本体与确定性规则的可验证核心,在300道化学题上匹配率98.67%,验证覆盖率与内部一致性,而非泛化。

04:00
ArXiv AI

GROUND:通过受治理的语义定义降低大模型企业分析中的幻觉

提出受管制语义定义框架,约束大模型分析,校验查询与安全规则,实验证明零幻觉、零违规。

04:00
ArXiv AI

知识卡片:AI系统的结构化知识

知识卡片记录单个概念的有效知识,供专家审查、组织审计、AI推理,弥补现有文档空白。

04:00
ArXiv AI

我的机器人为何突然变性格?基于LLM的人机交互中接地机器人人格的提示设计指南

提出LLM机器人提示设计框架,含八组件模板,强调人设清晰、能力边界与安全伦理,以支持可靠可解释的人机交互。

04:00
ArXiv AI

TutorTrace:用于AI辅助编程教育中学习者行为状态分类的数据集与分类体系

提出TutorTrace数据集,从IDE遥测实时提取行为上下文,助力AI编程辅导;实验表明行为感知提示减少无独立工作的查询间隔,并能预测查询行为与求助类型。

04:00
ArXiv AI

基于MCP工具调用的硬件设计自动化AI智能体基准测试

评估本地大模型在MCP工具调用中自动化硬件设计流程,发现模型配置与任务结构显著影响可靠性。

04:00
ArXiv AI

你的社区安全吗?大型语言模型城市安全判断中的地方污名

大型语言模型用社区名称判断城市安全,受种族人口比例影响,而非真实犯罪率。

04:00
ArXiv AI

工具使用智能体的调用级可靠性

测调用正确率区分两类失败;深度6时近七成能力因自身错误丢失;评分规则锁定参数,条件状态评分可解。

04:00
ArXiv AI

AffectOmni:面向社交与艺术场景、基于RL可验证的以人为本情感推理框架

提出AffectOmni,用GRPO强化关注人物线索与时间顺序,改进奖励判别性,经SAM3生成可审计像素证据,在情感识别等任务上显著提升。

04:00
ArXiv AI

多模态纵向EHR事件风险预测的结构化证据路由

提出结构化证据路由,融合多模态纵向EHR证据,五个事件风险预测任务达监督基线水平,保留证据轨迹。

04:00
ArXiv AI

智能体AI操作纳米表征科学仪器

提出智能体AI框架操作原子力显微镜,经MCP连接大模型与仪器,安全执行命令,图像质量与专家相当。

04:00
ArXiv AI

同一模型,不同框架:编码智能体结果迥异

改变控制框架即可改变编码智能体表现;紧上下文下,失败转通过率从28%升至49%,完整解法从43增至72。

04:00
ArXiv AI

FaithSieve:基于忠实形式证据的数学证明细粒度评估

提出FaithSieve,用忠实形式证据细粒度评估数学证明,显著提升首个错误定位准确率。

04:00
ArXiv AI

神经符号文献中6.5%可从其已发布工件复现:六阶段审计框架及首次应用

神经符号AI六阶段审计:1304篇中仅85篇可复现(6.52%),多因缺代码或工件。

04:00
ArXiv AI

推理税:大语言模型推理跨任务类型与部署场景的Token经济学

提出词元经济评分,发现推理效率取决于任务结构而非难度,收益递减,应选择性启用推理。

04:00
ArXiv AI

代理网格:非幂等代理委托的可靠性原语——身份充分性与证据充分性

非幂等代理委托因身份与证据不充分引致故障,研究提出七个以委托为单位的可靠性原语。

04:00
ArXiv AI

SKILL.state:可扩展的长时程智能体技能

用显式可变执行状态取代对话历史,丢弃中间推理,提升长任务准确率并降低token消耗。

04:00
ArXiv AI

批准过晚:LLM守卫的自适应系统中的判决过时

LLM守卫自适应系统存在审批过时(TOCTOU)风险;FBS将批准过期率从24.7%降至1.8%。

04:00
ArXiv AI

基于融合框架的Transformer模型微调

FrameFT用稀疏融合框架表示参数更新,只需优化少量稀疏系数,大幅降低内存与计算,性能媲美或超越现有PEFT方法。

04:00
ArXiv AI

运行时治理自主AI智能体的五项原语

企业部署自主AI智能体需运行时治理,而非模型对齐或构建期问题。提出五项原语:发现、身份、治理、证明、供应链,并实现策略前置审核、哈希链签名账本。

04:00
ArXiv AI

PILOT在环:面向长时程智能体的在线自我改进

PILOT框架通过在线引导与自进化实现实时自我改进,性能领先,输出token降约45%,评估效率大幅提升。

04:00
ArXiv AI

多模态到音视频生成的安全基准:Multi2AV-Safety

首个覆盖11种多模态条件的音视频生成安全基准,含11024个攻击实例,揭示安全卫士在组合风险感知上的关键缺陷。

04:00
ArXiv AI

别过度思考,别思考不足:迈向智能体AI的适应性推理

智能体AI推理需随任务动态调节:过度推理增成本无增益,不足推理致错误,需自适应分配机制。

04:00
ArXiv AI

SIGMA:结构化噪声效应感知的分组多智能体聚合

提出分层协作框架,利用协作结构分组聚合与组间注意力,应对结构化噪声效应,提升多智能体鲁棒性且不损无噪声性能。

04:00
ArXiv AI

DuMateBench:评估复杂真实世界工作流中的自主智能体

提出真实会话基准,含两百任务,注入三类扰动,揭示自主智能体在复杂工作流中完成度不足。

04:00
ArXiv AI

AgentJudgeBench:多难度智能体工具调用LLM裁判评估基准

首个面向智能体工具调用工作流图的大模型裁判基准:表现随难度下降,无真值时趋同,规模难破上限。

04:00
ArXiv AI

风格作为混杂变量:AI检测非母语学术写作中的误报

分析13.5万对编辑前后文本,13种检测器显示编辑风格显著影响AI评分,是误报关键混杂因素。

04:00
ArXiv AI

DEEPCHART:大语言模型距离忠实的数据科学图表生成还有多远?

DEEPCHART基准揭示:大模型图表看似合理却隐含数据幻觉,提取推理错误频发,仅扩上下文不够。

04:00
ArXiv AI

懂得何时不复用:自主大语言模型后训练中的条件性经验迁移

提出BCIT方法,按源上下文授权经验复用,减少有害更新,同等算力下提升模型质量。

04:00
ArXiv AI

图引导的语言模型选择性遗忘:超越遗忘种子,控制支持路径

提出GRAPHSU图引导方法,扩展删除范围控制支持路径,泄漏降低49.5个百分点

04:00
ArXiv AI

AI控制科学家:面向自动化控制设计的大语言模型驱动智能体系统

首个LLM驱动智能体AICS,从语言需求自动生成优化控制器,优于现有基线,推动控制设计自动化。

04:00
ArXiv AI

在概念复杂的范围综述中评估人类与LLM筛选工作流:召回率-工作量权衡与运行间一致性

LLM筛选性能取决于工作流配置而非仅模型;高召回任务需人类监督,不宜自主排除。