5333 条条目 · 106 个活跃源
2026年8月25日
04:00
arXiv cs.AI

AIREP:AI运行时治理中逐决策证据的协议

提出AIREP协议,为AI运行时治理决策生成可离线验证的签名记录,并构成防篡改哈希链。

04:00
arXiv cs.AI

罗马乌尔都语中的仇恨言论分类:参数高效微调与提示工程的比较研究

在罗马乌尔都语低资源场景下,比较零样本推理、LoRA微调、提示调优及提示工程,探索高效仇恨言论分类方法。

04:00
arXiv cs.AI

模型崩溃及对策综述

综述生成式AI因合成数据自噬导致模型崩溃的现象、缓解对策及未来挑战。

04:00
arXiv cs.AI

SchemaRouter:面向高效异构代理式RAG的字段感知工具路由

SchemaRouter以模式图路由字段,降低令牌与延迟,保持准确率,并支持来源许可。

04:00
arXiv cs.AI

无中立评测框架:现代LLM排行榜由配置敏感项制造

评测配置令分数31%-89%波动;脆弱题目承载95.7%差距;评分方式决定排名。

04:00
arXiv cs.AI

面向安全关键多无人机系统的智能体AI:挑战与机遇

多无人机用于安全关键任务,但智能体融入需重视人机协同与社会技术设计,通过迭代原型探索可迁移方案。

04:00
arXiv cs.AI

弃权协议:Clos 架构的根因分析

用弃权代数替代加权融合,应对不确定证据,结合拓扑感知配置,实现云端大规模网络稳定可解释的根因分析。

04:00
arXiv cs.AI

检索支撑的机器人程序生成与基于模型上下文协议的模拟修正

提出检索增强生成与模型上下文协议的工作流,在机器人仿真中自动生成并修正程序,发现静态检查遗漏的执行错误。

04:00
arXiv cs.AI

可解释AI在时间序列分类中的软件框架:系统综述

综述时间序列分类的可解释AI框架,发现仅一个支持频域解释,两个专用指标,且跨框架不一致,呼吁统一框架。

04:00
arXiv cs.AI

让信用跟随计算:面向大语言模型强化学习的架构感知信用传输

提出CompPO:用注意力浓度作为信用传输门控,实现架构感知的路径相关GAE,提升LLM RL信用分配,优于GRPO。

04:00
arXiv cs.AI

面向空气质量预测的QHAdamW增强人工神经网络

提出QHAdamW优化器,提升Adam,马尼拉AQI预测误差更低、收敛更好,可预报PM2.5/PM10。

04:00
arXiv cs.AI

评估流行好莱坞电影的多模态叙事理解

新基准测试好莱坞电影叙事理解,视觉-语言模型近随机,视听模型最高61.1%,低于人类。

04:00
arXiv cs.AI

量化地理域偏移以解耦人类移动流生成模型的地理空间可迁移性

提出地理域偏移量化方法,揭示移动流生成模型的可迁移性受区域差异影响,具空间异质性与不对称性。

04:00
arXiv cs.AI

数据驱动的大语言模型动态算法调度

利用LLM与性能数据库生成线性代数算法动态调度启发式,案例验证可复现专家策略。

04:00
arXiv cs.AI

语义压缩树:基于层次语义残差的多分辨率知识检索

语义压缩树以层次残差建索引,逐级检索;给定文档时匹配稠密检索且省30%上下文,但文档路由选择显著更差。

04:00
arXiv cs.AI

测量大型语言模型中的激活控制

提出激活可控性基准,发现大语言模型能通过自然语言指令控制残差流激活,可规避基于激活的监控。

04:00
arXiv cs.AI

鲁棒的轻量级深度学习模型用于口腔癌筛查

面向智能手机口腔癌筛查的轻量模型,优化后达高灵敏/特异度,稳健可解释,适用于基层边缘部署。

04:00
arXiv cs.AI

ATHENA:知识引导的智能神经架构搜索,用于基于AutoFormer的电子健康记录建模

提出知识引导的多智能体NAS框架,复用跨医院架构知识,在6项临床任务中优于基线,减少人工调参。

04:00
arXiv cs.AI

CLIP在区域地理定位中学到了什么?探究适应后的视觉线索与场景配置

适应编码器显著提升区域定位精度,依赖完整场景配置,而非仅粗粒度线索。

04:00
arXiv cs.AI

ECHO:面向长时程智能体的认知启发式可审计记忆平面

提出认知启发式可审计记忆平面ECHO,面向长时程智能体,检索高分但查询扩展污染,非独立证实。

04:00
arXiv cs.AI

Multimodal Prompt Learning with Irregular EHRs for Robust Monitoring of Critical Care Patients

04:00
arXiv cs.AI

AI守护者:检测与防御AI对话中操纵性暗模式的智能体接口

提出AI Watchdog,实时检测五类暗模式;即时警告显著降低用户顺从(71.7%至53.7%)。

04:00
arXiv cs.AI

MemGuard:面向LLM智能体记忆治理的持久化验证信号

MemGuard将验证器输出转为持久化元数据,附奖励、置信度等描述,改善记忆准入与漂移,在多项基准上表现最优。

04:00
arXiv cs.AI

训练需要可信世界:面向智能体学习的可验证合成网络环境

合成网络环境常存在缺陷,通过结构化验证与修复,将可行任务率从48.6%提升至94.8%,显著增强智能体训练与迁移效果。

04:00
arXiv cs.AI

一致性并非连贯性:面向4D国防上层本体认证对齐的定向搜索

对齐IES、HQDM、BFO三个国防上层本体;手工17条映射至OWL,经HermiT推理得出三个结果

04:00
arXiv cs.AI

超越相似性:面向慈善食品机构多目标食品替代的异质图学习

提出异质图神经网络,融合行为与营养数据,多目标排序实现食品替代推荐,冷启动下仍稳健。

04:00
arXiv cs.AI

Repo2Skill-Evo:仓库技能悄然过时

研究揭示LLM代理的仓库技能会随版本更新悄然过时,无显式信号;前沿代理维护技能表现欠佳,难以可靠更新。

04:00
arXiv cs.AI

TessIndex:面向代理经济的能力验证身份系统

TessIndex为代理经济构建能力验证身份系统,以区块链与中心化双层架构实现持久身份、可验证能力证明及通证化。

04:00
arXiv cs.AI

闭环AI实现可认证的工程设计

提出AI工程师闭环框架,融合LLM与工程仿真,自动优化设计,通过AIP认证,钢耗成本降8.1%。

04:00
arXiv cs.AI

以ASAS对领先阿拉伯语大语言模型进行红队测试

首个阿拉伯语红队基准ASAS,评估7模型,多数难挡半数不安全提示,揭示安全鸿沟与语言对齐不迁移。

04:00
arXiv cs.AI

DynaContext:面向异构参数提取的优化提示自改进动态情境化

提出DynaContext,离线优化+动态情境化+验证门控自改进,异构参数提取F1提升17.3点。

04:00
arXiv cs.AI

SPAR-Hate:审核员引导的多智能体双语仇恨言论解析框架

提出审核员引导的多智能体框架SPAR-Hate,多视角证据生成与仲裁,提升双语仇恨言论解析。

04:00
arXiv cs.AI

面向长时间外推的单步演化:误差界指导与先验引导的自治偏微分方程神经残差框架

提出先验引导神经残差框架,弱形式PDE残差近似单步误差,免真值监督,五类基准超越基线,提升长时间外推。

04:00
arXiv cs.AI

面向地热井阵列的大语言模型决策支持与建模

研究评估大语言模型在提升地热井阵列数据分析、建模及决策支持方面的潜力,并利用AI加速生成基准。

04:00
arXiv cs.AI

MegaMem:面向超大型上下文窗口的检索方案

MegaMem通过双视图检索与源码关联,在固定生成预算下实现亿级令牌持久记忆,准确率提升至86.50。

04:00
arXiv cs.AI

评估小规模视觉语言模型在定性机械问题上的表现

评估Gemma-3与Qwen-VL在定性机械问题中的推理能力,通过链式思维与答案对比检验空间及常识推理。

04:00
arXiv cs.AI

超越表象:揭示多模态大语言模型的情境错觉

提出情境错觉分类法与基准,暴露多模态大模型脆弱性,改进方法性能提升达20%。

04:00
arXiv cs.AI

针对作者身份再识别的聚合感知合成文本生成

聚合感知合成文本生成(AAST)从束级联合选文,降低作者重识别风险,保持语义质量。

04:00
arXiv cs.AI

面向临床预测的开放权重大语言模型角色特化多智能体混合

角色特化多智能体临床预测:最终整合者贡献最大;大分析师配小整合器可匹配闭源模型并提高高危召回,但再入院增益小。

04:00
arXiv cs.AI

MCP-Universe RL:通过强化学习训练MCP工具使用智能体的框架

提出开源框架MCP-U RL,用模型上下文协议作环境接口,自动编排环境与调度轨迹,提升多领域工具智能体训练效果。

04:00
arXiv cs.AI

路由引导的测试时扩展:分歧探索,共识提交

利用MoE路由信号引导软件智能体探索与提交,无需外部评判,将宏平均解决率从44.9%提升至48.2%,并迁移至Qwen3.6。

04:00
arXiv cs.AI

查询驱动的长文档多模态信息提取

提出长文档图文联合抽取新任务及首个手工基准;多智能体协作框架显著提升抽取效果,但仍有差距。

04:00
arXiv cs.AI

MEMONDEMAND:面向大规模企业数据的记忆管理系统

提出动态多层层级、双记忆与按需提升机制,实现大规模企业数据高效准确检索,在基准上超越现有最强系统。

04:00
arXiv cs.AI

明确用户专长:迈向按用户熟练度定制回答的主动式对话代理

现有代理难以从查询判断用户专业水平,新方法PASSING通过主动提问澄清专长并定制回答,效果更优。

04:00
arXiv cs.AI

少读多解:面向AI代理的令牌高效稀疏阅读

提出稀疏读取层,无需训练,在内容进入上下文前拦截,大幅减少令牌与延迟,同时保持或提升任务质量。

04:00
arXiv cs.AI

可解释AI中的选择问题

可解释AI技术虽多,但用户难选合适方法。提出“选择问题”形式化,并建议用多智能体LLM工具自动匹配解释技术。

04:00
arXiv cs.AI

认知何在:在最小完整认知架构中剖析涌现与计算功能

价值模块必须显式计算而非涌现;自适应停止看似涌现实为测量假象,计算二阶决策带来显著收益。