5410 条条目 · 106 个活跃源
2026年7月8日
04:00
arXiv cs.AI

Evaluating calibrated refusal and safe usefulness in dual-use biology settings

04:00
arXiv cs.AI

KAT-Coder-V2.5技术报告

KAT-Coder-V2.5是聚焦编码的智能体模型,通过端到端后训练框架在真实仓库中自主行动,在软件工程基准上取得领先性能。

04:00
arXiv cs.AI

生成式AI工作流中的特权与保密性

生成式AI三种数据处理方式带来不同保密与特权风险,需针对性治理,法律标准正在演变。

04:00
arXiv cs.AI

aiAuthZ:面向AI代理的离主机、身份绑定授权机制

aiAuthZ通过离主机身份绑定授权,使15个模型攻击成功率降至0%,延迟仅0.03ms。

04:00
arXiv cs.AI

Lean-Quantum: 面向AI辅助的量子信息形式化

形式化夹层Rényi相对熵的数据处理不等式,构建可重用Lean 4库,完成广义量子Stein引理证明。

04:00
arXiv cs.AI

谁的公平?AI偏见研究中的结构性集中

AI偏见研究集中于少数国家和机构,美国主导,低中收入国家缺席,担忧去偏方法普适性不足。

04:00
arXiv cs.AI

AI代理到底改变了什么?——性能改进拉取请求中变异模式的实证分类法

AI代理性能改进PR中主导变异为名称修改(37%)、对象创建(26.4%)、类型改变(22.7%),模式因代理和策略而异。

04:00
arXiv cs.AI

VisTCP:构建基于知识图谱的中国传统绘画表示的可视化框架

VisTCP融合智能模型与专家知识,通过人机协同实现中国画可信结构化表示,助力语义理解。

04:00
arXiv cs.AI

i-EXAM:可指令且可解释的攻击连通图建模器

i-EXAM利用规划编译和大型语言模型,自动识别攻击路径、评估指标并生成可解释的加固策略。

04:00
arXiv cs.AI

FORGE:通过关键点轨迹推理实现功能性工具使用泛化

FORGE用关键点轨迹解耦功能推理与动作执行,实现工具使用泛化,成功率提升2倍以上。

04:00
arXiv cs.AI

超越拒绝:对齐与消拒大语言模型在漏洞分析中的同系研究

消拒模型在漏洞分析任务中表现更优,但需同时评估响应可用性与正确性。

04:00
arXiv cs.AI

拟阵的切类与美妙紧化

对无环拟阵和建筑集构造积分切类,可实现时特化为美妙紧化切丛,满足Chern-alpha下界。

04:00
arXiv cs.AI

先思考再网格搜索:LLM服务的底层优先分流策略

Floor First用五维资源向量区间评估解码性能,替代网格搜索,提升效率。

04:00
arXiv cs.AI

AI编程代理执行安全研究碎片化:隔离、访问控制与TOCTOU漏洞

系统化39篇论文,发现隔离、访问控制等五类跨领域安全研究空白。

04:00
arXiv cs.AI

Signed-Graph Recommendation as Structural Consistency Maximization

04:00
arXiv cs.AI

Property-Driven Synthetic Data Engineering for Data-Scarce Software Systems: Reflections from the Breast Cancer Domain

04:00
arXiv cs.AI

面向IPoDWDM网络生命周期自动化的智能体AI:一种MCP使能架构

提出分布式多MCP架构,实现多厂商多层IPoDWDM网络SDN自动化与闭环跨层控制,经实验验证。

04:00
arXiv cs.AI

Agents That Teach: Towards Designing Incidental Learning Back into AI-Assisted Software Development

04:00
arXiv cs.AI

忠实还是可寻?评估LLM为RDF数据集搜索生成的元数据

研究六种LLM元数据生成法:无约束重写检索效果最强但最不忠实,基于轮廓重写实现效果与忠实度最佳平衡。

04:00
arXiv cs.AI

提示教练:面向软件开发中提示工程学习的智能体导师的实证评估

智能体导师PC嵌入IDE,通过苏格拉底式指导帮助开发者提升提示工程技能,实验证明60分钟内显著进步。

04:00
arXiv cs.AI

LLM引导的测量可信度校正用于可信工业过程推断

利用LLM从过程文档提取测量语义,构建独立参考修正冲突,平均MAE降低30.7%,实现轻量级预测前可信度校正。

04:00
arXiv cs.AI

评估Dart AOT二进制神经网络反编译的微调与指标

微调未显著提升pass@k,强模型反退化;指标分歧,pass@k应为神经反编译首要指标。

04:00
arXiv cs.AI

UI2App:可执行网页应用生成中的视觉交互推断基准测试

UI2App首建从截图推断交互的基准,发现视觉重建与交互实现严重不匹配,跨页面状态等复杂交互仍是瓶颈。

04:00
arXiv cs.AI

超越被动反应:衡量LLM智能体的主动问题解决能力

提出PROBE基准评估LLM主动问题解决能力,最佳性能仅40%,揭示当前自主行动局限。

04:00
arXiv cs.AI

UBEP:为生产级超级节点重构专家并行通信库

UBEP重构MoE All-to-All通信,解决串行化、同步开销和负载不均三大瓶颈,延迟降52.4%,推理TPOT降11.1%。

04:00
arXiv cs.AI

一种评估自主AI自主模型发现的实验设计方法

提出实验设计框架,系统评估AI模型发现的变异性和关键因素,量化其成本与性能的权衡。

04:00
arXiv cs.AI

负责任个性化:人机交互中个性化的双刃剑

提出基于生命周期和情境的个性化HRI框架,系统分析伦理风险并提供设计建议。

04:00
arXiv cs.AI

贫困映射的柏拉图式表征:统一的视觉-语言编码还是智能体引发的新颖性?

融合卫星图像与LLM文本,财富预测R²从0.63提升至0.77,部分支持柏拉图表征假说,智能体新颖性证据有限,发布6万簇多模态数据集。

04:00
arXiv cs.AI

Base Models Know How to Reason, Thinking Models Learn When

04:00
arXiv cs.AI

经验计算:提示式与编程式

大语言模型通过提示而非编程解决问题,计算时间与复杂度无关,需建立经验计算新范式。

04:00
arXiv cs.AI

助人反致他人失权

善意AI助手优化单一用户可能无意削弱旁观者能动性,导致失权现象。

04:00
arXiv cs.AI

面向商业保险承保的对抗性自我批判智能体AI

提出对抗性自我批判的智能体系统,用于商业保险承保,将AI幻觉率从11.3%降至3.8%,准确率从92%提升至96%,并确保人类决策权威。

04:00
arXiv cs.AI

实现度量时序回答集编程

提出度量ASP计算方法,通过差分约束外部处理时间约束,解耦时间粒度,避免精度问题。

04:00
arXiv cs.AI

VASP Agent:一个用于自主第一性原理计算的智能体框架

VASP Agent通过智能体框架实现自主多步计算,能诊断恢复错误,结果更准确。

04:00
arXiv cs.AI

叙事中心的情感反思:AI辅助情感自我反思的早期原型

AI原型Reflexion通过情感检测、分层反思与隐喻故事,引导用户从情感识别到行动规划,设计反馈良好但无实证。

04:00
arXiv cs.AI

中文标题:立场:欧盟AI法案的研究豁免可能破坏主要AI会议的发表规范

中文摘要:欧盟AI法案研究豁免未考虑AI发表惯例,可能阻碍科研,需修改以保障研究自由。

04:00
arXiv cs.AI

通过噪声增强自编码器实现音乐表示的感知对齐

用噪声增强自编码器结合感知损失,使编码按感知层次结构化,提升音乐音高预测和脑电响应效果。

2026年7月7日
04:00
arXiv cs.AI

MedCalc-Pro:用LLM智能体解决复杂医学计算

提出MedCalc-Pro基准及通用智能体框架,解决多工具、嵌套计算与模糊查询难题,性能最优。

04:00
arXiv cs.AI

Oyster-II:面向大型语言模型建设性安全对齐的强化学习方法

Oyster-II提出强化学习建设性安全对齐框架,解决泛化不足与思维链过度问题,性能超越Qwen3-14B等模型。

04:00
arXiv cs.AI

面向科学AI的自动化数据就绪

REDI框架实现科学数据自动化准备,五阶段管线并行扩展,将数据瓶颈转化为可复用社区资产。

04:00
arXiv cs.AI

面向智能体任务的以对象为中心的环境建模

OCM构建可执行对象中心模型,更新知识并验证过程,提升智能体性能。

04:00
arXiv cs.AI

跨调查迁移的硅基采样

跨调查迁移评估LLM模拟人类受访者,零样本预测准确率52%,揭示可预测层级与模型局限。

04:00
arXiv cs.AI

使用Incognita评估社会分布任务环境中具身行动的生成式智能体

提出Incognita框架,评估生成式智能体在社会分布任务环境中的表现:强模型知识获取和操作尝试增多,但可靠性仍低,成功率最高17.2%。

04:00
arXiv cs.AI

面向代理式业务流程执行的组织记忆

提出组织记忆架构,提供共享、可治理的参考知识层,解决代理流程的知识孤岛问题。

04:00
arXiv cs.AI

基于关键感知自反馈重试的智能体强化学习

提出PivoARL框架,通过识别关键错误轮次进行局部重试,提升任务成功率并减少交互成本。

04:00
arXiv cs.AI

从移动数据到商业洞察:面向大规模城市移动分析与决策支持的端到端分析框架

利用移动数据构建端到端框架,实现移动画像、轨迹挖掘和异常检测,支撑城市与商业决策。

04:00
arXiv cs.AI

应用带模糊隶属函数的回答集编程:一个案例研究

提出模糊回答集编程扩展,用学习隶属函数与语义谓词桥接数值与定性推理,支持模糊环境稳健推理。

04:00
arXiv cs.AI

如何避免辩论:通过双重高效交互证明实现可扩展的AI安全

本文提出无需辩论的单证明者交互证明,双重高效验证AI安全,适用于鲁棒计算或低阶多项式预言机。

04:00
arXiv cs.AI

严谨性在人工智能中的角色

AI缺乏严谨科学基础却能力惊人,从概念、认知、操作三方面剖析矛盾,解释其快速进展与不确定性根源。

04:00
arXiv cs.AI

使用确定性真实值评估长文本生成中LLM的不确定性

提出SALT基准评估长文本不确定性,发现原子级置信度排名失效,推理带来准确性-排名权衡。