5362 条条目 · 106 个活跃源
2026年8月10日
04:00
arXiv cs.AI

人不仅由其国家定义:解析欧洲大语言模型价值对齐的社会决定因素

大语言模型对不同社会人口群体价值对齐不均,国家因素单独解释力与全部社会人口因素相当,且两者互补。

04:00
arXiv cs.AI

一图胜千言:视觉语言模型如何削减AI能耗并提升精度

视觉语言模型将时序数据编码为二维图,输入token减少3.6-10.4倍,推理能耗降1.8-2.5倍,精度反超文本模型与基线,为数值时序分析提供节能高精度方案。

04:00
arXiv cs.AI

CoBa:基于计算均衡路由的经济高效测试时扩展

CoBa均衡路由分配测试时算力——广泛廉价验证、重算高价值候选,以近半计算量达到同等或更高推理精度。

04:00
arXiv cs.AI

Muon训练Transformer中表示-读出接口处的Grokking后崩塌

Muon在模113加法grok后崩塌,根在表示-读出接口;冻结接口可避免,任务族完美却被对抗余项否决。

04:00
arXiv cs.AI

通过多阶段后训练渐进对齐推荐基础模型

提出LP-FFT-RFT三阶段渐进后训练框架,先适配任务再对齐业务指标,离线优于单阶段,线上A/B测试提升推荐质量。

04:00
arXiv cs.AI

CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training

04:00
arXiv cs.AI

MI-MIDI:通过探针、透镜和引导实现文本到MIDI生成模型的机制可解释性

用探针、透镜和引导分析两个文本到MIDI模型,揭示音高、配器等结构可线性解码,并实现双向控制。

04:00
arXiv cs.AI

智能体AI:用户赋权还是圈占?

智能体AI赋权取决于技术背后的政治决策;个体收益与集体抗争能力可能背离,治理固化压缩用户参与。

04:00
arXiv cs.AI

SoRoMoX: Fast, Differentiable, and Parallelizable Soft Robot Models

04:00
arXiv cs.AI

终身MAPF中基于交错更新的可扩展长时域规划

PUSH结合PIBT、RHCR与TP优点,以交错窗口规划子集,在通用地图上支持上万智能体长时域规划,吞吐量显著优于基线。

04:00
arXiv cs.AI

HarnessSafe:评估智能体框架中跨持久化载体的安全性

提出安全基准,覆盖七类持久载体三百二十八案例,用多阶段追踪评估攻击链进展,发现遏制效果因载体和模型后端而异

04:00
arXiv cs.AI

超越文本匹配:迈向面向人类二进制逆向工程的免参考评估

首次系统探究LLM-as-a-Judge评估二进制逆向任务,构建基准BinJudgeBench并提自适应路由方案BinJudge,相关性远超传统指标,兼具高效与低成本。

04:00
arXiv cs.AI

基于零知识证明的图像出处软删减

提出用零知识证明替换敏感出处断言,支持距离证明,兼容C2PA,秒级构建、毫秒级验证。

04:00
arXiv cs.AI

面向GPU加速超级计算机的可扩展高保真大分子对接

提出基于GSO的GPU加速可扩展对接框架,实现高保真柔性对接,速度提升超百倍,时间从小时降至秒级。

04:00
arXiv cs.AI

Towards Assurance Closure in AI-Native Large-Scale Agile Software Development

04:00
arXiv cs.AI

迈向决策与智能体AI的因果数据管理生态系统

现代AI是数据集成生态,需因果层区分驱动与相关,提出可查询的因果世界系统(CWS)以支持可靠决策。

04:00
arXiv cs.AI

解读Copom基调:加权LLM框架衡量鹰鸽情绪、前瞻指引与不确定性

提出加权LLM框架,衡量巴西Copom声明基调,区分鹰鸽/中性句,结合强度与前瞻指引,属方法论贡献。

04:00
arXiv cs.AI

一个幂零类为三的有限E-群

证明3^84阶3-群为E-群,其张量刚性化为PG(8,3)上9841个点的有限计算。

2026年8月7日
04:00
arXiv cs.AI

点火指数:衡量语言模型中的全局工作空间动态

提出点火指数,以sigmoid陡峭度量化全局工作空间动态;前馈变压器显著优于状态空间模型,循环架构沿迭代轴显现转变。

04:00
arXiv cs.AI

当特权指导错位时:多轮智能体的状态匹配路由与情境化自蒸馏

提出状态匹配路由与情境化自蒸馏,解决多轮智能体特权指导错位问题,显著提升任务成功率。

04:00
arXiv cs.AI

啄木鸟蒸馏:弱模型诊断强模型推理缺陷

提出弱到强蒸馏框架,通过对比局部干预纠正推理错误,提升强模型数学推理性能。

04:00
arXiv cs.AI

抽象事件因果规则:归纳与应用

提出抽象事件因果规则,从噪声数据归纳可泛化的因果逻辑,构建知识库并注入预测模型,显著提升稀有及未见事件的预测性能。

04:00
arXiv cs.AI

SearchAuditor:审计与归因长时程搜索智能体的失败

提出SearchAuditBench与SearchAuditor,定位归因修复长时程搜索智能体失败,通过率32.3%。

04:00
arXiv cs.AI

从连续预测变量到临床阈值:缺血性卒中结局预测中基于指南分类的性能权衡的早期证据

指南分类可替代连续预测变量,多数队列性能无显著下降,特征重要性稳定,可行。

04:00
arXiv cs.AI

PD-GS:音素驱动的3DGS音频驱动说话头

提出音素驱动高斯泼溅法,融合音素与音频,改善唇形,减少漏口伪影。

04:00
arXiv cs.AI

Otter:时间感知与历史条件的人类国际象棋AI

时间感知+历史条件建模,15.3M参数,6.1B位置训练,top-1精度55.23%,超Maia2。

04:00
arXiv cs.AI

智能体自主显微镜基准测试支持资格鉴定,但未必泛化到未见任务

研究多智能体架构、LLM等对显微镜任务的影响,发现基准可用于资格鉴定,但无法可靠预测新任务性能。

04:00
arXiv cs.AI

Project2Task:图引导的自主研究项目级规划

提出图引导的项目级规划方法,生成依赖感知任务合约,提升自主研究任务组合的质量与执行准确率。

04:00
arXiv cs.AI

LUNAR:基于通用用户行为日志的个性化大语言模型基准测试

LUNAR:首个跨域行为日志个性化LLM基准。日志必要非充分,核心挑战为证据选择、跨域整合、隐私控制。

04:00
arXiv cs.AI

TriQua:调和事实性评估中的粒度与上下文

提出新框架,按事实复杂度建模,保留上下文与原子性,精标注错误,评分优于现有分解方法

04:00
arXiv cs.AI

对抗不确定性下态势与保障优化

针对军事资产部署,提出CEV与RobustCEV优化器,应对对抗不确定性,较贪婪基线显著提升效率,自适应对手下提升达158%。

04:00
arXiv cs.AI

OrchestraBench:评估多智能体编排的故障模式、恢复与分解质量

提出OrchestraBench,通过故障注入评估多智能体编排,发现意图推理优于关键词路由,语义故障难以恢复,级联随深度加剧。

04:00
arXiv cs.AI

反事实分析的大语言模型方法

研究用GPT-3.5做反事实分析,提示工程提升预测精度,在在线借贷中生成反事实投资回报,展现逻辑与因果推理,凸显LLM决策潜力。

04:00
arXiv cs.AI

DoctorAgents:面向小型临床时序数据、迭代精调AutoML流程的智能体框架

提出DoctorAgents智能体框架,用LLM智能体以文本梯度下降迭代优化临床小数据ML流程,优于AutoML基线。

04:00
arXiv cs.AI

通过多方利益相关者协商划定警务AI的风险边界

警务AI风险审议中,纳入种族偏见视角并未收窄讨论,反而聚焦工具实效与普惠,凸显从源头融入该视角的益处。

04:00
arXiv cs.AI

基于教学适宜性指数评估与改进LLM人工智能导师的教学契合度

提出教学适宜性指数(PSI)评估并改进LLM辅导响应,PSI反馈使82.3%弱案例提升,证明教学契合可测可改。

04:00
arXiv cs.AI

随机性并非难点:先修DAG上教学排序的归约与复杂性

教学排序可转化为确定最短路;即使无先修边也NP难;无环偏好时拓扑序最优,固定宽度可多项式求解,mΔ可评估优化价值。

04:00
arXiv cs.AI

EcoAgent-Bench:评估预算受限LLM智能体的经济决策

EcoAgent-Bench以定价动作与预算评估LLM智能体,发现其经济决策薄弱,预算下成功与节约行为是不同属性。

04:00
arXiv cs.AI

SkillTV-Bench:评测裁判在技能增强型智能体执行中的表现基准

提出SkillTV-Bench基准与SkillTV-Evolve方法,裁判准确率提升14.8个百分点。

04:00
arXiv cs.AI

StepReflect:移动GUI代理的结构化界面转换反思

提出StepReflect,将GUI反思转为结构化预测,经三阶段训练,提升任务成功率并降低API成本,可本地部署。

04:00
arXiv cs.AI

自主分析代理的新息残差审计:定位、检测极限、错误控制与可辨识性

无标签场景下审计自主分析代理:评分决定错误定位,可控制误报比例,且错误幅度过小则无法归因。

04:00
arXiv cs.AI

Hyper-ES:基于下降方向融合的高效大语言模型推理进化策略

提出子空间进化策略Hyper-ES,融合梯度下降方向优化LLM推理,超GRPO-LoRA 1%且省10%梯度更新。

04:00
arXiv cs.AI

SkillHEX:通过假设驱动的自主探索与利用提升智能体技能

SkillHEX融合假设驱动自验证与证据引导树搜索,破解稀疏奖励与开发陷阱,在SkillsBench上显著提升技能进化效果。

04:00
arXiv cs.AI

测量与检测有害的AI谄媚行为

研究有害AI谄媚(PSRS):测量17个模型,发生率5%-56%,可自动检测,但跨模型泛化性能下降。

04:00
arXiv cs.AI

贝叶斯期望不确定性降低(B-EUR)模型:设计选项值得尝试的计算解释

B-EUR模型将设计选项价值定义为认知不确定性期望降低;实证表明泛化性倒U型,结果可辨性正相关。

04:00
arXiv cs.AI

活动帧:面向智能体记忆与回放的确定性屏幕活动编译

提出确定性编译框架,将屏幕活动压缩86倍,智能体问答准确率98.4%,并首次测量成本参数。

04:00
arXiv cs.AI

统一智能体:跨设备交互管理

针对跨设备交互场景,现有智能体缺乏跨时间状态管理;统一智能体携带交互证据,显著优于四种现有设计。

04:00
arXiv cs.AI

BlockPython:面向从积木式到Python编程过渡的过程感知智能体支持平台

该平台通过双向翻译和四阶段学习,采集过程证据,结合规则诊断与智能助手,支持积木到文本编程过渡。

04:00
arXiv cs.AI

Subliminal Learning is Non-Semantic Distillation

04:00
arXiv cs.AI

ViSR-KGC:基于视觉子图推理与视觉语言模型的多模态知识图谱补全

提出ViSR-KGC方法,提取子图并可视化为图像,结合表示学习与视觉语言模型,利用多模态证据补全知识图谱。