5783 条条目 · 106 个活跃源
2026年9月16日
04:00
ArXiv AI

KnowBench:以工作量削减为统一、面向真实部署的临床AI基准

提出临床AI基准KnowBench,以"工作量削减"(ER)统一衡量医生对系统产出的接受率,实测总ER达97.99%。

04:00
ArXiv AI

穿越稀疏证据:通过显式上下文选择与整合的智能体视觉RAG

SCoRE通过显式筛选整合稀疏视觉证据,结合证据感知强化学习,提升视觉RAG问答可靠性。

04:00
ArXiv AI

表格基础模型仅凭单张表即可涌现泛化能力

单张真实表自监督预训练即可让表格基础模型跨域泛化,任务数量与质量是关键。

04:00
ArXiv AI

Atria Dawn:智能体超级智能的黎明

以可验证经验流程训练的基础智能体模型,多项基准领先;人机协作升至项目级伙伴,人类保留最终决策与监督。

04:00
ArXiv AI

AlgoEvo:面向自动算法发现的自进化智能体搜索

提出自进化智能体框架AlgoEvo,将算法发现变为交互式知识积累,以更少评估与Token媲美或超越专用方法。

04:00
ArXiv AI

早试点、晚承诺:技术快速进步下企业AI采用的实物期权模型

构建两期实物期权模型,比较企业AI立即部署、试点与等待;技术进步快会增加试点,但不支持不可逆承诺。

04:00
ArXiv AI

Stellar Colosseum:面向数学与理论计算机科学长时程研究的多智能体框架

多智能体框架Colosseum以并行生成、证伪与树聚合分配推理,在TCS-Bench上达71.0%,攻克多个开放难题。

04:00
ArXiv AI

基于LLM路由优化SQL生成

首个Text-to-SQL的LLM路由,动态选模型在BIRD上兼顾准确率与成本。

04:00
ArXiv AI

不止于鸭叫:将语言模型与 RAG 深度集成到 DuckDB

FlockMTL将LLM与RAG集成进DBMS,以模型函数和成本优化简化知识密集型分析。

04:00
ArXiv AI

基于状态预测神经网络的多目标IMM跟踪

提出PR-IMM,将Transformer状态预测模型作为新模式融入IMM,结合雷达多普勒,位置误差较IMM降57.3%、ID切换减25.3%。

04:00
ArXiv AI

化学与几何表示保真度提升药物-靶点亲和力预测

DTA表示阶段信息丢失为上游瓶颈;ReGeoDTA保留化学异质性与连续几何,提升预测,表明表示保真度是关键设计原则。

04:00
ArXiv AI

通过一致性驱动的迭代精化实现自然语言到 SysMLv2 翻译

提出一致性检查驱动的生成-检查-修复框架,将自然语言翻译为生产级可接受 SysMLv2 模型,接受率达 100%。

04:00
ArXiv AI

面向包容性野火疏散引导的多语言智能体系统

BEACON为英语能力有限者提供多语言野火疏散指导,含火险预测、路线、清单和聊天机器人。

04:00
ArXiv AI

一种带平均场环境反馈的多智能体Q学习进化计算框架

提出多智能体Q学习与动态环境耦合的平均场框架,推导Q值分布传输方程,并验证网络规模、反馈和时间尺度效应。

04:00
ArXiv AI

多无人机分布式模型预测控制中的冲突预测可变时域

冲突预测可变时域:各机外推邻居航迹、闭式求冲突时间,自适应取最小时域;可证稳定且降耗保安全。

04:00
ArXiv AI

SkillAtlas:面向智能体技能的攻击轨迹库

SkillAtlas将私有安全报告转为可检索公开攻击轨迹库,含3014案例、8类风险,轨迹标签使守卫准确率达0.770。

04:00
ArXiv AI

构建生产级希腊语-英语语音识别器

希英双语ASR Sophea经23轮迭代,三模型ROVER集成使九项生产门槛全过,英语WER4.26%。

04:00
ArXiv AI

智能体化企业操作系统:面向企业智能体持续部署的基底反转

企业智能体难持续运营,根因是数据不适配模型推理;应重构认知基底,以四层框架实现治理。

04:00
ArXiv AI

不确定性下自主避撞的置信空间机会约束机动规划

将交会信息-行动权衡建模为置信空间规划,机会约束树搜索择机机动,减少不必要机动且不违反碰撞风险。

04:00
ArXiv AI

正 p-能量的加边单调性对任意 p ≥ 1 均不成立

证明正 p-能量在加边时可下降,推翻 p≥3 猜想;故对一切 p≥1,加边单调性均失效。

04:00
ArXiv AI

生成式人工智能与扩展现实在协作式建筑设计教育中的应用:一项探索性工作室研究

探索GenAI与多用户XR在建筑协作设计中的影响:技术互补,但信心下降,控制与舒适性存挑战。

04:00
ArXiv AI

云原生 Graph-RAG 的错误归因解耦:数据完整性诊断框架

提出三层解耦诊断框架,正交归因Graph-RAG错误;数据完整性是主要瓶颈,且存在参数知识掩蔽效应。

04:00
ArXiv AI

探索使用大语言模型实现JavaScript代码自动化漏洞识别

评估多款大模型对JavaScript代码的漏洞识别,微调后准确率由29%升至60%,远超传统SAST工具,但召回有限。

04:00
ArXiv AI

mKernel:快速多GPU、多节点融合内核

mKernel实现多GPU多节点融合内核,瓦片级重叠计算与通信,H200最高加速1.88倍。

04:00
ArXiv AI

间隙熵与几乎逐实例最优的最佳臂识别

解决最佳臂识别的间隙熵猜想,证明几乎实例最优样本复杂度下界,给出无需先验间隙的算法,并在 Lean 4 中形式化。

04:00
ArXiv AI

TyPatch:将补丁转化为类型状态规则以实现内核缺陷检测

TyPatch把补丁转为类型状态规则,由共享后端统一执行分析,在Linux内核发现559个缺陷,生成开销降低近九成。

04:00
ArXiv AI

论紧致连通李群上薛定谔桥的随机控制与路径空间表述的等价性

紧致连通李群上薛定谔桥随机控制与路径空间表述等价,控制能量等于相对熵,可化为端点约束下相对熵最小化。

04:00
ArXiv AI

当恶意指令持续存在:针对基于Harness的智能体的持久记忆投毒攻击

提出PMPA持久记忆投毒攻击,恶意指令经良性来源写入智能体记忆,跨会话触发恶意行为与隐私泄露。

04:00
ArXiv AI

单调系统鲁棒受控不变集的实时综合

提出阈值函数重构,将最大不动点迭代转为并行一维二分搜索,实现单调系统受控不变集实时综合,10^14格点两分钟内完成。

04:00
ArXiv AI

重新审视人类反馈的隐含推断对人机协作中偏好学习的意义

固定规则推导人类反馈标签有偏差;提出IMPLIED动态学习修正标签,降低偏好估计误差,提升机器人理性。

04:00
ArXiv AI

混淆模型,控制信息流:理解并缓解LLM智能体的隐私泄漏

指出LLM智能体隐私防御的结构缺陷,提出上下文外工具级信息流控制FLOWSEAL,泄漏率降至近零。

04:00
ArXiv AI

一种基于Transformer的音频亲属关系验证新方法及一个全新的非受控普通话亲属语音数据集

提出Transformer音频亲属验证模型CONVTRAP-TN,并发布贴近日常录音条件的中文亲属语音数据集ARKIN,实验显示现有方法跨库鲁棒性不足。

04:00
ArXiv AI

评估现有设计建议对AI伴侣设计的适用性:一项多方法研究

多方法研究评估现有设计建议对AI伴侣设计的适用性,综合九大原则领域,揭示伦理与UX交织且需情境化。

04:00
ArXiv AI

LLaTSA:与大语言模型对齐的通用暂态稳定分析

提出LLaTSA:用结构化文本前缀与稀疏MoE对齐,实现跨系统暂态稳定轨迹预测与判别。

04:00
ArXiv AI

ECAS:面向验证门控科学应用执行的边缘控制智能体系统

ECAS将云端LLM推理与边缘执行控制分离,以验证门控和闭环修复保障科学应用在HPC上的可靠执行。

04:00
ArXiv AI

建模、扩展与解码:优化含非言语发声的可控语音生成

提出NVV感知DiTAR系统,经预训练、增强微调和推理优化,在NVVSpeech挑战赛总排名第一。

04:00
ArXiv AI

弥合长时临床音频中的模态鸿沟:轻量级与重量级端到端SOAP生成对比研究

构建141万样本语料,多阶段训练实现端到端SOAP生成,30B模型显著优于级联ASR+LLM基线。

04:00
ArXiv AI

AlgoRAG:面向理论计算机科学教育的检索增强生成——算法分析与复杂性理论的综合评估框架

提出AlgoRAG:以检索增强生成与领域知识库辅助算法分析与复杂性理论教学,评估显示准确且教学性强。

04:00
ArXiv AI

探究生成式AI对信息搜寻的影响

用程序修辞分析生成式AI借专业与智能信号影响用户信任,并探讨信息搜寻风险与跨学科应对。

04:00
ArXiv AI

面向腿足机器人强化学习的技能组合

技能单独可靠但切换脆弱;可靠组合应作为独立研究问题,使技能库可复用,并让规划器等接管决策、行为可验证。

04:00
ArXiv AI

从视觉反馈到文本评论:面向图像依据评论辅助的多智能体视觉语言框架

提出图像依据评论辅助新任务,构建四角色多智能体视觉语言框架,从商品图生成可编辑评论草稿。

04:00
ArXiv AI

有求必应的当下、共享的过往、社交中的他者:青少年对陪伴型AI聊天机器人的过度依赖

分析近四千条青少年帖:陪伴型AI带来慰藉与身份探索,却也引发过度依恋、情感依赖与社交替代。

04:00
ArXiv AI

MANE:面向深度神经网络边缘加载的多路径自适应网络

MANE框架令服务器采用多路径尾部架构,运行时动态权衡精度与吞吐,40设备并发下SLO满足率超80%。

04:00
ArXiv AI

基于VLM驱动层次化语义解析的组合式SVG生成

VLM驱动框架将场景递归解析为语义几何层次并补全遮挡,生成可编辑的组合式SVG,并建立新基准与指标。

04:00
ArXiv AI

非SCAR假设下的PU分类:聚类辅助与过采样增强的逻辑回归模型

非SCAR下PU分类:SMOTE结合聚类清洗训练逻辑回归,实验显示性能提升,LassoJoint稳健。

04:00
ArXiv AI

面向“检索或拒绝”热机械点阵搜索的属性注册表契约

用属性注册表契约实现热机械点阵检索或拒绝:可行则返回可重建行,无解则给出极小不可满足约束与修复松弛。

04:00
ArXiv AI

TriCalRAG:面向AIOps本地化LLM根因分析的三策略检索增强基准

提出TriCalRAG本地LLM根因分析基准:RAG较零样本提升F1约0.10–0.27,且显著改善校准稳定性。

04:00
ArXiv AI

随机代理:面向工具调用型LLM智能体的结构性租户隔离

指出LLM代理解析租户标识的越权风险,提出移出工具模式、绑定凭据并在代理下层强制隔离,实验验证有效。

04:00
ArXiv AI

RAIN:用于语义水印提取的区域感知反演网络

RAIN将水印端点恢复分解为图像锚点与噪声残差,免提示一步提取语义水印,开销低于OSI与FARI。

04:00
ArXiv AI

大语言模型作为神谕:对主观个人问题的依赖

人们将主观个人判断外包给大模型,此类“神谕式”使用随时间增长、年轻人更普遍,用户常不自知且不满。