5807 条条目 · 106 个活跃源
2026年9月4日
04:00
ArXiv AI

基于提示工程的方法,在通用AI助教中实现可扩展、灵活、实时的混合微观个性化

提出提示工程框架,按六维学习者特征个性化通用AI助教,结合布鲁姆分类法,实验显示可感知的响应差异。

04:00
ArXiv AI

困于故事:多轮LLM对话中的叙事俘获

多轮道德咨询中,大模型易被单方叙事俘获,判断平均偏移25个百分点,需保持独立判断。

04:00
ArXiv AI

Dude:面向论文-代码差异检测的双检测多智能体系统

提出首个双检测多智能体系统Dude,解决论文-代码差异检测中误报问题,F1最高提升18.7%。

04:00
ArXiv AI

超越“AI生成”标签:可视化来源密度以减轻透明度代价

提出来源密度可视化界面,助用户区分事实与虚构;实验显示其显著提升辨别力,优于简单的AI生成标签。

04:00
ArXiv AI

GUI智能体知道何时不应行动吗?实现多模态GUI智能体的冲突感知终止

提出冲突感知终止基准与干预框架,使智能体识别矛盾指令并停止执行,同时保持正常任务性能。

04:00
ArXiv AI

DuplexSpeechBench-IFEval:全双工语音智能体隐式指令跟随评估基准

提出DSB-IFEval基准,含1038例,评估全双工语音智能体隐式指令跟随;结果显示架构权衡,且安全冲突难解决。

04:00
ArXiv AI

AutoGraphForge:迈向自动图论发现

提出自动图论发现流水线,经反例引导生成6522个猜想,人工证明部分定理,并用Lean4及神经证明器验证。

04:00
ArXiv AI

激进解码期KV淘汰的关键要素:时间聚合与排序保持

时间聚合与排序保持决定激进KV淘汰效果;EMA聚合使评分改动失效,InertiaKV提速1.34-1.46倍。

04:00
ArXiv AI

视觉先验引导的特征重配置用于医学病灶分割

提出FreNet,以视觉先验在编码前像素级重配置、编码中特征级重配置,抑制背景、应对多样病灶,9个基准达最优。

04:00
ArXiv AI

提示工程在药物毒性预测中的应用分析

英国临床试验耗资巨大且失败率高,研究分析LLM提示工程。发现模型自然变异大于提示微调影响,用化学信息学代码提取特征效果更佳。

04:00
ArXiv AI

基于约束生成的整数规划反事实路由

用整数规划迭代添加约束精确求解反事实路由;测试中质量第四,但速度最快,平均9秒,远快于次快的118.8秒。

04:00
ArXiv AI

面向数据中心能源优化的人工智能

综述约194篇文献,发现AI优化数据中心多仅模拟验证,忽略水与碳核算,方法难分优劣;提出CLEAR-DC框架以统一报告净收益。

04:00
ArXiv AI

主动服务智能体:统一决策框架、方法与评估

主动服务需从环境推断机会并决策是否干预,定义为授权约束下的部分可观测决策过程,强调校准增量价值而非离线性能或长期记忆。

04:00
ArXiv AI

SimSkill:自主精通交通仿真的终身学习AI智能体

SimSkill是终身学习智能体,面向SUMO交通仿真,自动生成并验证任务,积累程序与语义记忆,使完成率最高提升二十五个百分点。

04:00
ArXiv AI

推断人工代理中的情感意识:案例研究

人工代理虽完全确定性,却可表现享乐性地点偏好,提示情感行为未必源于主观感受,对理解意识物理基础有启示。

04:00
ArXiv AI

去序保级:HTN计划去序化

将经典规划去序技术扩展至HTN,去除多余顺序约束,验证于IPC基准,显著减少约束数量,关键路径略降。

04:00
ArXiv AI

替我发言:赋予大语言模型参与会议的情景意识

CAPA架构通过状态更新与预测,使代理把握发言时机:静默率由51.4%降至2.5%,恢复率翻倍,幻觉仅0.6%。

04:00
ArXiv AI

基于SMT的HTN-SAT编码实现数值TOHTN规划

研究数值全序HTN规划,用SMT扩展SAT编码处理数值变量,提供基准测试,实验证明其具备竞争性基线。

04:00
ArXiv AI

更多批评并不会让评审更好:EquiReview-R

评审该区分遗漏与过度批评:先修订后搜索可使过度批评从15.5%降至8.1%,遗漏上限9.9%。

04:00
ArXiv AI

FiMI银行:面向印度零售银行业的自主模型

偏好优化安全拒答升至80%,可验证奖励RL优化工具任务并减29%词元,两种方法互补。

04:00
ArXiv AI

Spurious Advantage Hidden in GRPO

04:00
ArXiv AI

重新思考大语言模型的在策略蒸馏(二):单个训练样本

单查询在策略蒸馏即达全数据大部分收益,源于状态覆盖高而吸收慢;瓶颈在算法。

04:00
ArXiv AI

从欺骗性输出到欺骗性机制:语言模型欺骗研究的因果框架

新框架区分欺骗行为与机制;实验表明欺骗性行为可无对应机制,接收者信息能因果影响偏好,但非模型能动性。

04:00
ArXiv AI

自主研究集群中涌现性作弊与举报的案例研究

百个LLM自主智能体科研群中自发出现作弊,后被举报抵制;共享设施既传播漏洞也支持监督,需以制度机制治理。

04:00
ArXiv AI

干净工程,不稳定测量:共享端点上黑盒大语言模型观察者的预注册可靠性失效

预注册审计发现共享端点上黑盒大语言模型测量不稳定,同请求重复排名一致性极低,模型名不是冻结仪器。

04:00
ArXiv AI

Reflect-SQL:一种基于自我反思的文本到SQL生成框架

针对复杂数据库模式与查询,提出多阶段自我反思框架,经检索、合成、蕴含三循环迭代优化,在BIRD基准上执行准确率达72.03%。

04:00
ArXiv AI

匿名化而非消除:保持效用的语音匿名化

提出两阶段语音匿名化框架,保护内容与声纹隐私,实验显示隐私强且效用损失小,评估更全面。

04:00
ArXiv AI

基于联邦图学习的LLM多智能体系统隐私保护拓扑引导安全

联邦图学习让LLM多智能体系统在不共享数据下实现拓扑安全,性能超越集中式,有效抵抗分布偏移。

04:00
ArXiv AI

PrivateHub:用于生成私有传感器密集型环境数据的对比扩散模型

PrivateHub用对比扩散生成多传感器数据,保留非隐私应用可检测性,使隐私应用识别率降40%~50%。

04:00
ArXiv AI

X-Translator:一种实时多语言说话人感知的语音到语音翻译系统

多说话人长对话场景的实时级联翻译系统,通过增量分段提交与说话人提示管理,平衡质量、延迟和声音一致性

04:00
ArXiv AI

联邦入侵检测中的隐私、鲁棒性与公平性权衡:聚合接口上的几何不可区分性

联邦入侵检测中隐私噪声与鲁棒聚合会加剧少数类攻击漏检,须联合权衡而非独立组合。

04:00
ArXiv AI

文明框架:个人多智能体系统间以主权为锚的通信

以文明(人类主权、账本、智能体)为通信主体,大使馆协议异步收发消息,发现先到信息获不当权威的效应。

04:00
ArXiv AI

ToolDF:面向混合真实性音频深伪检测的工具集成推理框架

提出ToolDF框架,用音频大模型分源并路由专家,混合真实性检测性能最优且证据可解释。

04:00
ArXiv AI

空地协同视觉语言导航:基于共享鸟瞰图

提出AGC-VLN,首个空地协同视觉语言导航免训练基线,利用无人机鸟瞰图与地面车局部视角互补,成功率达77%,较单智能体提升27%。

04:00
ArXiv AI

软件工程中采用人工智能的心理代价

软件工程采用AI会带来心理代价,如责任焦虑、身份认同受损,员工通过恢复控制等方式应对。

04:00
ArXiv AI

从先验引导启发式到可部署智能体:加速截止时间约束网络控制的示范驱动强化学习

提出截止时间感知拥塞指标及混合框架,用统一目标推导强化学习训练协议,以示范驱动加速,保证端到端时延。

04:00
ArXiv AI

BRIDGE:通过形态-控制协同设计实现物理AI的开源人形平台

提出数据驱动的形态-控制协同设计框架,优化人形机器人的类人运动,并推出开源平台,性能达到最优。

04:00
ArXiv AI

LevelSyn:通过电平异步图神经网络实现物理感知逻辑综合

针对逻辑综合与物理设计脱节问题,提出LevelSyn框架,用异步GNN预测门坐标并优化线长,功耗降6.89%,时延提升27.48%,DRC违规减少99.59%。

04:00
ArXiv AI

FailBench:VLM在判断机器人任务成功方面有多可靠?

FailBench基准测试显示,VLM判断任务成功可靠性低,最佳平衡精度仅0.77,微调反不如通用模型,存在成功偏置,局部裁剪可提升。

04:00
ArXiv AI

GazeFS:基于注视-头部历史的目标中心注视轨迹预测与稳定

提出GazeFS,从注视-头部历史预测目标中心方向与搜索/注视阶段,无需目标信息即可降低注视偏差,提升目标居中精度。

04:00
ArXiv AI

基于自回归语音先验的测试时自适应语音增强

提出单句测试时自适应法,用自回归先验约束增强模型,最小化KL散度,提升噪声失配下语音质量。

04:00
ArXiv AI

对称性与因果性:超越独立同分布数据的因果效应识别

基于保持因果机制不变的数据对称性,构建抽象因果推理语言,实现超越IID数据的因果效应识别。

04:00
ArXiv AI

基于连续神经音频编解码器表示的掩码自回归语音增强

提出掩码自回归语音增强(MARSE),利用连续神经音频编解码表示迭代解码掩码语音,实现性能与计算开销的灵活权衡。

04:00
ArXiv AI

盲目信任,血腥突刺:当攻击者控制的钩子更新将AI智能体框架导向恶意行为

智能体框架盲目信任钩子更新,攻击者可借此植入恶意命令;HookPry工具攻破全部被测框架,现有防御均失效。

04:00
ArXiv AI

挤出丝材形状对3D混凝土打印可建造性的影响:几何感知深度学习-有限元方法

提出几何感知建模框架,结合深度学习预测丝材形状与有限元激活,证明真实丝材几何显著影响可建造性预测,椭圆近似为精度与效率最佳平衡。

04:00
ArXiv AI

不可公式化的定理:有限句法系统的基本极限及其对安全与人工智能的影响

任何一致且充分表达的有限句法系统都有其无法自主产出的定理;该元定理适用于安全人工智能及一切此类系统。