5419 条条目 · 106 个活跃源
2026年7月3日
04:00
arXiv cs.AI

Wiola架构:高效小型语言模型的设计

Wiola是一种全新SLM架构,含五项创新,支持多尺寸并兼容HuggingFace。

04:00
arXiv cs.AI

Agent4cs:一种面向大型层次化代码库的代码摘要多智能体系统

Agent4cs多智能体框架自底向上总结大型代码库,含总结、关键词提取、质量保证三个智能体,语义一致性提升8%,关键词覆盖率提升38%。

04:00
arXiv cs.AI

超越下一个词预测:在Atlassian工作流中针对工具使用代理的RLVR概念验证

针对企业API工具使用,RLVR训练小模型显著提升成功率,但手工奖励难扩展。

04:00
arXiv cs.AI

Janus: 一个用户参与的智能体权限管理实验平台

Janus系统探索用户参与的权限管理,用户输入增强安全,AI辅助减轻负担,但需考虑用户疲劳,无通用最优设计。

04:00
arXiv cs.AI

有限监督下重新审视思维链推理:半监督思维链学习

Semi-CoT利用未标记问题生成伪推理链,通过熵门筛选高精度伪CoT,但有效使用仍需更强选择或训练。

04:00
arXiv cs.AI

OPINE-World: 基于本体错误优先的交互式探索的程序化世界建模

OPINE-World在线学习对象中心程序化世界模型,以本体错误引导探索,在ARC-AGI-3上无需训练解决20/25游戏,效率78.4。

04:00
arXiv cs.AI

安全自适应云修复:神经符号世界模型验证LLM生成恢复计划

PASE用LLM生成恢复计划,神经符号世界模型验证,DRL优化提示,恢复时间减少40%。

04:00
arXiv cs.AI

AI交通科学家自主发现交通规律

TrafficSci系统自主发现交通规律,重现已知规律并揭示城市驾驶行为的新时间记忆尺度。

04:00
arXiv cs.AI

DRL-CLBA:基于DDPG强化学习的语音分类干净标签后门攻击

提出利用DDPG强化学习和音频隐写的干净标签后门攻击,实现高成功率并绕过防御。

04:00
arXiv cs.AI

自信扩展:为自适应测试时缩放校准大语言模型的置信度

提出C3RL算法校准LLM置信度,基于此的CAS自适应测试时缩放,节省推理预算12.33倍且性能更优。

04:00
arXiv cs.AI

中文标题:空间支撑至关重要:面向降雨场重建的几何感知图融合

中文摘要:提出几何感知多支撑图网络,融合点、线、网格观测重建降雨场,RMSE降低23.2%,优于基线。

04:00
arXiv cs.AI

中文标题

将证据分为公共和私有子集,实现信息不对称,使智能体持有独有知识,通过协商降低误差相关,提升预测准确性12-18%。

04:00
arXiv cs.AI

金融服务大语言模型评估的元基准

提出元基准框架,将452个公开基准映射到工作活动与银行业务域,通过加权方案评估模型表现。

04:00
arXiv cs.AI

路径级别的后见指令用于视觉-语言导航中的语义探索

Phi-Nav通过后见推理对齐指令与探索轨迹,三阶段双监督循环,数据高效且性能优异。

04:00
arXiv cs.AI

Mastermind:面向仓库级漏洞复现的策略驱动学习

提出双循环框架,分离策略学习与任务经验,用GRPO训练可复用策略,使冻结执行器漏洞复现成功率提升至84.5%。

04:00
arXiv cs.AI

潜意识时钟:扩散语言模型中的潜在时间建模

扩散语言模型隐式编码去噪进度,可提取并操控,影响模型信心与熵。

04:00
arXiv cs.AI

大规模LLM智能体安全测试:从风险发现到基于证据的验证

提出Vera框架,通过三阶段自强化流程实现大规模LLM智能体安全测试,攻击成功率达93.9%,并发布含1600用例的Vera-Bench基准。

04:00
arXiv cs.AI

Pre-Flight:评估大语言模型航空运营知识的基准

Pre-Flight基准测试LLM航空运营知识,最强模型仅82.7%,远低于专家95%,表明差距显著。

04:00
arXiv cs.AI

ElephantAgent:智能体系统中的上下文状态连续性

ElephantAgent通过强制上下文状态连续性及历史可追溯性,防御智能体系统中的状态投毒攻击。

04:00
arXiv cs.AI

CamoNAS:面向增强的伪装目标检测的神经架构搜索

提出CamoNAS,一种频率感知多分辨率NAS框架,自动搜索层级结构与RGB频率双流,在COD基准上达最优。

04:00
arXiv cs.AI

SkillCoach: 自我演化评分标准以评估与增强代理技能使用

SkillCoach通过自我演化评分标准从技能选择、遵循、组合和反思四维度评估代理过程,区分质量与偶然成功,提升评估与训练效果。

04:00
arXiv cs.AI

重新思考LLM集成应用的复杂性度量:超越源代码

提出HECATE工具评估提示与代码层复杂性,筛选出10个有效度量,提示层维度独立且重要。

04:00
arXiv cs.AI

Spec-AUF: 面向掩码块草稿器的训练-推理不一致下“接受直至失败”训练

AUF截断交叉熵支持至首次失败位置,提升推测解码平均接受长度,Qwen3-8B上τ从2.40增至2.61。

04:00
arXiv cs.AI

ContextSniper:AntTrail面向仓库级程序修复的令牌高效代码记忆层

ContextSniper通过精准证据选择减少51.5%令牌用量和36.4%成本,解决率仅小幅下降。

04:00
arXiv cs.AI

原子任务图:智能体规划与执行的统一框架

提出原子任务图(ATG),通过显式图管理依赖,实现递归分解、并行执行与失败局部修复,用小模型即可超越强基线。

04:00
arXiv cs.AI

OntoLearner:一个基于大语言模型的本体学习模块化Python库

OntoLearner统一本体访问与LLM学习管道,实证发现本体复杂度而非模型能力是主要瓶颈。

04:00
arXiv cs.AI

面向在线递归MLLM编辑的多模态知识编辑范围泛化

提出ScopeEdit在线编辑器,通过分支解耦控制编辑传播边界,平衡跨模态泛化与局部性。

04:00
arXiv cs.AI

SUNTA: 基于惊奇的层次化视频预测与分块

SUNTA用解耦训练和内部不一致性度量惊奇,实现基于预测误差的层次化分块,在250步长时预测中保持准确。

04:00
arXiv cs.AI

领域特定大语言模型后训练提升健身智能

FitOne系列LLM经三阶段后训练,在ACSM/NSCA认证考试中提升达13%,兼顾领域专业性与通用能力。

04:00
arXiv cs.AI

通过约束实现可引导性:编码代理可扩展监督的基础

用访问控制等约束监督编码代理,比代理框架更廉价,实验显示后门检测召回率提升至90.9%。

04:00
arXiv cs.AI

Copewell:面向公平心理健康的多元智能体群架构

提出多智能体群系统Copewell,通过多源评估、情感映射与双模式干预,实现公平心理健康支持。

04:00
arXiv cs.AI

基于文献锚定的自主研究:从语料库到前沿计算物理学手稿的容错LLM流水线

提出容错LLM流水线,从语料库自动生成发表级手稿,通过文献锚定与冗余机制实现自主研究。

04:00
arXiv cs.AI

非曼哈顿环境中的文本驱动三维室内场景合成

SPG-Layout框架利用统计先验和层次布局,在非曼哈顿环境中生成物理合理的室内场景,显著优于现有方法。

04:00
arXiv cs.AI

海马体线性注意力:为递归遗忘提供精确记忆

HOLA模型添加有界精确缓存,弥补线性注意力递归状态损失,将困惑度降低16%,实现32k长序列稳健检索。

04:00
arXiv cs.AI

面向大型语言模型使用的实践审计框架:集体经验主义、伪理性认知与AI生成内容治理

提出LLM实践审计框架,基于集体经验主义与伪理性认知,分析认知风险,审计流程确保输出可验证可干预。

04:00
arXiv cs.AI

面向可扩展监督的协作式分歧解决

提出协作式分歧解决范式替代对抗辩论,使非专家模型判断准确率从49.2%升至62.1%,实现从说服到协作求真的转变。

04:00
arXiv cs.AI

印度皮肤科医生如何利用人工智能进行临床实践和工作流程管理:一项以特应性皮炎为重点的全国性调查

印度皮肤科医生多用通用AI做认知行政任务,临床需求聚焦慢性病与特应性皮炎工作流支持。

04:00
arXiv cs.AI

超越检测:马德里理工大学生成式AI评估与治理的重塑

大学应摒弃检测思维,制定规则、改革评估并培养AI素养,马德里理工大学正构建六维战略框架,将学生视为共创者。

04:00
arXiv cs.AI

人工智能辅助人类审查缺席判决

AI辅助审查缺席判决,准确率提高6%,速度提升25.9%,有效减少错误并节省时间,助力资源有限法院。

04:00
arXiv cs.AI

AI显卡生产正变得愈发不可持续

研究揭示2013-2025年AI显卡生产环境损害持续上升,呼吁行业重视充分性而非无止境性能提升。

04:00
arXiv cs.AI

命令行AI编码助手的采用与影响:微软2026年初推广Claude Code和GitHub Copilot CLI的研究

微软推广AI命令行工具,社交网络驱动首次使用,采用者合并PR增加约24%,留存取决于编码活动。

04:00
arXiv cs.AI

点云分类中联邦学习与知识蒸馏的基准测试

联合基准测试发现,极端非IID下联邦学习性能剧降,蒸馏压缩模型但硬标签蒸馏存在评估陷阱,推荐无标签蒸馏。

04:00
arXiv cs.AI

面向群组跟随机器人的自适应陪伴:处理动态变化的群组队形

基于视觉语言模型的自适应群组陪伴方法,通过语义推理提升15%成功率、降低25%碰撞率,行为自然适宜。

04:00
arXiv cs.AI

CPG-PAD:概念引导的提示呈现攻击检测

提出基于可解释AI的概念引导提示学习框架,对齐攻击视觉语义,实现跨域泛化SOTA。

04:00
arXiv cs.AI

重新思考通用目标跟踪:迈向人类级感知智能

提出增强目标判别、鲁棒适应与几何推理的方法,缩小机器跟踪与人类感知的差距。

04:00
arXiv cs.AI

GPUAlert:一种零代码注入的进程边界监控器,用于诊断GPU训练任务故障

GPUAlert零注入监控GPU训练任务,自动发送含故障原因和日志的通知,性能高且开销极低。

04:00
arXiv cs.AI

完全无监督的海底电缆物理接触检测:基于偏振态监测

提出无监督Fast-Slow DSVDD检测器,无需标签即可在12万余次记录中精准识别全部5次拖网接触事件。

04:00
arXiv cs.AI

基于区域感知图神经网络的鲁棒可解释三维模态形状识别

提出规范工程图表示与区域感知图学习框架,实现跨车辆项目的鲁棒可解释三维模态形状识别。

04:00
arXiv cs.AI

超越基于梯度的攻击:网络安全分类器中的对抗鲁棒性与可解释性稳定性

对抗攻击威胁预测与SHAP解释,引入ESI指标,揭示预测鲁棒性和解释稳定性为不同维度,梯度攻击对树模型失效但仍显著影响解释。

04:00
arXiv cs.AI

IntentTune:利用用户需求与个性化解决电商搜索中的“未知”查询意图

提出IntentTune框架,利用用户历史搜索等行为信号解决电商模糊查询意图,效果优于群体需求模式。