6019 条条目 · 106 个活跃源
2026年5月29日
04:00
ArXiv AI

认知范畴变换器:用于语言建模的范畴论归纳偏差

CCT架构在WikiText-103上困惑度降低12%,消融证实单纯消息传递贡献84%改进。

04:00
ArXiv AI

临床试验中AI与人机交互趋势——混合人机探索

混合人机法分析临床试验中AI术语趋势与分布,发现AI试验增长,中美为主,人机筛选可行但需明确报告定义。

04:00
ArXiv AI

中文标题:AI增强教育中的实践者信念与行为:基于DOT框架的调查证据

中文摘要:基于DOT框架调查72名高校从业者,发现其认可AI教学支持但强调人类监督,存在制度阻碍,理论与实践存在差距。

04:00
ArXiv AI

可微分的基于信念的对手塑造

D-BOS通过可微分的信念动力学塑造对手,在隐藏角色游戏中显著优于PPO和BBM。

04:00
ArXiv AI

注意语气:语气会影响大语言模型的性能吗?

提示语气系统性影响LLM准确率,但效果因模型而异,用户需警惕语气稳健性。

04:00
ArXiv AI

ReasonOps:面向LLM推理轨迹的算子分割

ReasonOps无监督标注大模型推理轨迹,发现7个通用算子,用于模型识别与正确性预测。

04:00
ArXiv AI

迟做胜于早做:基于本体约束的后提取校正的神经符号知识图谱构建

提出神经符号框架,通过后提取校正减少LLM调用,提高知识图谱一致性并保持问答质量。

04:00
ArXiv AI

中文标题:纸面代理,纸面收益:DeFi投资代理的实证分析

中文摘要:DeFi投资代理仅现纸上收益,用户净亏1.9亿美元,估值超基本面万倍,尚处早期。

04:00
ArXiv AI

BenchTrace:用于测试LLM代理反思能力与受控演进的基准

提出BenchTrace基准,评估LLM反思与演进能力,通过失败避免率发现反思通过率低,演进存在遗忘与负迁移。

04:00
ArXiv AI

Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces

04:00
ArXiv AI

OpenClawBench:真实世界智能体执行轨迹中过程侧异常的基准测试

提出OpenClawBench数据集,衡量真实智能体执行中的过程侧异常,揭示成功评估忽略的失败,微调模型检测F1达0.729。

04:00
ArXiv AI

重新审视文献检索评估:深度研究有所助益,但人类引用列表并非金标准

深度研究管线将召回率从低于20%提升至80%以上,但人类引用列表仅51%相关,远逊于AI,需多维度联合评估。

04:00
ArXiv AI

利用AI通过结果无关的师生反馈中介发现孤立学习者

提出基于学生困难、自我分歧和教师担忧的透明排序机制,无需成绩即可发现孤立学习者。

04:00
ArXiv AI

角色提示何时真正有效?基于检索与指标分析的LLM专家角色注入研究

角色提示提升专业性但降低清晰度,效果因领域和问题类型而异,需多指标评估。

04:00
ArXiv AI

ConMoE:基于原型重分配的专家池整合用于MoE压缩

提出无需训练的ConMoE,通过贡献和可替换性信号选择保留专家并重定向调用,实现高效MoE压缩且性能优越。

04:00
ArXiv AI

PassNet:面向图编译器Pass生成的大规模语言模型扩展方法

PassNet构建18K图数据集与PassBench基准,微调小模型获2.67倍提升,验证LLM驱动编译器优化的可行性。

04:00
ArXiv AI

架构敏感的监督微调用于屏幕条件动作预测:PiSAR基准

微调Qwen3-VL-8B显著优于前沿零样本基线,但Gemma-4-26B微调效果差,显示模型与微调方法不匹配。

04:00
ArXiv AI

中文标题:迈向类人交互式语音识别:智能体修正与语义评估

中文摘要:提出Agentic ASR闭环框架,引入句子级语义错误率S^2ER,实验表明迭代交互显著降低语义错误。

04:00
ArXiv AI

VitalAgent: 面向可穿戴健康数据的反应式和主动式生理监测工具增强智能体

VitalAgent是工具增强的智能体框架,支持反应式问答与主动监控,性能提升超30%。

04:00
ArXiv AI

Xetrieval:密集检索的机制性解释

Xetrieval通过嵌入级稀疏特征分解,实现密集检索决策的机制性解释。

04:00
ArXiv AI

CrystalXRD-Bench:面向多样晶体材料的XRD峰指标化视觉语言模型基准测试

CrystalXRD-Bench评估七个模型,最佳精确匹配率仅37.6%,XRD峰指标化任务远未解决。

04:00
ArXiv AI

MINDGAMES:多智能体大语言模型社交与战略推理评估的实时竞技场

Mindgames多游戏竞技场评估LLM社交战略推理,发现规则遵守与结构化支架为瓶颈,发布近3万场多智能体游戏数据。

04:00
ArXiv AI

DeepSurvey:在自动综述生成中增强分析深度与引用可靠性

DeepSurvey通过全文本分析、跨论文建模和代码分析增强综述深度,经引用图扩展与证据约束引用提升可靠性,内容评分8.644,专家偏好83.3%。

04:00
ArXiv AI

UI-KOBE:面向知识的轻量级图引导GUI代理行为探索

UI-KOBE利用应用知识图指导轻量级GUI代理,降低规划负担,提升移动任务执行效率。

04:00
ArXiv AI

采用季节性空间先验和基于LLM的活动链生成的GPS增强型旅游移动性建模

提出融合GPS月条件先验与LLM的四阶段框架,生成人口统计一致的综合行程,验证有效。

04:00
ArXiv AI

DeepTool:通过过程监督强化学习扩展工具集成推理中的交错思考

提出DeepTool框架,利用过程监督强化学习增强工具调用中的交错思考,显著提升推理性能并保持token效率。

04:00
ArXiv AI

Mind-Omni:基于离散扩散的大脑-视觉-语言统一多任务框架

提出Mind-Omni框架,通过离散扩散统一七种脑机任务,实现多模态交互与协同,性能媲美甚至超越专用模型。

04:00
ArXiv AI

FinVerBench:大语言模型财务报表验证中的基准有效性与校准

FinVerBench基准揭示,LLM验证财务报表需超越算术检测,实现校准判断,构造有效性是关键。

04:00
ArXiv AI

HiKEY: 面向开放域文档问答的层次化多模态检索

HiKEY通过层次化树状多模态检索,粗到细定位文档和证据,检索召回提升12.9%,QA提升6.8%。

04:00
ArXiv AI

基于大型语言模型的多智能体框架改进协作故事讲述

提出作家-编辑迭代框架,让多个LLM协同优化儿童故事质量,少量迭代即可高效产出优质叙事。

04:00
ArXiv AI

TRACE:基于图尔敏论证要素的大语言模型思维链推理评估

TRACE通过分析思维链论证结构评估推理,与准确率强相关,可作为强化学习奖励信号。

04:00
ArXiv AI

记法重要:AI代理系统中令牌优化格式的基准研究

TRON减少27%令牌但准确率低14pp,TOON减18%低9pp且多轮解析易失败。

04:00
ArXiv AI

FHRFormer:一种用于胎儿心率时间序列修复与预测的自监督掩码Transformer框架

提出FHRFormer自监督掩码Transformer框架,用于胎儿心率时间序列缺失数据修复与预测,鲁棒性强。

04:00
ArXiv AI

NICE: 基于理论的大语言模型社交智能诊断基准

NICE基于社会理论构建LLM社交智能诊断框架,含137项测试,揭示模型沟通能力薄弱环节。

04:00
ArXiv AI

LLM演化的领域无关启发式方法用于符号AI规划

首次用LLM进化出领域无关启发式,超越手工最优,在未知域解决任务更多,覆盖帕累托前沿。

04:00
ArXiv AI

VikingMem:面向有状态LLM应用的记忆库管理系统

提出Memory Base范式及VikingMem系统,通过事件实体抽象与时序压缩,实现高效状态管理,检索效果提升30%。

04:00
ArXiv AI

BitTP:面向边缘设备的采用BitLLM的轻量级轨迹预测模型

提出BitTP,将LLM轨迹预测器1.58-bit量化,激活全精度,显著降低预测误差与资源消耗,适合边缘部署。

04:00
ArXiv AI

超越轨迹奖励:通过图建模实现代理搜索的步骤级信用分配

提出图距离贡献奖励和步骤优势策略优化,用图建模解决代理搜索步骤贡献分配难题。

04:00
ArXiv AI

Croissant Tasks:一种用于可重现机器学习评估的元数据格式

提出声明式元数据格式,将实现细节抽象为高层规范,使自主代理能生成可重现评估。

04:00
ArXiv AI

NaRA:面向扩散大语言模型参数高效微调的噪声感知LoRA

NaRA通过噪声感知低秩适应,解决扩散模型中噪声动态问题,推理与代码生成任务均获性能提升。

04:00
ArXiv AI

面向真实世界监管合规问答的引文闭合检索与逐规则归因

提出RegOps-Bench基准与RefWalk框架,实现引文闭合检索与逐规则归因,提升监管合规QA性能。

04:00
ArXiv AI

LFQ:对数感知的最终块量化,提升低比特量化大语言模型的生成质量

LFQ通过最小化全精度与量化模型的对数概率交叉熵,提升低比特大模型的生成任务准确率。

04:00
ArXiv AI

中文标题:基于PAC-Bayes风险的嵌套因果Bandit认证策略优化

中文摘要:提出NCTS算法,给出因果PAC-Bayesian风险界,实现离线数据下策略的认证与风险量化。

04:00
ArXiv AI

AgentDoG 1.5:轻量可扩展的AI智能体安全对齐框架

提出轻量对齐框架,仅千样本训练多尺寸模型,性能媲美GPT-5.4,部署为实时安全护栏。

04:00
ArXiv AI

OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准

提出OmniMatBench多模态推理基准,含3171个专家问题,评估13个模型,最佳得分0.372,揭示材料科学推理巨大差距。

04:00
ArXiv AI

SkillsInjector:面向LLM智能体的动态技能上下文构建

两阶段自适应方法动态优化技能选择、数量与呈现,显著提升任务完成率。

04:00
ArXiv AI

MEMENTO:利用网络作为低数据领域的学习信号

MEMENTO框架将网络作为学习信号,通过自适应探索与双通道记忆,无需额外训练即可在低数据领域显著提升性能。

04:00
ArXiv AI

SAAS:自我感知强化学习缓解智能体搜索中的过度搜索

提出SAAS框架,通过搜索边界建模、边界感知奖励和阶段优化策略,显著减少过度搜索,保持准确性。

04:00
ArXiv AI

OptSkills:通过基于聚类的蒸馏从问题原型中学习可泛化的优化技能

OptSkills从问题原型聚类,蒸馏工作流技能,提升优化建模求解的泛化性,在多个基准达SOTA。

04:00
ArXiv AI

It`s All About Speed: AI`s Impact on Workflow in Music Production