10015 条条目 · 106 个活跃源
2026年7月29日
04:00
arXiv cs.CL

MyMentorLLM:一个包含多模态语音/文本患者、受训者和专家的心理治疗GenAI刻意练习环境

MyMentorLLM多模态CBT训练生成2100会话,分析情绪诊断,表明刻意练习可行但需评估反馈。

04:00
arXiv cs.CL

AI在物理、天体物理和宇宙学科学研究中的辅助能力(二):项目规划与提案评估

LLM能生成与人类相当的项目计划,但AI评审偏向AI提案,且AI可100%识别作者,建议谨慎应用于提案准备与评估。

04:00
arXiv cs.CL

WorkSurface-Bench:面向多界面知识路由的企业智能体基准测试

提出WorkSurface-Bench,评估企业智能体多源知识路由能力,1151个任务表明正确选择界面必要但不足。

04:00
arXiv cs.CL

UniMem:面向边界无关任务流的互补性情景到参数记忆

UniMem利用自路由框架协调情景与参数记忆,平衡稳定与可塑,在边界无关任务流中平均提升4.0 EM。

04:00
arXiv cs.CL

阿拉伯语语言模型对抗鲁棒性评估

对抗攻击分别使阿拉伯语模型准确率下降92%、58%、76%,对抗训练提升鲁棒性,但字符噪声仍是挑战。

04:00
arXiv cs.CL

AngelSpec:面向现实世界高性能推理的投机解码方法

AngelSpec通过联合特化MTP与块扩散,DFly架构提升接受长度30%,吞吐量达2倍加速。

04:00
arXiv cs.CL

Polistemics:评估LLM作为政治与选举信息中介者

新基准测试发现LLM在政治信息中介中,清晰时可靠,模糊或矛盾时系统性失败,受政党先验影响,无模型表现一致。

04:00
arXiv cs.CL

具有挑战性的真实临床病例中多轮多模态诊断推理的评估

新基准ClinMM-Bench评估多轮多模态诊断,专有模型准确但完全正确率低,推理质量有限,存在五种错误模式。

04:00
arXiv cs.CL

中文标题:检测文本、表格和知识图谱间的知识不一致性

中文摘要:提出Kontrast框架,利用Text-to-SPARQL和LLM推理自动检测并解释跨模态知识冲突。

04:00
arXiv cs.CL

指令调优模型局部句法重用超过人类

指令调优模型比人类更重复相邻句法,但句法选择性和适应性下降。

04:00
arXiv cs.CL

Shieldstral:政策自适应多模态安全分类器

3B参数模型通过二分类问答框架整合5400万样本,多模态安全分类超越大7倍模型达SOTA。

04:00
arXiv cs.CL

VLD-RAG:面向长篇幅、视觉丰富多页文档的代理式视觉语言检索增强生成

提出VLD-RAG框架,用多模态混合检索与代理验证,提升视觉丰富长文档的跨页证据检索与问答性能。

04:00
arXiv cs.CL

语言作为创意LLM交互的物质接口

探索语言作为物质接口的创意AI交互,通过两周生态研究揭示多种语言模式与时间性,提出开放交互设计考虑。

04:00
arXiv cs.CL

检索前思考反噬:自适应知识图谱检索的TraceBound诊断

TraceBound诊断表明,检索前思考在KG检索中适得其反,因重复调用和预算分配不当,须作为控制问题评估。

04:00
arXiv cs.CL

文本分块大小对检索增强生成性能的影响

研究文本分块大小及检索数量对RAG系统生成质量和检索效果的影响,需权衡精确性与信息量。

04:00
arXiv cs.CL

从朴素RAG到深度代理检索:面向法规合规的演进式上下文工程流水线

从朴素RAG演进至深度代理检索,提出PEA-CAE架构,证明上下文工程比微调更经济可行。

04:00
arXiv cs.CL

中文标题:检索而非幻觉将是基于LLM的临床AI工具的关键限制因素

中文摘要:本文呼吁将临床AI中LLM错误的关注点从幻觉转向检索召回,并概述了误差类型、缓解策略及研究方向。

04:00
arXiv cs.CL

传递接力棒:轨迹中继的在线策略蒸馏

提出接力蒸馏,解决学生前缀失败问题,老师短暂接管纠正,多个推理基准最佳,训练轨迹缩短超50%。

04:00
arXiv cs.CL

多目标结构化剪枝优化大语言模型的延迟与模型大小

提出两阶段多目标结构化剪枝:粗粒度移除块,细粒度并行贝叶斯优化层剪枝,在保持性能下优化延迟和模型大小,适合边缘部署。

04:00
arXiv cs.CL

无读者的阅读:大型语言模型将读写折叠为单一纠缠代码

LLM读写代码纠缠(指数0.23-0.35),行为正耦合,与人类脑双分离相反。

04:00
arXiv cs.CL

DocAnnot——用生成式AI自动标注加速关键信息提取数据集创建

DocAnnot框架利用LVLM、OCR及空间匹配算法自动标注KIE数据集,F1达0.679/0.846,大幅减少人工,高效接近完美标注。

04:00
arXiv cs.CL

SourceMinds在CheckThat! 2026:多智能体流水线中基于NLI的引文审计用于生成完整事实核查文章

提出多智能体流水线,融合证据检索、结构化规划、门控自评和NLI引文审计,生成引文支持的事实核查文章。

04:00
arXiv cs.CL

HANDBOOK.md:长上下文智能体指令遵循基准

提出HANDBOOK.md基准,65个模拟企业手册的任务,最佳模型通过率仅36.2%,揭示长上下文政策遵循的突出问题。

04:00
arXiv cs.CL

SciClaimSeekers在CheckThat! 2026:利用LLM重排序为社交媒体声明检索科学来源

提出混合检索与LLM重排框架,在CLEF-2026任务中MRR@5达64.39%,证明大模型流水线可媲美微调。

04:00
arXiv cs.CL

面向心理健康的LLM检索增强生成:量化分层安全架构中检索的增量贡献

RAG通过检索上下文提升心理健康LLM意图检测准确性与安全性,误报增加但符合安全优先设计。

04:00
arXiv cs.CL

按位置排序:顺序敏感性——LLM列表式推荐器中可利用的攻击面

LLM列表式推荐器因位置偏差易受攻击,通过重排序即可提升目标排名,需正则化或架构改进来缓解。

04:00
arXiv cs.CL

双重视角,统一表达:基于证据的对话式音乐推荐

解耦检索与生成,通过混合检索和证据分配框架提升对话推荐解释可靠性。

04:00
arXiv cs.CL

智能体检索基准:评估编码智能体的仓库上下文检索

提出用于评估编码智能体文件检索的基准,含427个样本,发现不同方法各有优劣。

04:00
arXiv cs.CL

提示工程对小型语言模型在受控查询路由中的影响

提示优化显著提升小型语言模型在受控查询路由中的性能,Mistral 7B分数从81.79升至90.87。

04:00
arXiv cs.CL

超越“检索什么”:检索增强代码生成中的不确定性

OpenCoder通过估计源不确定性过滤异质性证据,将GPT代码正确率从56.25%提升至78.13%,但效果依赖LLM后端,揭示不确定性可作为控制信号。

04:00
arXiv cs.CL

大规模渐进采样下的数据质量分析:面向以数据为中心的AI管线基准测试

盲随机均匀采样在5%预算下误差0.49%,代表性比领域知识更关键,优于代理引导方法。

04:00
arXiv cs.CL

超越自我认知:在大语言模型中传播推理与检索的不确定性

利用置信度阈值路由检索,减少检索量20.4%并提升F1至0.483,但额外探测增加28.2%token。

04:00
arXiv cs.CL

患者端健康AI智能体评估基准框架:PatientAgentBench

提出PatientAgentBench,通过模拟对话和六维临床评分评估AI智能体,发现分诊与安全存在差距,静态基准不足。

04:00
arXiv cs.CL

基于眼动追踪的自动可读性评估方法认知评估

自动可读性评分方法无法有效预测实时阅读难易度,远逊心理语言学词汇属性,需认知驱动新方法。

04:00
arXiv cs.CL

局部自适应揭示Transformer中的不同学习特征

局部适应位置影响模型学习、泛化与选择性,不同目标呈现独特适应几何。

04:00
arXiv cs.CL

AI在物理学、天体物理学和宇宙学科学研究中的辅助能力 I:文献综述

AI与人类选文重叠不足6%,且生成文献中3%为虚构、64%存在元数据错误,但2026年模型显著改善。

04:00
arXiv cs.CL

AIriskEval-edu演示:教学解释中的教育风险审计

该平台审计教学解释的五个风险维度,用本地评估器实时审计并提供可解释结果,性能优于GPT-5.5。

04:00
arXiv cs.CL

RSIBench-Data: 面向递归自我改进的数据中心研究基准测试

评估LLM代理数据中心研究能力,发现58%场景可改进但78%后续尝试得分更低,揭示持续改进难题。

04:00
arXiv cs.CL

Stemma:诱导决策区域揭示LLM溯源

提出Stemma方法,利用诱导决策区域继承性测试LLM溯源,抵抗特征漂移,在770对测试中AUC达0.967。

04:00
arXiv cs.CL

面向不规则临床时间序列问答的经济高效多模态大语言模型推理框架

提出ClinPRISM,利用不规则感知编码与渐进对齐,仅用16个token、0.15秒延迟,实现临床时间序列问答最优性能。

04:00
arXiv cs.CL

基于信息论的文本程式化簇识别方法

提出加权自信息算法识别文本程式化簇,应用于希伯来圣经分层,揭示作者与编辑过程。

04:00
arXiv cs.CL

M^2PO:面向机器翻译的多视角多对偏好优化

提出M^2PO框架,通过双视角机制纠正流畅性偏差,并用多对目标捕捉部分错误,使9B模型性能匹敌GPT-4o。

04:00
arXiv cs.CL

大型推理模型认知习惯探究

大型推理模型展现类人认知习惯,能自适应任务,某些习惯与有害输出相关。

04:00
arXiv cs.CL

在大型语言模型中定位人格表征

研究发现LLM人格表征集中于解码器后三分之一层,伦理观有重叠,政治观区分明显。

04:00
arXiv cs.CL

Med-R$^3$:通过渐进式强化学习增强LLMs的医学检索增强推理

提出Med-R$^3$框架,渐进强化学习联合优化检索与推理,性能超越GPT-4o-mini。

04:00
arXiv cs.CL

PilotRL:全局规划引导的渐进强化学习训练语言模型智能体

提出全局规划引导的渐进强化学习框架PilotRL,在智能体任务中超越GPT-4o,性能提升3.6%。

04:00
arXiv cs.CL

当算法遇见艺术家:公共AI艺术话语中的语义压缩与利益相关者边缘化(2013-2025)

公共AI艺术话语中,艺术家的多样化关切被窄化,具体监管诉求被忽略,导致利益相关者边缘化。

04:00
arXiv cs.CL

守护者与加害者:大语言模型有害内容生成与安全缓解综述

综述LLM在有害内容生成与安全缓解中的双重角色,涵盖无意毒性、对抗性越狱及RLHF等防御策略,指出评估局限与未来方向。

04:00
arXiv cs.CL

VisRAG2.0:通过证据引导的多图像推理减轻视觉检索增强生成中的视觉幻觉

EVisRAG通过显式收集多图像证据与范围奖励设计,有效减轻视觉幻觉,提升推理可靠性,平均性能提升19%。

04:00
arXiv cs.CL

利用开放模型构建大规模英-罗文学翻译资源

提出TF2框架,基于12B开放模型两阶段微调,低成本生成高质量英-罗文学翻译,性能接近专有模型,已开源模型和数据集。