10133 条条目 · 106 个活跃源
2026年7月7日
04:00
arXiv cs.CL

SelfMem:面向AI智能体的自优化记忆系统

SelfMem让AI智能体自主探索记忆策略,在长对话任务中性能提升最高48.7%。

04:00
arXiv cs.CL

ProACT:面向多用户协作中具有故障感知能力的主动代理

提出ProACT框架,通过感知协作故障并主动干预,实验证明其增强协作合适性与干预质量。

04:00
arXiv cs.CL

超越静态规则:Text-to-SQL中潜在漏洞的自动发现

提出SAGE框架自动发现Text-to-SQL潜在漏洞,揭示模型脆弱性,漏洞模式可跨模型迁移。

04:00
arXiv cs.CL

一致但不准确:评估LLM在自然语言风险沟通中的局限性

LLM对概率预测解释一致但校准差,尤其不确定性描述不准确,不宜直接用于风险沟通。

04:00
arXiv cs.CL

重构智能体时代的科学发现

SCION智能科学操作系统通过元驾驭代理和研究执行计划,实现可追溯可复用的科学创新,优于现有基线。

04:00
arXiv cs.CL

Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

04:00
arXiv cs.CL

韩语冠形词尾结构在语料数据中的标注:超越关系从句识别

韩语冠形词尾ETM非关系从句标记,而是多种冠形结构形态成分,语料分析显示仅39.4%为关系从句类用法。

04:00
arXiv cs.CL

GRASP:图推理辅助的综述规划用于高保真相关工作总结生成

GRASP结合LLM规划与图算法,用两层图结构和Steiner树提取论文核心关系,生成与人工撰写高度匹配的相关工作总结。

04:00
arXiv cs.CL

方言能否像语言一样被引导?阿拉伯语大语言模型中的稀疏神经元与分布式方向

研究通过稀疏神经元分析与向量引导,实现无需微调的方言生成控制。

04:00
arXiv cs.CL

面向音节分词的说话人解耦分块回归

提出说话人解耦的分块回归音节分词,消除说话人干扰,实现音节边界检测与聚类SOTA,语言模型理解性能提升7%。

04:00
arXiv cs.CL

BanglaMemeEvidence:孟加拉语模因解释性证据检测的多模态基准数据集

首个孟加拉语模因证据检测研究,构建2917模因数据集,提出多模态框架,F1达0.74,填补低资源语言空白。

04:00
arXiv cs.CL

TRACER:面向任务型对话的早期故障检测

TRACER通过信念状态变化与文本表示,从部分对话中提前预测任务型对话的最终失败,实现有效预警。

04:00
arXiv cs.CL

NormWorlds-CF:基于求解器验证的反事实规范推理与变质关系GRPO

提出求解器验证的反事实规范推理环境NormWorlds-CF,采用变质关系GRPO奖励,在结构化变化任务中优于答案监督。

04:00
arXiv cs.CL

为AI智能体提供自然语言工具的显著有效性:一项跨14个模型验证NLT性能的复制研究

NLT提升工具调用准确率14.9%,减少关键错误93%,且对非原生工具调用模型增益显著。

04:00
arXiv cs.CL

将表示与重建分离实现可扩展文本编码器

CrossBERT分离表示与重建,支持高掩码比和梯度收集,吞吐量与样本效率翻倍,性能领先。

04:00
arXiv cs.CL

面向LongEval-RAG的候选集约束检索增强生成:系统设计与实证分析

最优变体为规则分块加MiniLM句子重排序,增益来自稳定证据单元与神经选择结合。

04:00
arXiv cs.CL

CrossHallu:大型语言模型内部幻觉信号是否跨语言和领域泛化?

研究六种LLM内部表示,发现幻觉信号在大多数模型中跨语言和领域可转移,性能取决于特征空间中类可分性和语言对齐。

04:00
arXiv cs.CL

Telescope:通过测量令牌重复概率改进对LLM生成内容的零样本检测

利用LLM对令牌重复的先天厌恶,提出Telescope Perplexity指标,实现高效零样本检测,性能领先。

04:00
arXiv cs.CL

AI Wizards在EXIST 2026:用于模因中多模态性别歧视识别的分层软标签学习

提出分层条件软标签预测,采用轻量Gated MLP和KL散度训练,在EXIST 2026中获Task 2.3第一。

04:00
arXiv cs.CL

面向开放网络检索增强型大语言模型的风险约束时效感知语义缓存

FreshCache三级语义缓存通过风险约束时间推断,在24小时窗口以0.1%过期错误实现97%搜索API节省。

04:00
arXiv cs.CL

超越多语言平均:MTEB-PT——葡萄牙语句子编码器基准

MTEB-PT基准揭示葡萄牙语嵌入性能任务依赖,长上下文模型及语言微调可显著提升效果。

04:00
arXiv cs.CL

通过扰动实现基于感知的敏感性检测检索增强生成中的幻觉(GASP)

GASP通过测量答案对检索证据的敏感性检测幻觉,在RAGTruth上达AUC 0.73/0.67,无需训练即可超越基线。

04:00
arXiv cs.CL

可解释性设计:注意力机制与端到端Transformer

通过sigmoid使注意力值通道成为可读检测器,构建端到端可解释语言模型,前馈单元为命名集合操作。

04:00
arXiv cs.CL

CausalGame:在游戏中评估LLM智能体的因果推理能力基准

提出CausalGame基准,通过游戏测试LLM智能体因果思考,模型表现较差,最佳准确率仅68%。

04:00
arXiv cs.CL

变废为宝:事后重标记LLM智能体轨迹生成成功示范

HSL事后标记意外成功目标,优化LLM智能体,提升长程任务性能且样本高效。

04:00
arXiv cs.CL

WPG-MoE: 弱先验引导的密集混合专家模型用于用户级社交媒体抑郁检测

提出弱先验引导的MoE模型,利用用户语义先验路由专家,提升抑郁检测准确率。

04:00
arXiv cs.CL

记忆编排语义系统(MOSS):一种可审计的智能体记忆架构

MOSS是一种可审计的智能体记忆架构,基于关系数据库实现符号化检索,确保透明、模型无关并支持长期知识积累。

04:00
arXiv cs.CL

语义整合与词汇预期塑造自然阅读中的N400和P600动态

上下文语义相关性在N400和P600窗口解释脑电反应,超出词汇预期,表明自然阅读依赖语义整合和词汇预期。

04:00
arXiv cs.CL

UI-MOPD:面向持续GUI智能体学习的多平台在线策略蒸馏

提出UI-MOPD方法,利用多教师在线策略蒸馏实现跨平台GUI智能体持续学习,平衡旧平台能力保留与新平台适应,成功率分别达38.2%和12.0%。

04:00
arXiv cs.CL

大语言模型在Lean验证代数结构上的机制级路由失败

大模型在代数验证中机制级路由失败,暴露线索后准确率提升超10%,且真值推理与机制分类可分离。

04:00
arXiv cs.CL

勿单独承诺:扩散大语言模型中的联合令牌承诺

提出CoCommit方法,通过标记门控协调传递实现联合令牌承诺,减少因子化误差,提升推理和精确答案任务准确率。

04:00
arXiv cs.CL

dOPSD:扩散语言模型中的同策略自蒸馏

dOPSD通过模型自身去噪轨迹进行同策略自蒸馏,提升数学推理和代码生成能力。

04:00
arXiv cs.CL

evalci:用于语言模型评估统计严谨比较的Python库

evalci库对逐项结果表进行统计检验,输出置信区间和p值,揭示模型排名差异显著性。

04:00
arXiv cs.CL

埃菲克语的数字保存:面向低资源非洲语言的TTS

首次为尼日利亚埃菲克语构建TTS,比较四种模型,MMS-TTS最优但声调错误,需更大语料和声调建模。

04:00
arXiv cs.CL

具备可证明对齐保证的大语言模型不确定性感知弃权机制

CIC框架将不确定性分数转化为风险可控的选择性回答,在有限样本下保证错误率≤α并最大化回答率。

04:00
arXiv cs.CL

中文标题:移植、反转与预防错位人格:Qwen2.5中方法条件性的突现错位

中文摘要:Qwen2.5模型存在可移植的错位潜人格,低秩微调比全量微调更易诱发,正交微调可选择性预防。

04:00
arXiv cs.CL

从语言统计中学习核心概念区分的失败与成功

语言模型对统计频率敏感,但仅GPT-4能区分原则性与统计性属性,表明核心概念区分可从语言中学习。

04:00
arXiv cs.CL

语言模型以共享几何表示和变换概念

语言模型共享概念变换几何,位移方差具语义组织,结构可跨模型预测。

04:00
arXiv cs.CL

标题:时间维度的文章级可信度信号能否提升域名级可信度预测?

提出基于专家评级的时序框架,研究从文章内容自动评估新域名可信度的可行性。

04:00
arXiv cs.CL

EEG-SpikeAgent:用于自动化EEG尖峰检测的智能体闭环程序合成

基于LLM智能体迭代生成信号特征,实现EEG尖峰自动检测,AUC达0.935,兼具高准确度与可解释性。

04:00
arXiv cs.CL

ToolFailBench:诊断LLM代理工具使用故障的基准

提出诊断工具使用失败的基准,发现不同模型虽总分相近但失败模式迥异。

04:00
arXiv cs.CL

中文标题

通过分析Reddit青少年药物使用讨论,发现周末深夜高峰、负面情绪主导及具体语义主题,为预防干预提供依据。

04:00
arXiv cs.CL

文本保真度与多样性度量

基于最优传输散度提出文本保真度与多样性度量,可区分数据质量缺陷,并检测合成数据多样性不足对下游模型准确率的影响。

04:00
arXiv cs.CL

渐进式披露用于LLM维护的维基知识库:预注册消融研究

渐进式披露未节省索引加载,但通过精准访问降低成本,质量不降反升。

04:00
arXiv cs.CL

MTEB-PT: A Text Embedding Benchmark for Brazilian Portuguese

04:00
arXiv cs.CL

先错后对:对齐语言模型中的后期补救与接口失败

对齐模型存在内部先错后对机制:中间层暂时偏好错误,靠后期层纠正,该现象可预测压缩失败且可通过训练缓解。

04:00
arXiv cs.CL

回溯式思维链(RetroCoT):以法医重建提示作为跨代模型的安全诊断

RetroCoT攻击揭示模型对齐依赖语用框架而非语义,GPT-5虽能拒绝但易受对抗反馈绕过。

04:00
arXiv cs.CL

FormalRx:自动形式化中语义失败的修正与检查

提出FormalRx诊断框架,基于28类错误分类法,实现自动形式化错误判定、分类、定位与修正,性能优于基线。

04:00
arXiv cs.CL

所见即所得:面向图表到代码生成的观测对齐监督

提出观测对齐监督框架,替换图表代码生成中不可观测原始变量为视觉可约束量,提升可观测值恢复。

04:00
arXiv cs.CL

将离策略令牌转化为在策略令牌:一种提升大语言模型对齐的插件方法

提出选择性重要性采样,将离策略令牌转为在策略令牌,插件化减少方差,显著提升对齐鲁棒性。