10163 条条目 · 106 个活跃源
2026年6月30日
04:00
arXiv cs.CL

何必纠结连续潜在变量?通过渲染压缩实现可解释的离散潜在推理

提出离散潜在推理(DLR),将连续状态转为离散token,实现可解释高效推理,压缩20倍。

04:00
arXiv cs.CL

SEVA:面向事实归因的自我进化验证智能体(过程奖励)

提出SEVA结构化验证代理,用过程奖励解决RL训练优势崩溃,实现自我进化,在事实归因上媲美GPT-4o-mini且输出可审计。

04:00
arXiv cs.CL

本地部署开源大模型在Text-to-SQL上的表现如何?——基于BIRD的跨模型家族规模与技术的边界研究

本地开源LLM的Text-to-SQL:代际强于规模,自我纠错免费提效,模式链接无用,自一致性性价比低。

04:00
arXiv cs.CL

快数字,慢语言:连接定量与定性盈利信号

定量惊喜公告即释,定性情绪次日显现,EarningsInOne语料桥接两信号分析。

04:00
arXiv cs.CL

两阶段提示优化用于少样本关系抽取:从推理引导搜索到梯度引导精炼

提出推理与梯度优化结合的提示框架,在少样本关系抽取任务上取得领先性能。

04:00
arXiv cs.CL

人类是进化出的指令遵循者吗?一种潜在的归纳偏置使得快速指令任务学习成为可能

主张人类拥有进化形成的指令遵循偏置,能通过语言指令快速泛化行为,类似LLM零样本学习,是先天认知特征。

04:00
arXiv cs.CL

KbSD:面向智能体搜索中行为校准的知识边界感知自蒸馏

KbSD通过知识边界自蒸馏和象限自适应优化,提供密集监督,提升搜索准确率并缓解幻觉。

04:00
arXiv cs.CL

MATCH:通过上下文检索调制注意力以支持长上下文Transformer

MATCH框架将稀疏注意力与动态上下文检索结合,显著提升长距离任务性能且保持高效。

04:00
arXiv cs.CL

揭示自然语言处理的技术发展:一个以科学实体为中心的视角

本文从实体角度分析NLP技术趋势,发现预训练语言模型成主流,新技术涌现和接受速度加快。

04:00
arXiv cs.CL

Fund2Persona:基于基金披露数据构建与优化金融顾问画像的框架

提出Fund2Persona,利用基金披露数据构建并优化金融顾问画像,生成更具体有用的投资建议。

04:00
arXiv cs.CL

不用GPU能走多远?面向问答、对话与摘要的轻量级幻觉检测系统基准测试

轻量级幻觉检测在QA和对话任务中有效,但在摘要任务中接近随机,性能高度依赖任务。

04:00
arXiv cs.CL

SrDetection:一种用于代码大语言模型数据泄漏检测的自引用框架

提出自引用框架SrDetection,通过对比原样本与变体检测代码模型数据泄漏,F1显著提升。

04:00
arXiv cs.CL

平滑缩放定律隐藏逐步词元学习

缩放定律由词元学习时间分布主导,可据此优化训练加速11%损失下降。

04:00
arXiv cs.CL

中文标题:探索自然语言处理领域中算法提及的动机:一种深度学习方法

中文摘要:提出NLP论文中算法提及动机分类框架,发现使用动机占主导,改进最少,动机多样性增长,使用逐渐取代描述。

04:00
arXiv cs.CL

神经程序记忆:通过隐式激活引导赋能LLM智能体

NPM通过隐式激活引导,从历史经验中提炼技能向量,直接激活神经机制,无需训练即可引导任务,效果与显式指令相当

04:00
arXiv cs.CL

ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation

04:00
arXiv cs.CL

临床推理图:LLM诊断推理的结构化评估显示有胜任力但无一致性

LLM诊断准确率尚可,但推理图分析显示其缺乏跨病例一致性,胜任力与推理稳定性脱钩。

04:00
arXiv cs.CL

MemDelta:智能体记忆评估中的受控基线与隐藏混淆因素

MemDelta揭示记忆评估中嵌入模型等变量易混淆结论,自记忆不如检索,Mem0成本高50倍但仅局部等同云RAG。

04:00
arXiv cs.CL

IHDec: 基于散度引导的对比解码以保障多轮指令层级

提出IHDec无训练方法,用JSD检测并对比解码纠正多轮指令层级冲突,效果优于训练方法。

04:00
arXiv cs.CL

LatentRevise:从零命中推理中学习

LatentRevise方法利用失败轨迹优化推理前缀嵌入,引导模型自我反思,提升零命中场景下的数学推理能力。

04:00
arXiv cs.CL

我们是在衡量策略还是措辞?LLM数学推理中表面与方法层面多样性的鸿沟

引入方法层面多样性,揭示表面与方法层面的系统性偏离,目标导向真正多样的人类式推理。

04:00
arXiv cs.CL

Mamba的时间步长与人类阅读时间对齐

Mamba模型每词时间步长可显著预测人类阅读时间,且独立于GPT-2惊异度,为实时语言处理提供新视角。

04:00
arXiv cs.CL

LLM-as-a-Judge在代理场景中能否可靠验证评分标准?

引入RuVerBench评估LLM验证评分标准可靠性,发现先进模型虽强但噪声大,弱模型对提示更敏感,批处理有取舍。

04:00
arXiv cs.CL

走向对齐动力学的物理直觉:以随机性结晶为例的案例研究

用热力学相变理论解释语言模型对齐:分为高熵液态、成核和沉降三阶段,验证了结晶过程。

04:00
arXiv cs.CL

LLM智能体是潜在上下文管理者:通过本体感觉仪表盘激发自我管理上下文

提出VISTA,通过运行时仪表盘暴露上下文块状态,无需训练即显著提升长程工具智能体性能。

04:00
arXiv cs.CL

基于Token共现图的高效检索增强生成

提出TIGRAG,基于token共现图规避昂贵LLM管道,高效实现多跳推理,检索和问答优于现有方法。

04:00
arXiv cs.CL

Forewarned is Forearmed: When Non-Sequential Embedding Turns Into an Anomaly Detector

04:00
arXiv cs.CL

节点与邻域语义一致性:面向TAG异常检测的文本-拓扑对齐

提出N2NSC框架,解决文本属性图异常检测中节点与邻域的语义一致性问题,优于现有方法。

04:00
arXiv cs.CL

小模型,大成就:探索紧凑型语言模型

研究小型语言模型在RAG系统中的表现,无需GPU即可在设备上运行。

04:00
arXiv cs.CL

参数化技能

提出ParametricSkills,将文本技能转为LoRA参数,避免上下文依赖;在软件工程任务上平均提升6.44分,实现测试时持续学习。

04:00
arXiv cs.CL

非完全人类品味:LLM调查代理的程式化杂食性

LLM代理品味呈系统正向偏差、结构简化、文化对齐失真。

04:00
arXiv cs.CL

语言交流的信息动力学

提出信息论框架量化语义定向流动,分解多源贡献,实验验证信息流检测与对话质量区分。

04:00
arXiv cs.CL

在受控和自然语境下估计上下文嵌入中的语法性别方向

提出首个上下文嵌入语法性别解耦方法,构建平衡数据集与评估指标,发现未加权受控上下文最纯净,质心估计器最优。

04:00
arXiv cs.CL

CORTEX: 通过本体语料图谱实现网络规模语料库的高质量跨域组织

Cortex通过本体语料图谱将网络语料构建升级为结构化知识组织,支持高质量跨域关联与推理。

04:00
arXiv cs.CL

DAIN:基于动态智能体的交互网络实现高效协作多模态推理

DAIN动态多智能体协作框架,稀疏调度专家智能体,多项基准达SOTA,提升准确性确保可解释性。

04:00
arXiv cs.CL

人类与自动识别荷兰构音障碍连续言语的比较:案例研究

重度构音障碍语音识别对人类和ASR均极困难,微调后个性化模型优于人类,但仍有提升空间。

04:00
arXiv cs.CL

在思考之前,学会决策:主动路由以实现高效的视觉推理

PRP主动路由范式通过双模型能力评估实现早期路由决策,加速推理且不损性能。

04:00
arXiv cs.CL

CaresAI在CT-DEB26中:使用领域特定Transformer嵌入和分类模型检测临床试验剂量错误

本研究用BioBERT等Transformer嵌入临床试验文本,结合机器学习检测剂量错误,最佳ROC-AUC达0.853。

04:00
arXiv cs.CL

不完整图证据下的大语言模型推理基础

不完整图证据下,LLM推理无法同时拒绝假轨迹和保留真轨迹,软基础化通过KL正则化变形实现稳定推理。

04:00
arXiv cs.CL

利用开源大语言模型的多智能体系统以减轻虚假信息威胁

多智能体系统模仿人类标注,结合共识与多样性,优于GPT-4等,利用开源LLM实现多语言虚假信息检测。

04:00
arXiv cs.CL

字段顺序无关紧要:结构化元数据检索的置换不变嵌入模型微调

提出置换不变微调(PI-FT)消除字段顺序影响,在15语言基准上低成本提升检索性能,优于大模型。

04:00
arXiv cs.CL

REAR:通过奖励分解实现测试时偏好重对齐

提出REAR框架,通过奖励分解实现测试时偏好重对齐,高效可扩展,适用多种任务。

04:00
arXiv cs.CL

DialogPII:用于检测个人信息的合成对话转录多语言数据集

多语言合成对话数据集DialogPII覆盖11语言8场景,用于个人信息检测,附基线模型与验证。

04:00
arXiv cs.CL

MOPD:面向LLM后训练中能力集成的多教师在线策略蒸馏

MOPD通过多教师在线策略蒸馏集成多种能力,消除暴露偏差,优于混合RL等方法,并支持并行开发。

04:00
arXiv cs.CL

OLIVE:面向语音自监督学习的视图增强潜在预测与波形重建

OLIVE联合优化分析与合成,通过视图增强预测与波形重建,提升生成与说话人任务,保持识别语义性能并改善重建。

04:00
arXiv cs.CL

SIMAX:一种可扩展且可解释的多保真度带注释医患对话模拟框架

SIMAX框架生成带标注的模拟医患对话,评估显示自然度和保真度良好,支持通信编码系统开发验证。

04:00
arXiv cs.CL

M3 QuestionIng:多模态多跨度医学问答

提出M3QAFrame多模态多跨度医学问答框架,融合文本图像,生成含图像答案,性能优于现有方法。

04:00
arXiv cs.CL

TRACE:双人语音中基于时间关系的对话情感同步检测

提出TRACE框架与DyadEE数据集,利用时间关系感知与情感微调Whisper特征,情感同步检测准确率达97.01%。

04:00
arXiv cs.CL

不确定性感知的生成与模糊情境下的决策

提出基于贝叶斯理论和风险厌恶的不确定性感知决策算法,用于辅导和评审,实验表明贝叶斯方法更优,高模糊性需谨慎实施。

04:00
arXiv cs.CL

面向异质知识冲突下鲁棒RAG的状态感知同伴专业化

RAPS-DA状态感知同伴专业化框架,通过样本三状态分工与token双重选择器,提升RAG异质冲突鲁棒性,无需标签即超越基线。