10073 条条目 · 106 个活跃源
2026年7月17日
04:00
arXiv cs.CL

基于主题与参与者中心分解的对话摘要情感动态

提出对话摘要框架,从主题与参与者双视角分解,显式建模语义与情感动态,引入情感轨迹评估指标。

04:00
arXiv cs.CL

CoTu在EXACT 2026:面向透明教育问答的神经符号推理

神经符号推理系统以4B模型编程求解,在EXACT 2026物理任务获满分、技术分最高,实现小模型透明可解释问答。

04:00
arXiv cs.CL

量规考验:基于合成成对证据从单次查询演化量规

提出无标注的查询量规演化框架,利用合成成对证据自动筛选有效量规,在偏好基准上表现最优。

04:00
arXiv cs.CL

Grokipedia vs Wikipedia:基于LLM的意识形态政治中立性审计

所有LLM评委认为Grokipedia中立性低于维基百科,两者对政客的偏向因意识形态而异。

04:00
arXiv cs.CL

神经语言模型中语法性的线性表征

本文通过内部表征探测发现,神经语言模型能线性编码语法性,且独立于其他因素,跨语言泛化。

04:00
arXiv cs.CL

SciDiagramEdit: 从论文修订中学习编辑科学图表

提出 SciDiagramEdit 框架,从论文版本历史中学习编辑科学图表,通过技能进化提升编辑准确性。

04:00
arXiv cs.CL

T^2MLR:具有时间中间层循环的Transformer

T^2MLR通过缓存前token中间层表示并注入当前层,实现持久推理,仅需局部中间层循环即可超越全层,改造预训练模型显著提升数学推理。

04:00
arXiv cs.CL

面向扩散语言模型的掩码感知策略梯度

提出掩码感知策略梯度,将生成分解为两阶段MDP,结合token与掩码项优化,在GSM8K和MBPP上达SOTA。

04:00
arXiv cs.CL

中文标题:扩展基于吉兹字母的非洲语言词汇:阿姆哈拉语和提格利尼亚语的比较研究

中文摘要:通过词汇扩展和两阶段训练,VEXMLM在低资源格兹字母语言上显著提升性能,并泛化到17种其他非洲语言。

04:00
arXiv cs.CL

预训练大语言模型的原地分词器扩展

通过继续BPE合并和两阶段适应扩展分词器,减少新增语言token数,实现2-4倍解码加速。

04:00
arXiv cs.CL

通过成分数据分析的语言识别:基于对数比几何的线性时间分类器

基于成分数据与CLR变换,结合拉普拉斯平滑实现线性时间语言识别,长文本准确率高且计算高效低耗。

04:00
arXiv cs.CL

TikStance:面向TikTok政治对话中多目标立场分析的多模态层次化数据集

提出TikStance数据集,含161视频及评论,多模态层次化,覆盖2024美大选三人,标注一致性高。

04:00
arXiv cs.CL

超越排行榜:可信多模态视觉问答的设计经验

医疗多模态VQA需可靠可解释,结构化推理更可靠,建议改进评估、解释和鲁棒性检查。

04:00
arXiv cs.CL

可解释语言模型用于闭环1型糖尿病控制

本文提出LLM-T1D,融合强化学习与大语言模型,实现透明可靠的胰岛素泵控制,在模拟器中达73.5%时间在目标范围且防幻觉。

04:00
arXiv cs.CL

对话式视觉地点识别

提出对话式地点识别新范式,将定位转为交互推理,构建大型基准及DQ-pilot框架,经课程学习显著超越基线。

04:00
arXiv cs.CL

划分、提示、聚合:语言模型中的统计自洽性

通过二叉树划分和聚合测试,发现语言模型广泛违反概率自洽性,细粒度提示比直接估计更准确,揭示知识聚合缺陷。

04:00
arXiv cs.CL

多智能体AI与MCP服务器协同下的电网研究编排

MCP接口使AI代理能标准化调用仿真工具,实现人机协同的电网研究编排,提升交互性与可审计性。

04:00
arXiv cs.CL

MemoHarness:从经验中学习的智能体控制层

MemoHarness通过分解六个控制维度并存储执行经验,无需测试标签即可自适应优化,在多项任务上优于固定框架。

04:00
arXiv cs.CL

MEMORA:源自第一人称视频的具身动作记忆,用于推理与规划

提出具身动作记忆EAM,通过在线编辑与离线整合实现持久记忆,在45小时视频数据上规划准确率提升20.5%,得分提升16.6%。

04:00
arXiv cs.CL

RetroAgent:利用大语言模型在结构化记忆中进行智能逆合成规划搜索

RetroAgent结合符号搜索与神经推理,通过结构化记忆观察全局搜索状态,基于全局进展和领域知识决策,性能与泛化能力强。

04:00
arXiv cs.CL

Instrument Effects in Language-Model Honesty Evaluation: An Auditable Single-System Demonstration

04:00
arXiv cs.CL

测量学生在学术写作中对生成式AI的依赖程度:生成式AI依赖类型量表(GenAI-RTS)的开发与多源验证

开发验证20题GenAI依赖类型量表,测战略、工具、依赖、对话四类型,信效度好,跨群体不变。

04:00
arXiv cs.CL

制造分歧:解析七个社交媒体影响力操作中的敌对内容

国家支持的影响力操作中"仇恨"被高估两倍,仅18.7%为身份仇恨,其余属党派或地缘政治谩骂,应定义为"制造分歧"。

04:00
arXiv cs.CL

利用指令微调与模型合并优化推理模型适应

通过指令微调与原始模型合并,低成本提升推理模型在可验证及难验证领域的性能。

04:00
arXiv cs.CL

停止思考,开始观察:通过无推理对齐实现多模态文档问答的高效后训练

提出无推理对齐训练框架,直接优化视觉特征,减少推理token超60%,性能优于推理强化学习。

04:00
arXiv cs.CL

WrAFT:一个模块化的议论文自动写作评估系统

WrAFT模块化系统实现议论文精准评分(QWK 0.84)和高度认可的反馈(赞同率超93%)。

04:00
arXiv cs.CL

多智能体辩论能改善研究论文的AI反馈吗?

实验表明单次AI报告比多智能体辩论更受作者欢迎,后者效果不佳。

04:00
arXiv cs.CL

能量社会:一个在生存压力下研究智能体合作的模拟环境

能量社会通过能量生存机制模拟LLM智能体竞争与合作,合作促进捐赠,竞争出现自私。

04:00
arXiv cs.CL

生成式AI是否超越了有监督的XMLC?——基于德语科学文献自动主题标引的基准研究

有监督XMLC整体指标最佳,但LLM生成方法在长尾和分级相关性上更优,更具潜力。

04:00
arXiv cs.CL

Penny:支架式英语写作中学习者与聊天机器人互动的转换网络分析

研究揭示两种互动循环:高水平学习者倾向对话,低水平依赖纠错,AI写作呈非线性对话特征。

04:00
arXiv cs.CL

公共记录中的Qubes OS安全性

Qubes OS安全公告分析:79.8%漏洞来自上游组件,披露率自2015年后持平,上游依赖长期存在。

04:00
arXiv cs.CL

记忆驱动的自我表露与关系转折点:人与AI交互的纵向多模态研究

人机关系通过缓慢积累与突然转折构建:对话质量影响即时享受,感知记忆经自我表露间接影响后续,转折点可行为检测。

04:00
arXiv cs.CL

多模态大语言模型的科学可视化素养基准测试

评估六种多模态大模型在科学可视化素养测试中的表现,Gemini最佳但整体不均,弱于纹理、集成可视化及定量估计。

04:00
arXiv cs.CL

同策略Delta蒸馏

提出基于教师模型与基础模型差异的delta信号作为新蒸馏奖励,更直接转移推理能力,显著提升同策略蒸馏性能。

04:00
arXiv cs.CL

步骤标记:通过步骤监控控制语言推理模型生成

提出Step-Tagging框架,实时标注推理步骤实现可解释早期停止,减少20-50%token且保持精度

04:00
arXiv cs.CL

用于鲁棒即插即用适配的解耦对齐

提出无需训练的即插即用对齐方法,通过知识蒸馏纠正阴影对齐,防御成功率提升14.42%。

04:00
arXiv cs.CL

桥梁证据:静态检索效用无法预测多步骤智能体搜索中的因果效用

智能体检索中静态相关性与因果有用性不相关,约三分之一的“桥梁文档”虽静态无用却支撑搜索转向。

04:00
arXiv cs.CL

预训练数据可能通过计算宣传被投毒

公共讨论接口可投毒大规模预训练数据,HalfLife分析可估计对抗性内容包含程度。

04:00
arXiv cs.CL

言语化采样:如何缓解模式崩塌并释放大语言模型多样性

发现偏好数据典型性偏差导致模式崩塌,提出言语化采样策略,无需训练即可显著提升模型多样性与创作质量。

04:00
arXiv cs.CL

PERL:拼音增强的改写语言模型,用于中文ASR N-best纠错

PERL通过长度约束与拼音语义门控融合,在中文ASR纠错中大幅降低字错误率(Aishell-1降29%,DoAD降约70%),且保持低延迟。

04:00
arXiv cs.CL

Idea2Plan:探索AI驱动的研究规划

研究LLM从研究想法到研究规划的转化能力,构建Idea2Plan基准,GPT-5表现最佳但仍需改进。

04:00
arXiv cs.CL

MedFailBench:临床医生构建的开源医学AI安全边界检查基准

MedFailBench通过严重性分级与安全门分类,标注医学AI错误以检测安全边界失败。

04:00
arXiv cs.CL

WavePhaseNet:基于DFT的语义概念层次结构构建方法

用DFT分解语义,降维至3000维并引入上同调正则,抑制幻觉保持语义一致。

04:00
arXiv cs.CL

通过变点检测分割人类与LLM合著文本

通过变点检测算法分割人类与LLM合著文本,实现段落级定位并证明最优性。

04:00
arXiv cs.CL

L-MARS: 具有智能搜索和引文忠实性审计的法律多智能体系统

提出L-MARS系统,通过多轮法官审计将法律问答引文F1从0.13提至0.25,无引文率从34%降至13%。

04:00
arXiv cs.CL

中文标题:工具幻觉:重新思考网络代理中的工具使用

中文摘要:通过大规模对照实验重新审视网络代理中工具使用的效果与设计原则,修正并补充了先前结论。

04:00
arXiv cs.CL

用于AI安全评估的对抗性语用学:指令冲突、嵌入命令和策略模糊性的基准

提出对抗性语用学基准,评估模型在模糊指令、嵌入命令等场景下的行为,发现评估器易漏判安全相关类别。

04:00
arXiv cs.CL

The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues

04:00
arXiv cs.CL

大型语言模型对人类口语交流影响的经验证据

实证表明,ChatGPT偏好词汇涌入人类自发口语,AI正反哺并重塑语言文化进化。

04:00
arXiv cs.CL

超越趣味性:面向可视化数据分析的语义与上下文感知自然语言查询推荐

融合语义、趣味性与上下文,推荐更相关连贯的查询序列,提升洞察生成与决策支持。