10213 条条目 · 106 个活跃源
2026年6月19日
04:00
arXiv cs.CL

情感分析之盲区:基于7万次客服对话衡量客户是否获助及问题根源

GPT-5.4满意度估计比情感分析更准(相关性0.47 vs 0.36),发现44%对话语气与满意度不一致,揭示“容忍摩擦”等隐藏问题。

04:00
arXiv cs.CL

超越均匀遗忘:跨偏好设置的顺序直接偏好优化研究

顺序DPO的遗忘模式非均匀,取决于目标关系、信号强度和训练顺序。

04:00
arXiv cs.CL

AtomMem:通过原子事实构建LLM智能体的简单有效记忆系统

AtomMem通过提取原子事实并分层组织,实现高效稳定记忆,在推理任务中取得最优性能。

04:00
arXiv cs.CL

杠杆非可达:语言模型中单神经元调控的控制窗口定律

提出单神经元调控的预算归一化控制窗口定律,相干控制存在于触发点低于可预测的崩溃上限且控制具类型性。

04:00
arXiv cs.CL

提示、规划、提取:用于临床叙述中肺病理信息提取的零样本智能大语言模型工作流

零样本智能LLM从肺病理报告提取信息,最佳模型F1达0.893、召回0.949,低成本有效。

04:00
arXiv cs.CL

基于源数据的文本到JSON学习数据生成

提出STAGE方法,利用电子表格驱动LLM生成文本到JSON训练数据,精确匹配率达74.27%,值准确率90.69%。

04:00
arXiv cs.CL

近乎智能的革命:用人工智能扩大协商规模并赋能人们的选择

探讨LLM如何扩展民主协商、赋能边缘群体,同时警惕语言偏见,避免期望过高或过低,需嵌入伦理保障。

04:00
arXiv cs.CL

大型语言模型并不总是需要可读语言

LLM可将语义编码为紧凑非标准文本,牺牲可读性但保持99.5%语义保真度,文本压缩至27.9%,减少上下文开销。

04:00
arXiv cs.CL

REDACT:一个系统控制的多语言个人信息检测基准

REDACT基准含13,427条记录、51种实体类型,评估发现规则检测器在高敏感数据上召回率低,LLM更鲁棒。

04:00
arXiv cs.CL

基于离散语音令牌意外度的轻量级发音评估

提出仅用母语音频的轻量框架,融合令牌意外度与对齐特征,发音评估性能接近有监督方法。

04:00
arXiv cs.CL

GEMS:几何约束实现大语言模型的多语义叠加

GEMS通过范数保持、正交化等几何约束实现多语义方向同时注入,GSM8K准确率98%,PPL仅增2.2%。

04:00
arXiv cs.CL

CREDENCE:面向分解的声明约简与可信度增强——语义度量与收敛性分析

提出Semantic-F1度量替代Jaccard,解决分解质量低估;给出修复管道收敛定理,构建三个领域评估基准。

04:00
arXiv cs.CL

IHUBERT:基于向量的语义去重与领域平衡的波斯语资源预训练

IHUBERT是波斯语预训练模型,采用语义去重和领域平衡,在45GB语料上训练,在抽取式问答等NLU任务中领先。

04:00
arXiv cs.CL

从文本到分数:追踪大型语言模型中作文质量表征的出现

研究发现LLM内部线性编码作文质量,跨层渐现且存在评分神经元,其分布随长度变化。

04:00
arXiv cs.CL

可操作的激活方向:检测与缓解跨语言模型家族的新兴失调

模型内激活方向可99.6%分离失调,干预减少代码泄露,跨模型方向非特异,建议模型内探测。

04:00
arXiv cs.CL

MedRLM:递归多模态健康智能,用于长上下文临床推理、传感器引导筛查、基于证据的决策支持及社区到三级转诊优化

MedRLM递归处理多模态临床数据,通过证据图记忆和传感器触发机制,实现可审计的长上下文推理与转诊支持。

04:00
arXiv cs.CL

爵士领谱、独奏转录、古典钢琴与单声部乐谱的音高拼写

提出两阶段优化算法,从MIDI输入估计音符名称、调号和局部音阶,适用于爵士、古典等多种乐谱,用于音乐转录与分析。

04:00
arXiv cs.CL

ReNikud: 音频监督的希伯来语字素到音素转换

ReNikud利用音频伪标签和伪元音架构实现希伯来语字素到音素转换,性能超越现有最优方法。

04:00
arXiv cs.CL

CzechDocs:面向捷克少数民族语言的多路并行格式化文档数据集

包含捷克及少数民族语言格式化文档的多路并行数据集,用于评估保留格式的机器翻译,已公开验证集与评估工具。

04:00
arXiv cs.CL

可验证指令遵循修订中自我偏好微弱或缺失:真实作者身份下的四模型测试

四模型测试显示,模型自我偏好微弱或缺失,拒绝有效修正率与新鲜模型无显著差异,且97%的拒绝原因系发现缺陷。

04:00
arXiv cs.CL

流式工具使用何时有用?——流式检索增强生成中工具意图稳定性的特征描述

流式RAG中73.9%查询可隐藏工具延迟,工具意图稳定性取决于查询属性与输入节奏。

04:00
arXiv cs.CL

HydraHead:从注意力头功能异质性到专业化注意力混合

HydraHead通过头级混合全注意力和线性注意力,可解释性选择关键头并缩放归一化融合,仅15B训练即实现512K长上下文性能提升69%。

04:00
arXiv cs.CL

语域差距:尼日利亚公共话语的意义智能框架

提出MIF框架,揭示语域差距:加模式后准确率从33.3%升至73.3%,意义智能评分提升5.4分。

04:00
arXiv cs.CL

超越全局重规划:跨设备代理系统的分层恢复

提出H-RePlan分层重规划框架,区分设备本地与全局恢复,在跨设备基准上显著提升成功率并降低成本。

04:00
arXiv cs.CL

弥合语义缓存中的校准差距

语义缓存评估应从排名转向校准,PR-AUC具误导性,新指标P-CHR AUC与CRR揭示校准差距由训练目标决定。

04:00
arXiv cs.CL

LLM招聘决策中的性别偏见:来自日本背景的证据及缓解策略评估

日语简历中LLM存在反女性偏见,移除姓名可消除,但提示指令无效,隐私过滤与GPT-4o不兼容。

04:00
arXiv cs.CL

风格化偏见:多模态大语言模型中少数视觉线索主导社会偏见

通过控制单一视觉属性变化,发现年龄、体型及时尚风格等少数线索驱动多数社会偏见,约15种属性解释80%变异。

04:00
arXiv cs.CL

基于RAG的聊天机器人中针对提示注入的分层安全框架

提出三层安全框架,将提示注入攻击成功率从71.4%降至11.3%,误报率4.8%,延迟61.2ms。

04:00
arXiv cs.CL

CATCH-ME if you RAG: a dataset of Contextually Annotated multi-Turn Counterspeech against Hate and Misinformation Exchanges

04:00
arXiv cs.CL

超越GUI范式:移动智能体是否需要手机屏幕?

移动智能体使用CLI比GUI更高效,Claude Code达71.8%/51.9%,CLI-Advantage套件全面优于GUI。

04:00
arXiv cs.CL

你的鼠标和眼睛偷偷泄露了你的偏好:利用用户隐式反馈对齐大语言模型

隐式反馈(鼠标眼动)提升LLM对齐,IFLLM数据集使准确率从55%升至64%,DPO后响应质量提升三倍。

04:00
arXiv cs.CL

PsyScore:心理测量学感知的特质自适应作文评分与ZPD支架式反馈框架

整合心理测量与支架教学,实现特质自适应评分及最近发展区反馈,提升评估可靠性与教学对齐。

04:00
arXiv cs.CL

JAMER:面向专业游戏引擎的项目级代码框架数据集与基准

提出首个专业游戏引擎项目级代码框架数据集/基准,发现代码能力随规模急剧下降,架构设计是瓶颈。

04:00
arXiv cs.CL

当低级权限足够时:探究LLM代理中的过度权限工具选择

研究揭示LLM代理常过度选择高权限工具,临时故障加剧该问题,提出权限感知后训练可有效减少不必要的高权限使用。

04:00
arXiv cs.CL

面向Token操作的大模型推理优化技术

首提四层架构(多模型融合、模型优化、计算-模型融合、计算-网络-模型融合),系统梳理关键技术与产业现状,为降低Token成本提升效率与稳定性提供路径。

04:00
arXiv cs.CL

通过声学和韵律扰动研究语音质量评估中人类与模型的差异

模型能追踪声学退化,但对韵律错误不敏感;与人类在音高、语速感知上存在双分离。

04:00
arXiv cs.CL

基于段级普通话语音与对比学习自编码器的认知障碍检测

提出段级语音表示学习框架,结合自编码器与对比学习,在四个中文数据集上实现稳定的认知障碍检测,尤其在三分类任务中表现突出。

04:00
arXiv cs.CL

连接点:通过强化学习训练大语言模型实现跨域泛化的长生命周期智能体

提出CoD框架,通过端到端强化学习训练LLM的长生命周期智能体元能力,实现跨域泛化。

04:00
arXiv cs.CL

潜在思维链中有效监督的关键:一项信息论分析

信息论分析揭示潜在思维链监督失败为双重崩溃,提出轨迹与空间监督,引入ULP证明互信息最大化优于几何模仿。

04:00
arXiv cs.CL

PASQA: 以音高重音为中心的语音质量评估模型,使用带重音错误的合成语音训练

提出PASQA模型,针对音高重音正确性,利用合成重音错误数据训练,实现高排序精度并与人类判断一致。

04:00
arXiv cs.CL

生成式引擎大规模优化:衡量AI搜索中的品牌可见性

品牌可见性分三级,企业网站占78%来源,列表类内容占21%引用,情绪波动剧烈,提出七项测量协议。

04:00
arXiv cs.CL

DeFrame:针对框架效应的大型语言模型去偏方法

提出框架感知去偏方法,减少大型语言模型因语义等价表达差异导致的不公平响应,提升公平性和一致性。

04:00
arXiv cs.CL

放射学中空间接地2D视觉语言模型的可扩展训练

提出无需手动标注的放射学空间接地VLM训练方法,构建120万对CT/MR数据集,模型联合报告生成、VQA和定位且不损语言质量。

04:00
arXiv cs.CL

从构建到注入:面向大型语言模型的基于编辑的指纹技术

提出端到端注入指纹框架,通过代码混合和多候选编辑实现鲁棒所有权验证。

04:00
arXiv cs.CL

ShoppingBench:面向基于LLM的智能体的真实世界意图驱动购物基准

ShoppingBench涵盖复杂购物意图,GPT-4.1成功率不足50%,轨迹蒸馏使小模型性能媲美。

04:00
arXiv cs.CL

Med-R2:面向医学报告生成的感知与反思驱动的复杂推理

Med-R2引入感知推理、放射学知识指导与反思机制,增强病理特征感知与诊断准确性。

04:00
arXiv cs.CL

TransLaw:模拟香港判例法专业翻译的大规模数据集与多智能体基准

构建首个香港判例法句对齐语料库,提出TransLaw多智能体翻译框架,显著提升质量,但仍逊于人类专家。

04:00
arXiv cs.CL

Toward Human-Centered AI-Assisted Terminology Work

04:00
arXiv cs.CL

MENTOR:通过灵活教师优化奖励进行工具使用蒸馏的强化学习

MENTOR提出灵活过程感知奖励,平衡行为对齐与性能,提升小模型工具使用OOD泛化能力。

04:00
arXiv cs.CL

改善人类与机器编码之间的一致性:心理学中构念识别的提示工程经验性评估

评估五种提示策略,发现构念定义和任务框架最关键,结合代码本引导与自动工程的少样本提示最符专家判断。