10203 条条目 · 106 个活跃源
2026年6月23日
04:00
arXiv cs.CL

使用大型语言模型的特定领域本体构建

实验用GPT-3.5/4构建巴西海域本体,专家评估模型概念连贯但需完善。

04:00
arXiv cs.CL

更少即更多:面向边缘设备问答应用的轻量级提示压缩

提出CORE两阶段句子级提示压缩,无需小语言模型,边缘设备上准确率提升30%以上,内存减少50%,能耗降低95%。

04:00
arXiv cs.CL

超越“一种语言一种文字”:用PuMVR量化多语言VLM中的正字法偏见

PuMVR基准揭示多语言VLM因文字不同性能差异达16%,视觉输入无法消除偏见,需用SCR指标评估公平性。

04:00
arXiv cs.CL

后训练配方(而非模型家族)塑造多智能体LLM的对话行为

后训练配方比模型家族更显著影响多LLM对话行为多样性,同一基座的不同版本协作时差异更大。

04:00
arXiv cs.CL

探究语言引导:大型语言模型架构中形容词效应的分析

Shapley值揭示形容词引导效应因模型家族和句法位置而异,大模型存在非加性交互,增加对齐难度。

04:00
arXiv cs.CL

EmoInstruct-TTS:双路径指令引导的情感语音合成

通过48种情感状态嵌入和ICE-Flow模型,实现指令引导的精细情感控制,提升语音自然度。

04:00
arXiv cs.CL

VeriBound:使用形式化验证工具训练的过程奖励模型的PAC-Bayesian泛化界

提出VeriBound框架,为形式化验证训练的PRM提供PAC-Bayesian泛化界、样本复杂度、收敛率及Best-of-K性能退化上界。

04:00
arXiv cs.CL

从情感到可行洞察:先进空中交通的数据驱动公众情感分析

分析30万条文本,评估情感模型,发现六大公众关切集群,提供提升接受度的策略。

04:00
arXiv cs.CL

MindAlign:有限数据下通过多模态嵌入对齐从fMRI信号解码内心言语

提出MindAlign两阶段框架,神经语义对齐后结合冻结多模态模型从fMRI解码内心言语,优于基线且跨主体泛化。

04:00
arXiv cs.CL

FirstPass:用多轮编辑结果夯实AI科学判断

FirstPass数据集与模型基于多轮评审对话训练,实现80.5%的编辑预测准确率,生成近人类评论,可作为科学协作者。

04:00
arXiv cs.CL

Peeking Inside LLMs: Leveraging Internal Artifacts of LLMs for Enhancing Reliability in Legal Classification

04:00
arXiv cs.CL

音素救援:基于国际音标的多语言分词

提出基于国际音标的多语言分词方法,平衡字符分布,提升分词质量,尤其对非拉丁文字,并泛化到未见语言。

04:00
arXiv cs.CL

潜在个人记忆:将个人记忆表示为动态软提示

LPM以潜在槽矩阵编码个人记忆为动态软提示,性能提升高达54.4%,KV-cache减少64倍。

04:00
arXiv cs.CL

面向3D视觉定位的多样化语言生成扩展

提出ViGiL3D++方法,用场景图约束和LLM生成多样化查询,提升3D视觉定位性能并揭示VLM局限。

04:00
arXiv cs.CL

Comparing Transformers and Hybrid Models at the Token Level

04:00
arXiv cs.CL

通过约束证据选择实现话题与时间戳对齐

将时间预测转为候选选择,在会议记录查询中召回率从31.9%提至50.0%,误差减少,可解析输出大幅提升。

04:00
arXiv cs.CL

SciLens:基于代理蕴含与证据锚定的多模态科学主张验证

SciLens将科学主张分解为原子并锚定多模态证据,通过代理式蕴含验证提升证据敏感性和可解释性,F1达79.2%。

04:00
arXiv cs.CL

学会什么不该忘:千字节级学习实现长期智能体记忆

LRE方法仅需数KB学习,无需语言模型,通过识别关键历史单元实施驱逐,在长期任务中准确率媲美全历史保留,降低52%峰值上下文成本。

04:00
arXiv cs.CL

故事线树:长篇叙事的分层表示

故事线树分层组织长篇叙事,通过上下结合推导多级情节,在问答中适应性检索超越基线。

04:00
arXiv cs.CL

PeerCheck:提升LLM生成学术评审质量至人类水平

提出PeerCheck框架,发现LLM偏理论而人类重方法;CoT有效提升质量,但RAG存在悖论。

04:00
arXiv cs.CL

FiLM协调的双分支Transformer用于语言建模中的全局-局部依赖建模

提出FiLM协调双分支Transformer,通过特征线性调制动态协调全局与局部分支,在语言建模中效果更优。

04:00
arXiv cs.CL

高风险推理的多智能体审计框架:临床心理健康筛查中的评估与可解释性

提出多智能体审计框架,通过多步验证降低误差并提升可解释性,在心理健康筛查中优于单模型。

04:00
arXiv cs.CL

可扩展分层注意力Transformer用于长对话中的多轮越狱检测

提出层次化检测器,将多轮越狱检测作为对话级分类,避免长上下文拼接,F1达0.9394,超Claude Opus,误报率减半。

04:00
arXiv cs.CL

通过基于LLM的概念化实现事件本体扩展

ConceptE框架利用LLM从触发词提取概念语义,增强表示,提升事件聚类与层次扩展性能,最高改进12.37%。

04:00
arXiv cs.CL

基于验证门控的LLM自杀检测机制解释

验证门控框架揭示LLM自杀检测的中网络特征具有因果性、低秩性,仅在大模型中有效,但限于英文Reddit文本。

04:00
arXiv cs.CL

中文标题:Metanym游戏:一种自包含、自一致的LLM同行社区结构智能基准测试

中文摘要:通过LLM互评单词游戏,无固定测试集,用奇异值分解评估事实准确性,与GPQA高度相关,揭示评判能力比生成能力更稀缺。

04:00
arXiv cs.CL

LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations

04:00
arXiv cs.CL

GRAG:面向个性化对话系统的通用响应增强生成框架

GRAG解耦内容基础与个性化,利用通用LLM响应引导小模型微调,在资源受限场景下ROUGE-2提升47%、BLEU提升36%。

04:00
arXiv cs.CL

多标签情感标注中的质量与一致性:案例研究与评估框架

研究发现软标签投票和概率评估更能反映标注者差异,硬标签可能掩盖结构化的不一致性。

04:00
arXiv cs.CL

基于DistilBERT的自动作文评分中人口统计元数据作为构念无关噪声

将人口统计元数据与文本朴素拼接会降低DistilBERT AES模型预测准确性并增加评分偏差,是构念无关噪声。

04:00
arXiv cs.CL

When Context Misleads: Surprisal, Energy and Attention Entropy as Metrics of Coherence Illusions in LLMs

04:00
arXiv cs.CL

Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs

04:00
arXiv cs.CL

AdaMem: 学习为个性化长期LLM代理记住什么

AdaMem通过角色相关记忆策略与反馈学习,在缩减记忆体积9%的同时提升问答准确率最高9%。

04:00
arXiv cs.CL

SCOPE:用于LLM服务中可靠OOD拒绝的序列共形探测

SCOPE框架选择可读隐藏层,结合共形门与超鞅e过程,提升LLM服务中OOD拒绝可靠性。

04:00
arXiv cs.CL

OpenWER:改进跨语言语音识别评估并实现基于词元的准确率度量

OpenWER通过语言标准化和复合词检测降低WER达25%,促进跨语言ASR评估公平性。

04:00
arXiv cs.CL

用于空中交通管制语音识别的合成音频生成框架

提出合成音频生成框架,融合多种语音转换技术,解决ATC语音识别中数据短缺问题,显著提升准确率。

04:00
arXiv cs.CL

中文标题:LLM中的事实检索是一个冗余、分布式且非连续的过程

中文摘要:LLM事实检索路径非连续且冗余,存在多条等效路径,计算高度分布,挑战现有知识编辑理解。

04:00
arXiv cs.CL

痴呆症代理:一种用于痴呆症分期和表型分型的多模态多代理系统

提出临床对齐的多代理框架Dementia-Agents,在真实临床队列中优于现有方法,实现痴呆症分期与表型分型。

04:00
arXiv cs.CL

谁检查引用?法律幻觉检测基准测试

评估AI检测法律虚构引用,GPT-5召回82.8%但难识细微错误,成本与信息访问不平等成挑战。

04:00
arXiv cs.CL

超越挂钩于世界:指称轮廓与LLM基础化的数值结构

本文提出大语言模型的指称是轮廓化、数值化的,通过优化参数化人类语言痕迹,实现衍生指称。

04:00
arXiv cs.CL

CAT-Translate:构建日英翻译的紧凑型开源模型

开发小型日英翻译模型,在真实场景中超越多语言大模型,验证了专用翻译模型的价值。

04:00
arXiv cs.CL

针对AI可见性的每实体偏差映射:为什么品牌提及需要实体特定的校准

提出每实体偏差映射框架,发现品牌幻觉悖论:大品牌虚假引用更高,监管语境加剧虚构。

04:00
arXiv cs.CL

面向数学错误纠正的教学对齐LLM导师

基于偏好的教学对齐(SFT+DPO)提升LLM数学纠错的事实准确性与教学效果,接近专有基线,但评估可靠性仍存挑战。

04:00
arXiv cs.CL

小型语言模型在阿拉伯语处理中的评估

评估12个小型语言模型在阿拉伯语任务表现,Gemma 3(12B)最佳,模型大小非唯一因素,对齐和指令遵循更关键。

04:00
arXiv cs.CL

通过混合自然语言和临床奖励学习实现精确召回可控的放射学报告生成

提出强化学习框架,以控制参数调节临床精确率与召回率,引入临床奖励和组相对训练提升报告生成效果。

04:00
arXiv cs.CL

解析Agentic RAG:基于本地7B模型的多跳问答组件消融研究

全管道消融表明固定混合检索与短循环优于自适应设计,简单选择显著提升多跳问答性能。

04:00
arXiv cs.CL

MedHal-Loc:“架构可解释”的医疗幻觉检测器是忠实定位器吗?一个定位基准

检测能力不代表忠实定位;KG三元组流水线定位仅比随机好3.3%,受限于实体抽取覆盖率。

04:00
arXiv cs.CL

PeerMathDial:面向学生协作数学问题解决的中学对话数据集

首个中学数学同伴协作对话数据集,含55对话6406轮,构建行为分类,分析互动与干预,评估LLM潜力。