9701 条条目 · 106 个活跃源
2026年9月23日
04:00
arXiv cs.CL

在 Rust 中端到端训练语言模型:一份经验报告

纯Rust预训练语言模型:暴露Candle/Burn训练缺陷,结论是Rust宜推理不宜训练。

04:00
arXiv cs.CL

99%准确率衡量了什么?对广泛使用假新闻语料库中捷径学习的可复现审计

假新闻语料库的超高准确率主要来自元数据、来源标签和重复等泄漏及文体捷径,而非真实性;跨主题迁移时性能显著下降。

04:00
arXiv cs.CL

通过动态语义路由校准缓解大语言模型过度拒绝

提出免训练的动态语义路由校准,抑制过敏安全头并融合双分支解码,缓解大模型过度拒绝且保留安全性。

04:00
arXiv cs.CL

从语调到轨迹:连续情感与货币政策沟通的形态

央行记者会情感弧线的形状能稳健预测利率决策,并影响通胀预期与预测分歧,说明沟通设计是一阶政策信号。

04:00
arXiv cs.CL

相同数量,不同答案:语言模型中的数值表示不变性

数值等价的不同表示(小数、分数、百分比、单位换算)常令语言模型答案不一致,轨道不变性低于规范准确率。

04:00
arXiv cs.CL

衡量梵语文学中语义变化的计算方法

本文用历时词嵌入追踪梵语语义演变,建270万词四时期语料,经神经分词还原,21项中19项符合考证方向。

04:00
arXiv cs.CL

面向QMSum高效查询聚焦会议摘要的检索片段训练

QMSum缺评分器;统一重评15系统;检索片段微调令406M小模型媲美1.2B,且更省资源。

04:00
arXiv cs.CL

AIBuildAI-2.5:通过LLM引导的树搜索实现高效自主AI模型开发

提出LLM引导树搜索、资源感知调度与LLM路由,MLE-Bench奖牌率达73.3%。

04:00
arXiv cs.CL

提示广度与推演刷新在在线策略蒸馏中相互作用

在线策略蒸馏中,提示广度与推演刷新交互:刷新时广度提升准确率,冻结时相反,且受推理预算影响。

04:00
arXiv cs.CL

Peerify:同行评审论断验证基准

提出Peerify,基于稿件证据验证评审论断,构建800条真实评审基准;检索与论断分解关键,自动标签与人工共识达90.3%。

04:00
arXiv cs.CL

ufakzeka-1:从零构建并评估一个1.51亿参数的土耳其语语言模型

从零训练1.51亿参数土耳其语模型,仅耗约286美元,公开构建、评测全过程与三项可迁移发现。

04:00
arXiv cs.CL

LLM驱动的免训练位置-属性协同融合:面向双源加密POI与LULC制图的闭环范式

提出LLM驱动免训练闭环方法,融合双源加密POI,协同优化位置与属性,实现高精度LULC制图。

04:00
arXiv cs.CL

FrontierMath 埃尔德什

提出FME基准:68个截至2026年8月未解决的埃尔德什猜想,AI需在Lean中证明或证伪;每题预算300美元,GPT-6 Astra得3%,其余0%。

04:00
arXiv cs.CL

ICDAR2026 多领域文档多模态推理竞赛

竞赛以文档VQA评测八领域文档理解,20份提交显示最强系统依赖结构化证据提取、检索、验证与多组件编排。

04:00
arXiv cs.CL

自清洁却仍被捕获:智能体向自身写入的存储中错误的一个实测原语,以及分数下降实际衡量什么

智能体自我写入存储的错误受硬上界约束呈双模式,单一无参原语预测漂移;规模不能避免捕获,分数下降衡量可区分性。

04:00
arXiv cs.CL

ChainDoRA:面向参数高效大语言模型微调的张量列分解式权重分解低秩适应

ChainDoRA以张量列链构建方向低秩因子,仅5.35M参数即在七项常识推理任务上达72.30%平均准确率,较DoRA减参90.62%。

04:00
arXiv cs.CL

LatentPort:超越 KV 缓存——混合语言模型中循环记忆的跨模型迁移:无需目标前缀重放的 4B 到 9B 混合状态交接

实现4B到9B混合模型无需目标前缀重放的循环状态跨模型交接;加入GDN状态降损,校正后近原生9B。

04:00
arXiv cs.CL

MoM:记忆的记忆

提出MoM及P-Mem图:写入即提交当前值并保留被替换历史,提升有效性、减少过期答案并可恢复错误。

04:00
arXiv cs.CL

Understanding Reliability in LLM-based Human Behavior Simulation

04:00
arXiv cs.CL

基于图的反馈驱动猜词推理:面向Jotto问题的可扩展框架

图模型Jotto猜词,共同字母数作边权,约束传播缩小词空间,支持变长与重复字母,迭代数随词长对数下降。

04:00
arXiv cs.CL

影响并非失效:要问断言是否成立,而非问代码差异

改为追问具体断言是否仍成立,模型精确率由0.29升至0.97;问对问题比模型能力更关键。

04:00
arXiv cs.CL

Qwen3.8-Omni:迈向原生全模态智能体

原生多模态智能体模型,提升多模态理解推理与长程任务,支持百万上下文,并开源插件与实时交互框架。

04:00
arXiv cs.CL

FinFIRST:面向金融信息检索、信息溯源与可追溯性的搜索智能体基准测试

首个同时评估答案与支撑证据的金融搜索基准,含123个专家任务,使研究过程可测量、可验证、可诊断。

04:00
arXiv cs.CL

FineWeb-CLaR:面向基准对齐语料审计的文化、语言与区域标注

从FineWeb构建大规模文化-语言-区域标注数据集,并将277个文化基准同轴对齐,支持语料覆盖审计。

04:00
arXiv cs.CL

TelecomGPT-R1:面向异构电信任务推理的统一后训练

开源电信推理模型 TelecomGPT-R1 经轴感知数据生成与 DAPO 强化学习,七项基准均分 89.64%,超越 GPT-5 等。

04:00
arXiv cs.CL

套娃归因:学习将语言模型输出归因于表征与权重

提出套娃归因MAttr,用可微top-k掩码学组件嵌套排序,登顶机制可解释性基准,定位致拒答的1%权重。

04:00
arXiv cs.CL

美国公司判例法中的法律论证挖掘

首个42份美国联邦税务重组判例的专家标注树状论证语料,五类标签与支持树;分类检索可行,跨案泛化弱。

04:00
arXiv cs.CL

将长上下文压缩为答案对齐的记忆嵌入以用于LLM推理

CMC把长上下文压成答案导向的记忆嵌入,配问题引导选择与局部窗口,提升QA并省时省显存。

04:00
arXiv cs.CL

单独通过、合并失败:并行 LLM 智能体开发中的语义协调基准测试

并行智能体补丁单独通过却合并失败;构造任务干扰率97%,并发变更提示可恢复82%,已审查PR干扰少

04:00
arXiv cs.CL

压力下的行为:当用户施压时,六十个语言模型会怎么做

六十个语言模型受压时是否放弃正确立场:能否坚持与代际相关,方式与厂商相关,机器标注比人工一致。

04:00
arXiv cs.CL

从话语到网络:建模俚语在Reddit各子版块间的采纳与扩散

用LLM标注结合网络与语言分析,发现桥接资本促进俚语采纳、黏结资本抑制,语境越广采纳越慢。

04:00
arXiv cs.CL

ClusterFewshot:面向大语言模型工作流的少样本优化改进

结合语义聚类与效用评分构建代表性少样本示例,显著降低LLM工作流优化成本并提升准确率。

04:00
arXiv cs.CL

证候、协同与安全:面向中医处方生成的结构化推理与知识驱动对齐

针对中医处方生成中推理、随访调整与安全禁忌三大缺口,提出四阶段框架显著提升处方质量。

04:00
arXiv cs.CL

MemoryAthena:潜在记忆与生成记忆上的自适应路由

MemoryAthena以直接检索为锚,自适应路由生成记忆,问答与通用NLP任务平均分均提升。

04:00
arXiv cs.CL

ARAFA:一个由大语言模型生成的阿拉伯语事实核查数据集

大规模阿拉伯语事实核查数据集Arafa,含18万条声明-证据对,LLM三步构建,微调模型F1达77%。

04:00
arXiv cs.CL

BELXTR:基于上下文化词元检索的生物医学实体链接

提出BELXTR多向量模型,借词元级匹配改进生物医学实体链接,多语料平均提升5pp召回率。

04:00
arXiv cs.CL

冰岛手语孤立手语识别:低资源场景下的实验

首个冰岛手语孤立识别研究:数据极稀缺(849类中86%仅两样本),跨语言迁移(美手语预训练)使准确率提升14–24个百分点,多语言训练亦大幅增益。

04:00
arXiv cs.CL

知情掩码:面向扩散大语言模型强化学习的结构感知扰动

提出知情掩码,按去噪轨迹为token打分,偏向掩码下游token,提升dLLM强化学习效果与稳定性。

04:00
arXiv cs.CL

重新审视基于长度的训练:语音标记语言模型中的批次组成与损失归一化

固定批次组成与标记暴露后,短到长排序无独立收益;首轮分组增益仅见于批均值损失,与标记权重相关。

04:00
arXiv cs.CL

对arXiv:2512.07881和arXiv:2601.06104关于人类语言与AI生成语言中量子结构的评论的回复

回复两评论,回应大模型实验探索性、纠缠判定、玻色-爱因斯坦拟合、能级与量子空间等质疑,并更正笔误。

04:00
arXiv cs.CL

SpecialEduBench:面向自闭症儿童语言干预中知识、技能与态度的视觉语言模型基准评测

推出SpecialEduBench,从知识、技能、态度评测视觉语言模型在自闭症儿童语言干预中的教学能力,八款前沿模型均未饱和。

04:00
arXiv cs.CL

模态门控深度适配器:以精确保持方式为冻结嵌入模型添加模态

提出模态门控深度适配器,为冻结嵌入模型新增模态且原输出逐位不变,音频和热成像检索显著提升。

04:00
arXiv cs.CL

TSS:面向领域特定大语言模型投机解码的目标端稀疏化

TSS提出目标端稀疏化,跳过部分目标层以降低验证成本,提升草稿接受率与任务性能,翻译任务提速1.68倍。

04:00
arXiv cs.CL

幅度轮廓剪枝:面向Transformer压缩的免校准结构化注意力头移除

提出幅度轮廓评分,通过权重行范数离群检测免校准剪枝注意力头,MP-G适配GQA,零数据与梯度开销,性能优于校准依赖基线。

04:00
arXiv cs.CL

一个领域,多种语言:无需配对数据,为跨语言遥感MLLM组合领域与语言LoRA

MODL让英文遥感MLLM无配对数据跨语言:领域与语言LoRA逐层正交,答对率56-71%,文本不降

04:00
arXiv cs.CL

可信AI的真相:将表达性怀疑、来源溯源与信念修正作为可工程化的立场

在固定模型上叠加行为层,实现怀疑表达、溯源与信念修正;测试显示审计保证成立,但表达保真与溯源指标未达标。