9936 条条目 · 106 个活跃源
2026年8月17日
04:00
arXiv cs.CL

BCMT:分块因果记忆Transformer

BCMT用分块因果记忆替代全局注意力,实现长上下文建模,性能媲美密集Transformer,同时提升吞吐、降低内存。

04:00
arXiv cs.CL

并非所有Token都等价:面向智能体LLM系统的通胀感知路由

智能体系统重试导致Token膨胀,实际成本远超单价。InflationAgent通过四阶段路由,以语义汇率选模型,在GSM8K上比FrugalGPT节省31%Token且准确率更高。

04:00
arXiv cs.CL

潜空间思考,语言解释:自解释潜推理

提出SELR:通过答案损失和CoT损失联合训练,实现高效且自解释的潜推理,无需外部解码器。

04:00
arXiv cs.CL

语言服务器能为编码智能体节省Token吗?一种测量方法论与初步研究

经测量,LSP语义检索通常不省Token,仅特定任务和模型有利;建议按任务类自适应路由。

04:00
arXiv cs.CL

Jais 2:一个以阿拉伯语为中心的开源大语言模型家族

Jais 2是阿拉伯语中心开源大模型家族,含70B参数最大模型,性能领先,高效且开放。

04:00
arXiv cs.CL

基于语义感知偏差估计的大型音频语言模型公平性度量

提出语义感知混合效应回归框架,控制语义与说话人混淆,用模型自身语义嵌入,减少虚假公平发现,稳健估计亚组差异。

04:00
arXiv cs.CL

IterCOMP:面向多跳问答的推理感知自适应提示压缩

本文提出一种无需训练的迭代压缩方法,通过分解证据与生成追问,减少令牌并提升多跳问答的准确性。

04:00
arXiv cs.CL

GRPO超越英语:非英语与多语言环境下的大规模研究

研究发现非英语GRPO训练母语推理与英语差距小,跨语言迁移强,但特定语言可能引发其他语言退化,需广泛评估。

04:00
arXiv cs.CL

CLAIR-Fin:面向跨模态金融问答的对抗式多智能体声明级验证与自适应辩论框架

提出九智能体框架,按类型验证金融声明,对抗式辩论,先审查后终审,忠实度升至0.889,拒答5.4%问题。

04:00
arXiv cs.CL

TeachMateGPT:面向科学课程材料的多智能体知识锚定教学评估生成框架

TeachMateGPT以多智能体与分层知识库生成科学评估,通过分阶段闭环和源验证,将忠实度提至0.96、相关性提至0.89。

04:00
arXiv cs.CL

ASSERT:面向生成式人工智能审计的测量流水线

审计生成式AI时,测量选择显著影响报告率,ASSERT通过规范驱动流水线关联结果与测量,便于归因差异。

04:00
arXiv cs.CL

当词汇变化造成误导:用传统指标与基于大语言模型的指标重新思考动态主题模型评估

动态主题模型评估中,传统一致性不可靠,LLM语义相似度更准,建议结合两者并关注词汇变化。

04:00
arXiv cs.CL

基于执行可验证监督的强化学习引导小众多语言代码翻译

提出用执行结果监督的强化学习训练多语言翻译,扩展种子程序,训练奖励模型,优化600语言对,引入新基准,显著提升小众语言翻译质量。

04:00
arXiv cs.CL

批量自适应剪枝:面向语言推理模型的周期性神经元激活感知权重剪枝

提出免训练自适应剪枝,用周期Top-k与激活记忆,批量推理准确率提升39.7个百分点,提速1.40倍。

04:00
arXiv cs.CL

属性引导的体裁扩展:超越故事中心数据的创意写作规模化

提出属性引导的体裁扩展框架,构建多体裁语料,微调后模型在创意写作上超越基线,表明受控体裁扩展是关键优势。

04:00
arXiv cs.CL

修复而非改进:工具调用放弃中受约束解码的分解

工具调用放弃场景:受约束解码较差,停止/枚举作用相抵,仅恢复形式,语言假设不成立。

04:00
arXiv cs.CL

BM25增强的少资源东北印度语言多示例翻译

佛罗里达大学用BM25检索示例增强Gemini翻译,无需微调,参与WMT26英-东北印度语双向翻译。

04:00
arXiv cs.CL

GALA:面向文本到时间序列合成的生成感知跨模态对齐

GALA提出生成感知跨模态对齐,提升文本到时间序列合成,刷新多指标SOTA。

04:00
arXiv cs.CL

增强并不代表可预测:思维模型中的推理行为

推理训练强化自我纠正、假设检验等行为,但非正确性最强预测;高提升行为未被放大。

04:00
arXiv cs.CL

StreamHear:面向半监督流式语音识别的领域自适应伪标签方法

用离线教师生成伪标签并重对齐,微调流式学生模型,领域自适应效果优于监督微调。

04:00
arXiv cs.CL

S2Dialog:基于语义与声学风格建模的多模态对话检索

提出S2Dialog框架,用对话级文本与声学检索器及对比学习,实现多模态对话语义和风格检索,在DailyTalk上表现优异。

04:00
arXiv cs.CL

法律RAG系统仍会产生多少幻觉?

法律RAG系统幻觉严重,最优系统低于10%,最差近半,错误前提问题幻觉率更高。

04:00
arXiv cs.CL

HERMES:面向地学超长文档结构化知识提取的多智能体框架

提出多智能体框架HERMES,从超长地学文献中提取结构化数据,应用于古生物学专著,生成3.2万实体、45万属性,F1约0.9,效率提升六倍。

04:00
arXiv cs.CL

体育领域大模型综述

综述体育领域大模型的任务、数据集与挑战,奠定大模型驱动体育智能研究基础。

04:00
arXiv cs.CL

前导静音增强与多阶段合成监督用于第二届MLC-SLM挑战赛

通过随机裁剪与EMA优化,将说话人识别错误率从18.30%降至16.73%;合成问答与分布匹配增强将理解准确率从83.0%提升至86.0%。

04:00
arXiv cs.CL

快速硅采样的条件性优势

快速硅采样在计算效率和算法保真度上优于慢速模式,但硅采样整体仍早期,需谨慎使用,会低估意见方差。

04:00
arXiv cs.CL

SimpleOPD:用于长上下文推理的简单分词器无关在线策略蒸馏

提出简单分词器无关的在线策略蒸馏,解决分词器与分布不匹配,稳定训练并转移长上下文推理能力,数学推理显著提升。

04:00
arXiv cs.CL

越流行,越难忘:面向大语言模型遗忘的自适应流行度方法

提出AdaPop法,依流行度调节遗忘强度,用控制器平衡,泄露量降低约5倍和1.6倍。

04:00
arXiv cs.CL

Envs-FORGE:面向智能体强化学习的前沿优化奖励驱动环境合成

Envs-FORGE将验证器奖励转为逐种子环境合成动作,通过混合整数规划选择最优,显著提升智能体强化学习Pass@1。

04:00
arXiv cs.CL

语言模型表示中几何复杂性的局部与全局区制

内在维度受词汇多样性影响呈尺度依赖反转:低多样性时独特词少者维度高,高多样性相反,并给出反转点精确公式。

04:00
arXiv cs.CL

AI聊天机器人能找到专家找到的研究吗?模型、用户角色与样本量对医学问题研究检索的影响

评估三个AI聊天机器人检索Cochrane综述研究,性能因模型和用户角色而异,且偏向大样本临床试验。

04:00
arXiv cs.CL

不对称话语同质化与共享语言技术:来自Reddit的证据

2022年底起,跨党派论坛政治话语分化中断,保守派同质化加剧,进步派无变化,非ChatGPT单点触发,系社区层面渐进而非个体采用所致。

04:00
arXiv cs.CL

信息满意度:以读者为中心的摘要评估维度

现有摘要指标衡量不了信息满意度;读者背景可作信号,但常见指标均与人类判断不符。

04:00
arXiv cs.CL

智能体事务:迈向ACID合规的智能体系统

提出智能体事务与ACID合规框架,实现语义原子性等四性,实验较SOTA提升10.6%。

04:00
arXiv cs.CL

你只前向一次:在冻结语言模型的单次前向中同时作答与弃权

提出YOPO,在冻结语言模型单次前向中同时作答与弃权,通过重构残差流避免干扰,性能超两遍推理。

04:00
arXiv cs.CL

字里行间:法律模拟中行为真实性的建模与评估

提出WitnessSim,用可控法律人格模拟证人。评估区分行为真实性与教学效果:行为合理,无偏好,且随提问干预调整,提供法律模拟评估框架。

04:00
arXiv cs.CL

QUASAR:通过损失感知重构降低量化感知训练的性能下限

提出QUASAR方法,在训练中持续进行轻量损失感知重构,降低量化模型损失下限,显著提升低比特性能。

04:00
arXiv cs.CL

VoiceChat-TTS:面向交互式智能体的低延迟连续语音合成模型

提出低延迟连续语音合成模型VoiceChat-TTS,支持打断、静音待机,保持高质量。

04:00
arXiv cs.CL

状态条件验证:用于适应与监控安全分类器的正确性估计

RCV从内部表征估计正确性,纠正可疑预测并监测漂移,不重训即提升安全分类器策略符合度。

04:00
arXiv cs.CL

MINT:面向交易数据的通用零样本预测器

MINT框架将交易编码器与LLM结合,实现零样本预测问答,性能领先且大幅降低计算开销,优于文本序列化。

04:00
arXiv cs.CL

变换编码视角下的KV缓存压缩

利用变换编码与反向注水最小化注意力感知失真,实现KV缓存5.8倍压缩且精度近无损。

04:00
arXiv cs.CL

MathForm:利用知识检索与验证引导修正扩展数学自动形式化

提出MathForm框架,结合知识检索和验证反馈迭代修正,构建36.7万条Lean 4数据,训练8B模型,多基准上超32B专用模型。

04:00
arXiv cs.CL

无纠正控制的接地:大语言模型的真值追踪特征

针对大模型缺乏纠正控制但仍具指称,提出可回答性与路径剖面,分析其真值追踪条件和限制。

04:00
arXiv cs.CL

AI推荐哪位医生?大语言模型辅助医生选择中声誉与人口统计学信号的算法审计

审计7个LLM医生推荐:声誉主导(评分升0.8增31.4个百分点,费用升100降20);人口偏差方向与人类审计相反,模型自述无法检测。

04:00
arXiv cs.CL

错误但有用:多智能体消息中超越答案正确性的轨迹价值

多智能体推理中,错误但有用的消息常能提升最终结果;答案正确性不等于轨迹价值,DHD协议可测量该价值并生成可用标签。

04:00
arXiv cs.CL

见红思恶:视觉语言模型中的颜色偏差

视觉语言模型有颜色偏见:绿词倾向正面,忽略否定词,降低对比度致视觉问答错误增多。

04:00
arXiv cs.CL

AnchorBench:针对LLM锚定效应的多路径基准

提出AnchorBench,评估多路径锚定效应:锚定依路径,合理锚定影响更大,远距减弱,高精度也易感。

04:00
arXiv cs.CL

大语言模型不为跳跃付出代价

大语言模型无法完成溯因跳跃,因缺乏认知错误与物理成本的耦合;固定权重推理无此机制,问题比具身性更深。

04:00
arXiv cs.CL

原则性监管中LLM裁判的四轴可信度基准

原则性监管LLM裁判需四轴评估;无方法全能,120B模型遭关键词堆砌准确率骤降,报告对抗鲁棒性与校准。