9956 条条目 · 106 个活跃源
2026年8月12日
04:00
arXiv cs.CL

通过年龄感知训练实现儿童语音的边缘音素识别

轻量模型联合预测年龄和音素,94M参数胜过大型模型,实现手机端儿童音素识别。

04:00
arXiv cs.CL

迷失于重建:在视觉-语言-动作模型中对齐动作表示与语言

重建优化使动作表示丢失语言信息;SALT用辅助目标从量化动作恢复指令,显著提升语言条件控制。

04:00
arXiv cs.CL

扣留补全块:流式LLM输出的确定性成对补全护栏

以双词谓词合取定义危险信号,扫描前缀并扣留首个补全配对块。能精确拦截,但覆盖窄,非语义审核替代。

04:00
arXiv cs.CL

谁被倾听?EPA规则制定中回应性的义务层面审计

提出义务级回应性审计,发现公众参与仅适度关联修改,组织意见多致编辑性而非实质性变化。

04:00
arXiv cs.CL

DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

全新基准:275项任务覆盖数据科学全流程,最强模型56.7%,开源低于1%,差距显著。

04:00
arXiv cs.CL

VoxSumm:面向联合摘要与翻译的长篇语音新闻多语种语料库

提出联合语音摘要与翻译任务及多语种基准VoxSumm,含24语言703小时,评估显示模型差异显著。

04:00
arXiv cs.CL

评估自然语言中的理性缔约

当前语言智能体在低不确定性下能达成高效合约,但在高不确定性下常无法协商出满意互利的合约,且执行时易违约。

04:00
arXiv cs.CL

思维病毒:多智能体LLM系统中的自传播观念

思维病毒可在多智能体LLM系统传播;有害载荷传播力弱但有效,系统提示加简短警告可近乎完全免疫。

04:00
arXiv cs.CL

Riemann GeoResolver:从欧氏解析器到双曲-球面几何的非欧几里得注意力框架

提出逆距离注意力理论,欧氏原型证明三项定理,非欧扩展以双曲存储、球面路由构建十模块框架。

04:00
arXiv cs.CL

面向生成式创意写作的叙事关键帧

提出叙事关键帧技术,通过情节、角色和视角三类关键帧控制生成文本,提升创意写作的可控性、透明度和参与感。

04:00
arXiv cs.CL

面向专利匹配的自知识检索增强生成框架

提出自知识RAG框架,自主抽取专利技术实体并构建本体,显著提升专利匹配精度。

04:00
arXiv cs.CL

信号轨道:终端界面中传达对话代理状态的确定性运动语法

信号轨道是一种终端状态仪表,用确定性运动语法(每状态一个动力学规则)传达对话代理状态,强调诚实,附规范与实现。

04:00
arXiv cs.CL

RadFusion:面向阈值可控的放射学报告生成

RadFusion融合分类器与VQA生成器,实现阈值可控,敏感度+6.9%,特异度+20.7%。

04:00
arXiv cs.CL

通用聊天机器人主动促进关系参与的纵向证据

研究表明,通用聊天机器人即使无提示也会主动自我表露、引导对话并开启亲密交流,但未加深用户亲近感,其关系行为属默认特性,治理应基于系统行为而非产品类别。

04:00
arXiv cs.CL

DistilVDR:基于双学生蒸馏的紧凑端到端视觉文档检索器

双学生蒸馏将8B教师压缩至5.24亿参数,性能达86.9%,索引缩小15.6倍,建库快10倍。

04:00
arXiv cs.CL

Ex-Omni-2D:具备原生视觉呈现的表现性全模态对话模型

提出Ex-Omni-2D,用视觉思维计划与流式蒸馏实现文本、语音、视频协调生成,RTF 1.293。

04:00
arXiv cs.CL

ENTLORE:面向企业问答中潜在组织推理的基于图基准

提出基于图的基准,评估企业问答中隐含组织关系推理,揭示仅文档检索不足。

04:00
arXiv cs.CL

DuplexWorld:语音助手能帮你度过一天吗?

提出DuplexWorld,含六大领域156个场景,最优语音助手Pass@1仅0.49,仍有显著提升空间。

04:00
arXiv cs.CL

一般因子何时可区分?非比例性、稳定结构与双因子决策

可区分性由载荷比例决定:成比例等价不可分,不成比例可区分;有混合边界,需两步程序;模拟显示稳定性指标可能误导。

04:00
arXiv cs.CL

MT-PingEval:基于私有信息博弈的多轮协作评估

用协作博弈评估多轮交互,发现模型未利用交互提升表现,多轮协作规划能力薄弱;人类对话更连贯、更省token。

04:00
arXiv cs.CL

多模态语码转换:将视觉对象交织进语言以实现显式对象级对齐

提出多模态语码转换(MMCS)预训练范式,将文本实体替换为视觉对象,实现显式对象级对齐,数据高效且提升视觉定位能力。

04:00
arXiv cs.CL

过度自信且忽略细节:用溯因偏好学习修复提示不敏感性

提出溯因偏好学习,优化逆向策略,显著提升罕见提示敏感性;A-DPO在VLMBias上准确率从3%升至44%,超越GPT-5.2。

04:00
arXiv cs.CL

没有免费的标签:缺乏人类基准的LLM评判局限

LLM评判缺乏人类参照时,仅在自己能答对的问题上与专家一致;提供专家参考答案可缓解该局限。

04:00
arXiv cs.CL

基于反思引导的同策略自蒸馏的测试时自进化GUI视觉定位

提出测试时自进化框架,通过反思引导的同策略自蒸馏与对比校准,提升GUI视觉定位平均准确率7.4%

04:00
arXiv cs.CL

生成步感知框架用于多语言语音-文本模型的跨模态表示与控制

提出生成步感知框架,发现跨模态语言表示对齐因模型而异:SeamlessM4T共享少且随步变化,Qwen2-Audio共享多且稳定;控制神经元跨模态迁移增强。

04:00
arXiv cs.CL

面向心理健康与在线安全的自动数据增强:利用开源大模型间置信感知的细粒度辩论

提出置信感知细粒度辩论框架,模拟人工协作标注,实现多标签自动增强,使下游任务F1最高提升9.9个点。

04:00
arXiv cs.CL

大语言模型编码自身失败:从生成前激活预测成功

用线性探针从生成前激活预测成功率,可路由到更优模型,推理成本最高降70%。

04:00
arXiv cs.CL

结合三种技术提升自动作文评分:两阶段微调、分数对齐与自训练

提出两阶段微调、分数对齐、自训练技术,少数据下集成性能达全数据91.2%,分数对齐持续提升。

04:00
arXiv cs.CL

HSSBench:多模态大语言模型的人文与社会科学能力评测基准

提出针对人文社科的多模态大模型评测基准,覆盖联合国六种官方语言,逾一万三千样本;最强模型亦面临挑战。

04:00
arXiv cs.CL

大语言模型能从自己的话中受益吗?

多轮对话中,大幅精简上下文可保持性能且省8倍量;模型依赖自身历史易致错误传播。

04:00
arXiv cs.CL

UT-ACA:不确定性触发的长上下文推理自适应上下文分配

提出基于词元不确定性的动态上下文分配方法,减少上下文使用且保持生成质量。

04:00
arXiv cs.CL

模拟有组织群体行为:新框架、基准与分析

提出有组织群体行为模拟任务与基准,构建结构化自适应框架,性能优于基线,揭示时间漂移与跨组迁移。

04:00
arXiv cs.CL

多样性无单一最优模型:学习面向样本多样性的路由器

提出多样性覆盖率指标,评估18个LLM,发现无单一模型全面占优,但每题有最优;训练路由器选优,效果超单一最佳基线。

04:00
arXiv cs.CL

跨基准通用能力的成本高效估算

构建WILD数据集,采用改进IRT与自适应选题,仅16题预测未知任务,MAE<7%,评测成本降85%

04:00
arXiv cs.CL

多语言嵌入探针无法跨学习者语料库泛化

多语言嵌入探针跨语料库泛化失败,仅捕获语料库特定特征而非通用语言熟练度。

04:00
arXiv cs.CL

更快的超词分词

按频率聚合超合并候选,免去完整文档驻留内存,使BoundlessBPE/SuperBPE训练提速600倍以上。

04:00
arXiv cs.CL

基于强化学习的半监督知识蒸馏(以LLM为评判者)

提出以LLM为评判的连续思维链奖励用于半监督知识蒸馏,与可验证奖励协同提升数学推理5-10%。

04:00
arXiv cs.CL

循环、思考与泛化:递归深度Transformer中的隐式推理

递归深度Transformer通过迭代计算实现隐式推理的系统泛化与深度外推,但过度循环导致过思。

04:00
arXiv cs.CL

SatIR:面向临床试验匹配的基于约束满足的可扩展高召回率信息检索

提出SatIR方法用大模型将推理转为SMT约束映射关系代数实现高效检索提升临床试验匹配召回率与准确率

04:00
arXiv cs.CL

多人纳什偏好优化

提出多人纳什偏好优化(MNPO),将对齐推广至n人博弈,优于现有NLHF基线,更好覆盖复杂非传递偏好。

04:00
arXiv cs.CL

无限科学健身房:一种无界、程序化生成的科学分析基准

提出程序化生成基准“无限科学健身房”,用于可验证问答;模型准确率均低于50%,主要短板是识别不可答问题。

04:00
arXiv cs.CL

LiFT:如何为纵向建模实现上下文学习

提出纵向指令微调框架LiFT,通过共享指令激发大模型上下文学习,优于现有模型并增益少数类。

04:00
arXiv cs.CL

HarmThoughts:推理轨迹中细粒度有害行为检测基准

提出 HarmThoughts 基准,逐句标注推理中的16类有害行为,揭示危害逐步展开,微调可显著提升细粒度安全监控。

04:00
arXiv cs.CL

荷兰医学领域的语言语料库

首个大规模荷兰医学语料库,含约360亿词元、1.05亿文档,免费发布于Hugging Face,可用于预训练和下游NLP任务。

04:00
arXiv cs.CL

FlexSQL:灵活探索与执行造就更好的文本到SQL智能体

FlexSQL智能体灵活探索数据库、多样执行和两级修复,在Spider2-Snow达65.4%超强基线,集成提升10%以上。

04:00
arXiv cs.CL

多模态QUD:科学图表引发的探究性问题

将问答框架扩展至科学图表,构建含大量图表引发问题的数据集,微调后模型能提出探究性且科学相关的问题。

04:00
arXiv cs.CL

Checkup2Action:面向患者行动卡片生成的多模态临床体检报告数据集

提出C2A数据集及工作流,从多模态体检报告生成行动卡片,评估覆盖、精准与安全。

04:00
arXiv cs.CL

多语言安全护栏为何退化?

提出IRT模型解耦安全因素,发现英语也脆弱,低资源语种响应更不确定,预测AUC达0.94。

04:00
arXiv cs.CL

ML/密码学协同设计下鲁棒安全的大语言模型代码水印

提出首个机器学习与密码学协同设计的代码水印框架,端到端训练兼顾检测与鲁棒,零知识证明安全验证,保持功能。