9936 条条目 · 106 个活跃源
2026年8月17日
04:00
arXiv cs.CL

视觉即编码:探究视觉语言模型在代码理解中的有效性

研究发现多模态大模型可将代码渲染为图像,实现8倍压缩,利用语法高亮提升补全效果,克隆检测抗压缩性强,开辟高效推理新路径。

04:00
arXiv cs.CL

在基于语言的多智能体通信中学习打断

提出让监听者适时打断说话者的新通信范式,HANDRAISER方法预测最佳打断时机,在保持任务性能的同时降低32.2%通信成本。

04:00
arXiv cs.CL

神经语言模型刺激贫乏论证的统一评估

统一基准评估显示神经语言模型从少量输入可超偶然泛化但学习效率不及儿童认知偏置未一致促进刺激贫乏泛化

04:00
arXiv cs.CL

基于置信度动态的大型推理模型早停方法

提出CoDE-Stop,利用中间答案置信度动态决定停止推理,无需训练,减少25-50% token,优化准确率-计算权衡。

04:00
arXiv cs.CL

多轮大语言模型推理的自适应停止

提出首个多轮共形预测框架,按轮次分配误差预算,支持提前停止并保证覆盖率,降低轮数与成本。

04:00
arXiv cs.CL

TriageSim:基于结构化电子健康记录的会话式急诊分诊模拟框架

提出TriageSim,结构化病历生成拟人化分诊对话,产出800份文本音频,自动与人工评估,用于分诊分类。

04:00
arXiv cs.CL

面向研究的基础模型人类中心评估

现有评测忽视用户主观体验,提出人类中心评估框架,从问题解决、信息质量、交互体验三维度衡量。604次人类评测显示,大模型难以复现人类判断,凸显人工评估不可替代。

04:00
arXiv cs.CL

利用少样本学习与大语言模型从科学文献中分析血压随生物学性别的变化

采用少样本学习与大语言模型,从科学文献自动提取按性别分层的血压数据,分析血压随性别的变化。

04:00
arXiv cs.CL

解码学生思维:利用对话代理进行心理与学习分析

融合大模型与多模态数据的心理感知对话代理,实时分析学生认知情感状态,提升学习动力、减压并带来学业增益,但样本小待验证。

04:00
arXiv cs.CL

各司其职:将证据解读与决策聚合分离

分离证据解读与决策聚合,用四字段元组定义接口,解决计数尺度漂移;以校准对数似然比汇总,性能大幅提升。

04:00
arXiv cs.CL

面向长时程智能体任务的并行扩展的智能体聚合

提出聚合代理AggAgent,将并行轨迹视为环境,用工具按需检索综合,在六个基准上平均提升5.3%,深度研究任务提升10.3%,开销低。

04:00
arXiv cs.CL

当梯度重要性失真:GRPO下自适应LoRA秩分配失效

GRPO下自适应LoRA秩分配失败,梯度重要性失真且易放大,精度降4.5%,不宜从SFT直接迁移。

04:00
arXiv cs.CL

BAT:利用大语言模型学习空间声音推理

BAT将双耳声学分析模型与大语言模型结合,实现空间声音推理,在感知和推理上表现优越。

04:00
arXiv cs.CL

Cloud-ScPO:大语言模型推理中基于隐状态几何的半监督偏好优化

提出Cloud-ScPO,利用隐状态几何和自一致性挖掘偏好对,无需外部奖励,显著提升数学推理性能。

04:00
arXiv cs.CL

迷失于历史时间?波兰历史会考大语言模型基准

评估八种大模型在波兰历史会考中的表现,发现分数虽高但能力失衡,且存在脱离语境与时间错位两类典型错误。

04:00
arXiv cs.CL

AI智能体能否模拟A/B测试结果?智能体实验的验证框架。

提出模拟随机对照试验框架,分解误差;经67项测试验证,校准使预测误差降77倍,被试内设计使标准误降2.4倍。

04:00
arXiv cs.CL

PhoneWorld:规模化手机使用智能体环境

从真实界面轨迹规模化构建可控手机使用环境,覆盖多应用,显著提升多个智能体基准。

04:00
arXiv cs.CL

GEM:桥接推理与检索的生成式嵌入模型

GEM生成式嵌入模型通过推理用户意图增强检索,超越非推理版本,媲美更大模型,并支持测试时扩展。

04:00
arXiv cs.CL

探究个体写作风格对科技领域性别差距的影响

女性写作风格更具关系性,致其被女性多引、男性少引,揭示评价偏见渠道。

04:00
arXiv cs.CL

基于理论的评估揭示LLM个性化中的作者身份差距

基于作者验证理论评估LLM个性化,发现所有方法均低于跨作者下限,暴露作者身份差距,且不同指标结论相悖。

04:00
arXiv cs.CL

AI聊天机器人中的广告?大型语言模型如何应对利益冲突之分析

多数大模型在广告利益冲突中牺牲用户利益,如推荐昂贵赞助品、干扰购买、隐藏价格,揭示聊天机器人广告风险。

04:00
arXiv cs.CL

TEMPO:跨内存受限与计算受限场景的完工时间感知专家并行负载均衡

TEMPO:面向MoE的makespan感知负载均衡,兼顾内存/计算边界,混合场景性能更优。

04:00
arXiv cs.CL

迷失于发声:嗓音质量变化作为语音基础模型的评估维度

提出VQ-Bench评估语音基础模型对发声类型的敏感性,发现商业API失效及社会偏见。

04:00
arXiv cs.CL

通过表示干预理解并缓解大语言模型的过度拒绝

基于表示干预缓解大模型过度拒绝:从表示视角分析成因,通过重叠感知加权与上下文增强,兼顾安全与可用性。

2026年8月13日
04:00
arXiv cs.CL

扩散到压缩:利用扩散语言模型实现无损压缩

首创将扩散语言模型用于无损文本压缩,突破自回归逐字瓶颈,实现更优压缩率与速度。

04:00
arXiv cs.CL

Backtrader-Bench:基于自生成多选题的算法交易LLM智能体基准测试

提出Backtrader-Bench框架,用自生成多选题评测交易智能体;工具增强准确率90%,无工具73%,更难题目降至随机水平。

04:00
arXiv cs.CL

度量而非优化:预测大语言模型反学习中的恢复

提出一种审计方法,发现残留可访问性可预测模型级恢复速度,但直接优化它反而隐藏知识,增加恢复风险。

04:00
arXiv cs.CL

为预训练语言模型加装循环深度:两种参数预算下的安装、外推、迁移与保持

预训练模型可加装循环深度,两预算下中间监督按步推理,外推1.5倍深度,性能超暂存训练,但存在灾难性干扰。

04:00
arXiv cs.CL

TRACE Bench:任务驱动的角色扮演智能体清单评估

该框架将角色要求拆解为清单,用用户智能体对话驱动评估,评分可溯源至证据,覆盖率极高。

04:00
arXiv cs.CL

无标注手语表示学习用于跨数据集手语定位

利用广播新闻弱监督和伪标注,结合LLM规范化,提升跨数据集手语定位IoU至0.465,BLEU-4提升至11.04,证明松散对齐数据可有效学习手语表示。

04:00
arXiv cs.CL

迷失于压缩:评估上下文压缩下的附加约束损失

提出COMPINT评估套件,发现压缩仅保留约两成会话约束,新提取器可超九成保留。

04:00
arXiv cs.CL

更好、更快、更强:程序化技能学习最能降低智能体成本

程序化技能学习最能降低智能体成本;智能体通过分析过往轨迹即可习得技能,无需重放,兼顾降本与鲁棒性。

04:00
arXiv cs.CL

基于ODE的Transformer解码器用于迭代手语翻译

用龙格-库塔法改进迭代手语翻译的更新动力学,不增模型参数即提升BLEU,优于基线。

04:00
arXiv cs.CL

通过技能-执行框架演化的自进化具身智能体

SHAPER冻结模型参数,演化技能与代码框架,实现免训练的具身智能体自适应。

04:00
arXiv cs.CL

群体对齐引发的谄媚行为:可引导多元对齐的双向评估

研究群体对齐带来的谄媚副作用,提出GAS框架,评估3方法4模型13群体,发现增益与偏移非均匀,需双向多维评估。

04:00
arXiv cs.CL

收敛是否不可避免?将输出同质性追溯至基座模型

研究表明,语言模型输出同质性源于预训练阶段,对齐仅揭示或放大,非引入。

04:00
arXiv cs.CL

学习说服揭示大语言模型多么容易放弃正确信念

一个虚假说服论据即可让LLM准确率近零;RL训练的说服者成功率超93%,可迁移攻击其他模型,暴露可信度策略漏洞。

04:00
arXiv cs.CL

CT-ΔBench:面向视觉语言模型的纵向三维医学影像差异报告基准

提出CT-ΔBench基准,评估纵向CT影像差异报告,并设计变化感知指标与DeltaMed基线模型。

04:00
arXiv cs.CL

论CCSK中的弱互模拟

在CCSK可逆扩展中研究弱互模拟,提出方向性与混合两种变体,证明混合互模拟为同余并能完全抽象τ动作。

04:00
arXiv cs.CL

DonorRank:低资源跨语言语音识别中的供体语言选择

提出DonorRank排序框架,预测零样本语音识别的有效供体语言,优于遗传相似度等启发式,并揭示供体组合影响迁移线索。

04:00
arXiv cs.CL

超越单轮置信度:面向LLM智能体的轨迹自适应不确定性量化

单轮不确定性量化用于多轮智能体轨迹效果不均;自一致性最佳,轨迹等价变体最优,令牌概率对聚合器敏感。

04:00
arXiv cs.CL

Reddit上网络性暴力叙事中的污名与支持

研究Reddit性暴力叙事,构建SCOPE数据集,发现内化污名最常见,社区回应以信息和尊重支持为主。

04:00
arXiv cs.CL

强化步骤级推理以实现LLM的有效自我纠正

提出SFS-DPO两阶段框架:先步骤级偏好优化强化推理,再训练自我验证与纠正,优于基线。

04:00
arXiv cs.CL

主特质分析:迈向在人机协作中提炼“技能”

主特质分析从人机对话中提取协作特质,能解释行为并预测结果,但作为技能仍待验证。

04:00
arXiv cs.CL

AWARe:通过激活加权自适应保留缓解灾难性遗忘

提出AWARe微调法,按激活模式动态冻结关键参数,防止多模态大模型遗忘旧知识,兼顾下游性能。

04:00
arXiv cs.CL

措辞效应:量化大语言模型基准性能中的双向漂移

重述问题会双向改变模型答案;越强的模型损失越多,脆弱性源于措辞本身。

04:00
arXiv cs.CL

当API说错语言:重新审视多语言工具使用的后训练

多语言API调用中,模型常生成语言不一致的参数值(ALM)。微调可大幅提升一致性,效果不逊于强化学习;后者仅在泛化与多目标权衡上有边际增益。

04:00
arXiv cs.CL

定位与控制大型语言模型中的隐式个性化

研究表明LLM输出随隐性人口线索变化,对应内部激活信号可定位并干预,抑制其影响优于提示词。

04:00
arXiv cs.CL

语义莱尼亚:大型语言模型语义空间中稳态孤子的涌现

将大模型推理变为连续动态系统,通过稳态反馈涌现语义孤子,维持混沌边缘,实现溯因跳跃并建立认知标度律。

04:00
arXiv cs.CL

你会投给谁?审计大语言模型的政治倾向:意大利案例研究

提出可复现的审计框架,分析多个LLM对意大利政党及领导人的评价,发现其行为受提示词和角色设定影响,且存在不一致性。