ConPress:从多问题上下文压力中学习高效推理
提出ConPress方法,利用多问题上下文压力诱导自压缩,仅用8k样本微调即减少59%推理token,保持精度。
付费声音 vs. 公共信息流:可解释的跨平台气候话语主题分析
对比Meta付费广告与Bluesky公共帖子的气候话语,开发可解释主题发现流程,揭示策略推广与系统批评的系统性差异。
大型音频语言模型在多项选择评估中的鲁棒性评估
研究发现大型音频模型对选项顺序及题目措辞敏感,并提出更稳健的评估协议与指标。
How Pragmatics Shape Articulation: A Computational Case Study in STEM ASL Discourse
我更偏向逐点还是逐对?揭示基于评分量规的LLM评判中的位置偏差
基于量规的LLM评估存在模型特定位置偏差和排序偏差,随机排列选项可有效减轻。
低资源语言机器翻译中的多示例上下文学习实证研究
研究表明多示例上下文学习有效提升低资源语言翻译,BM25检索可大幅提高数据效率。
适应自监督语音表示用于帕金森病跨语言构音障碍检测
提出表示级语言偏移,对齐自监督语音表示,有效提升跨语言帕金森病构音障碍检测灵敏度和F1。
叙事特征还是结构化特征?大语言模型识别癌症患者心衰风险的研究
LLM用叙事特征识别癌症患者心衰风险,F1优于传统模型39%,显著提升性能。
MedLayBench-V: 面向医学视觉语言模型中专家-普通人语义对齐的大规模基准
首个大规模多模态基准,通过结构化概念精炼管道实现医学图像专家-普通人语义对齐。
Unintended Negative Impacts of Promotional Language in Patent Evaluation
通过有效反馈计算实现代理框架的缩放定律
引入有效反馈计算(EFC)作为缩放坐标,优于原始计算,提升通过率并降低成本。
心理健康支持中的人机交互信任对齐:多利益相关方的综述与观点
提出人、AI、交互三层信任框架,综述心理健康AI研究,揭示NLP评估与临床需求的关键差距,规划对齐研究路线。
山崩地裂如何登上新闻头条:全球滑坡事件在德国媒体报道中的覆盖与空间偏差数据分析
分析25年德国报纸对全球滑坡的报道,发现过度偏向南欧和西欧,揭示媒体注意力偏差。
通过干预性后训练学习语音基础模型的任务特定子空间
提出干预性对比后训练,将语音模型表示分解为内容和说话人子空间,提升域外说话人验证。
PhoneBuddy:训练开放模型实现代理式手机操作
结合真实与模拟环境训练手机代理模型,混合强化学习将任务成功率提升至45.33%,较监督微调提升近9个百分点。
CoLA:跨模态低秩适应用于多模态下游任务
CoLA在LoRA基础上增加跨模态路径,实现双流多模态高效适配,在视觉-语言与音频-视觉任务上相对提升约2-3%。
开放权重大语言模型中的同质性偏差对解码超参数具有鲁棒性
开放权重LLM中西班牙裔和亚裔同质性偏差对超参数鲁棒,非裔和性别偏差不稳健,且命名范式可反转偏差方向。
隐私感知的视觉语言模型
提出隐私基准和指令数据集,微调少量样本即可显著提升模型隐私感知能力,并超越GPT-4。
SyncLoop:一个用于自我改进数学推理的多模态双循环框架
提出C2-Evo框架,通过跨模态数据与数据-模型双进化循环,自动提升多模态数学推理性能。
广义医学短语定位
提出广义医学短语定位,允许每句映射到零或多个区域,MedGrounder模型两阶段训练,实现零样本迁移并减少标注。
Streaming-dLLM:通过后缀剪枝与动态解码加速扩散大语言模型
提出训练无关框架,剪枝冗余后缀并动态跳过收敛迭代,实现最高68.2倍加速且保持质量。
观点:感知后推理即无视觉推理
多模态研究误以为语言推理可补偿视觉缺陷,实则感知后推理退化为文本空间推理,丢失视觉信号,应转向感知内推理。
SPARC:分离视觉语言模型的感知与推理回路以实现测试时缩放
SPARC框架将感知与推理解耦,实现推理时计算资源灵活分配,显著提升视觉语言模型在复杂推理任务中的性能。
从语义和音位视角探究语音编解码器
本文分析语音分词器,发现其主要捕获音位而非词汇语义,为下一代设计提供启示。
CLEF HIPE-2026:评估从多语言历史文本中准确高效的人物-地点关系提取
HIPE-2026评估多语言历史文本中人物-地点关系提取,综合考核准确性、效率与泛化性,支撑数字人文应用。
记忆传染:通过智能体记忆的评估者偏见的跨时间传播
发现记忆传染:评估者偏见通过智能体记忆跨时间传播,长度偏见在旧模型中传播而新模型免疫,权威偏见未传播,且无安全阈值。
SingGuard:一种具有动态推理能力的策略自适应多模态大语言模型护栏
SingGuard是一种策略自适应多模态护栏,支持动态规则输入和快慢推理,在多个基准上取得SOTA,显著提升策略遵循准确率。
LLM系统中的持续知识更新:通过多时间尺度记忆动力学学习
提出外部记忆应模仿生物多时间尺度耦合动力学,使LLM通过Memini实现知识的持续自适应更新。
EXPO-SQL:基于执行的子句级策略优化用于文本到SQL
提出EXPO-SQL,通过子句级奖励细粒度监督,利用执行反馈识别错误子句,显著提升文本到SQL性能。
QuechuaTok:形态边界准确度——黏着型低资源语言分词器评估的必要指标
比较四种分词器在克丘亚语上的表现:PRPE形态准确率最高(83.33%),BPE仅6.67%,证明仅用生育率评估黏着语分词器不足。
评估LLM在高效且可解释的产品吸引力数值与分类隐式情感分析中的应用
提出LLM量化产品吸引力框架,零样本情感评分与专家高度一致(r=0.97,准确率94%),GPT-4o-mini成本降94%性能相当,兼具可解释性。
ModTGCN:面向文本分类的模块化感知图神经网络
提出ModTGCN,通过模块化辅助目标优化文本分类,在复杂低同质性数据集上效果显著。
量化RAG系统中的先验主导性
提出NCU指标量化上下文利用,发现小模型在严格事实提取中优于大模型,商业API存在先验主导问题。
自我识别微调可以预防和逆转涌现性失配
自我识别微调通过强化模型性格,有效预防和逆转涌现性失配,且不恶化其他指标。
一年之后:伤害仍在,但我们绝不后退!
通用大模型心理健康对话安全防护不足,除自杀外其他疾病失败率高达100%,需分类防护。
先定位再排序:重新审视基于无训练实体识别的知识型VQA
提出无训练IBA框架,解耦实体识别与证据排序,在KB-VQA上优于微调基线且降低复杂度。
LLM归因指标可迁移吗?跨数据集和构造的检索增强生成评估审计
审计8种自动归因评分器:跨数据集指标颠倒,无通用最优,需在目标数据集验证。
When Retrieval Metrics Mislead: Measuring Policy Signal in Long-Horizon Tool-Use Agents
我的嵌入是否反映 $A = B$?评估嵌入模型中的数学等价性
引入MELD数据集,发现现有模型按术语而非数学实质分组,提出对比学习对齐方法以改进。
CAVEWOMAN:大语言模型在语言输入与输出压缩下的行为表现
输出压缩降成本,输入压缩反增成本,模型响应偏离无约束基线。
非裔美国人英语辅音丛缩减的wav2vec 2.0和Whisper逐层探测
非裔美国人英语辅音丛缩减在模型中编码为结构化渐变音系变异,而非简单删除,保留底层塞音线索。
RASC+:面向临床值集编写的检索约束大语言模型裁决
通过检索增强候选池召回率至0.73,再以受限LLM裁决选择,F1从0.287提升至0.549。
迈向规范学习:基于偏好对的推理时对齐
提出Spec Learning框架,用偏好对编译自然语言规范,推理时对齐LLM,无需参数更新,性能优于DPO且可解释。
构建即忠实:基于声明锚定的多文档摘要归因
CAMS框架以原子声明为锚定单元,通过提取、聚类与约束重写,实现多文档摘要的细粒度归因与忠实性,提升归因准确率约三分之二。
面向多层MeMo的版本感知操作与事务记忆
MeMo通过版本感知操作和事务记忆编辑显式关联矩阵,实现知识更新而不需重训练,支持回滚与追溯。
情感分析的最佳预处理技术
研究发现,情感分析预处理最佳顺序为分词、清理、词干提取、去停用词;拼写校正影响最小,分词影响最大。
端到端语音语言理解中的选择性能力遗忘
针对SLU系统移除功能后意图-槽映射残留问题,提出BSU框架降低强制前缀重构风险,同时保持性能。
大型语言模型中的句子级上下文同化
发现句子级上下文同化:提示句子自增概率,模型越大效应越小,2%-4%注意力头控制,关闭可缓解。
PORTER:语言驱动的事件表示,构建可移植的结构化电子健康记录基础模型
PORTER采用语言描述解耦固定词汇,数值单独处理,实现无重训跨机构迁移,恢复97.1%AUROC,优于固定词汇模型。