PolERo:研究罗马尼亚语中的政治回避
介绍罗马尼亚总统问答数据集PolERo,含3574个人工标注样本,评估多模型分类表现,发现跨语言迁移不对称,含语用线索的矛盾回避类别仍是挑战。
改善放射报告外行摘要以提升健康素养:评估BioNER与检索增强生成
放射报告术语专业,患者难懂。本研究对比RAG与NER对自动生成外行摘要的影响,发现NER提升可读性,RAG可能引发幻觉,微调BioBERT+NER效果最佳。
NE-R1:基于强化学习的命名实体识别模型增强
提出按需检索与两阶段强化学习的NER框架,多维奖励平衡参数与外部知识,提升长尾实体识别,多基准F1平均提升2.52%/1.18%。
先搭台,再念词:世界观模拟如何增强多轮越狱中的心理说服
结合世界观模拟与影响策略,以MCTS优化18因素,最少查询近满成功率;可执行框架最有效,收益框架强,合法性诉求或反效果。
大型语言模型能否捕捉其训练数据中的多样性?
大模型输出比训练数据条件熵更低,存在条件多样性差距;矩阵熵投影重加权法可后处理校正。
MultiGhostBench:面向分布偏移的多语言长篇幅大模型生成文本归属基准
新归属基准含928本多语种长文书籍。分布偏移下无方法普适;变换器跨语言保留信息,统计法依赖语种。
高效GUI智能体:观察、记忆、动作与运行时优化的系统综述
图形界面智能体系统综述:聚焦观察、记忆、动作与运行时优化,提炼选择性读取等机制,指出验证成本、延迟与隐私挑战。
融合大语言模型与本体排序器的罕见病诊断学习
融合LLM与本体排序器可提升罕见病诊断,保留可核查证据,Recall@1最高提升20.18个百分点。
PragAlign:反馈引导的受控合成对话生成语用对齐框架
PragAlign用生成-评估-修订循环提升多约束满足率,但情感对齐仍不稳定,是主要挑战。
角色属性何时改善大语言模型的群体对齐
提出人类反应差异可解释角色提示效果不一,比较属性选择方法,经大规模评估,指导调查预测中如何选用属性。
大语言模型如何构建虚构世界:AI生成创意叙事中的背景设定与叙事空间
研究对比人机故事,发现人类多用“行动空间”,大语言模型偏重“感知空间”,且差异稳定、随模型和语言变化。
Debias-SparseGPT:面向大语言模型的偏差感知剪枝
提出Debias-SparseGPT剪枝法,在多种LLM和稀疏度下降低剪枝引入的偏差,保持困惑度与零样本精度,兼顾公平与效率。
从词元到语义:利用互补信号检测黑盒大语言模型的幻觉
利用语义熵与词元不确定性的互补信号,提出多种检测法。实验显示无普遍最优,堆叠法近半数最佳,无监督法亦有竞争力。
WinoQueer-NL:评估荷兰语语言模型对LGBTQ+群体的偏见
荷兰语模型偏见研究不足,基于WinoQueer构建文化适配数据集,经43名酷儿验证,评估多种模型,发现跨性别与非二元群体偏见显著。
TaRA:训练感知的低秩适应初始化
提出训练感知初始化TaRA,让LoRA梯度逼近全秩梯度,性能超越现有方法且开销可忽略。
oHC:基于四元数的SO(4)正交超连接
将残差矩阵限制为旋转矩阵,避免放大或衰减,稳定训练,用四元数参数化,性能优于基线。
基于语音和语言多模态分析的老年人孤独感预测因素
利用语音和语言多模态分析能预测老年人孤独感:高孤独感者更多否定与负面语气,多模态模型优于单模态
话语感知的手语词汇翻译:DiscoSign
提出话语感知的手语翻译框架,解决空间共指、问答结构和概念一致性,显著提升话语连贯性,并建立首个系统评测方法。
为每位患者构音障碍ASR选择PEFT变体:基于两种ASR基座的单说话人案例研究
比较7种LoRA法于2基座,注意力投影适配器有效;LoRA与DoRA无显著差异,故选LoRA;存储少而接近全微调。
厘清医学问答中误导性上下文的作用机制
医学问答中,模型对误导性断言比伪造证据更敏感且更难揭露;开放推理痕迹可监测近八成错误决策。
语言模型能够控制自身注意力
提出声明式注意力(DA):模型在思维链中声明关注区域,跳过大部分KV缓存,长上下文任务减少52%关注,精度损失小。
EarlyEval:通过早期结果预测实现更廉价的智能体评估
提出早期结果预测法,提前终止智能体运行,减少13%-26%步骤及大量词元,准确率几乎不变。
轨迹即状态:推理轨迹作为长上下文Transformer的条件状态
在长上下文前放置推理轨迹作为条件状态,可比后置指数级降低最坏内存,并显著提升推理效果。
从重加权到重写:释放训练数据归因中有影响样本的干预效应
影响力函数选中的样本,重加权效果弱,而重写响应能产生更强、持久、双向的行为改变,需干预感知评估。
CORAL:生产环境中推荐系统的LLM原生控制框架
CORAL让大模型智能体闭环调优推荐系统,凭记忆与工具在预算内改配置;A/B实验证明可提升参与或降低成本,且持续进步。
HyperStyler:基于上下文感知风格导航与超网络的低资源作者风格迁移
HyperStyler将低资源作者风格迁移解耦为风格选择与实现,用超网络动态参数调制,仅增2.4%参数超越LLM,速度快1.8倍。
DKL:面向指令调优语言模型的解耦知识学习
DKL对基座模型扩展预训练后与指令模型合并,注入新知识免指令微调,保持指令跟随;检索失败时准确率提升。
大语言模型工具使用中的智能体原生可复用工具原语编排工程
提出工具原语与中心库,构建HEART框架,性能平均提升6%-10%,成本降低85%,任务完成率达84%。
用户反馈提供了语言模型无法识别的独特信号
用户反馈是有效学习信号,因评估偏差看似无用;反馈修正效果优于基线,但语言模型评审常偏好较差答案。
杂乱街道:地理编码真实世界地址的基准
杂乱街道基准:评估杂乱真实地址的地理编码。商业系统召回率比开源高49%,非规范形式可造成25%的召回损失。
RideSkill:一种大语言模型驱动自动演进的通用拼车分层算法
提出分层拼车算法,用大模型自动演化训练技能库、组合器、重定位器,适应场景目标变化,部署无需大模型调用,实时运行。
谁的判断才算数?众包内容审核中的代表性差距导致免受有害内容保护的不平等
基于一万六千余人对十万余评论的模拟发现,审核者人口构成致保护不均:黑人与性少数即使充分代表仍受保护不足。
由匹配器评定排名:威胁报告知识图谱抽取的可复现性审计
知识图谱抽取评分依赖三元组匹配协议,可逆转系统排名;验证效果在线与离线相反。
中文标题:空间准确、时间失真:大语言模型如何表征国家文化变迁
中文摘要:现有评测仅看文化快照,忽略随时间变化。研究用四十年数据发现,LLM虽定位准确,但滞后数年、变化幅度不足,呈现“时间扁平化”,文化意识评估需补上时间维度。
多模态大语言模型中跨模态安全漂移的安全意识迁移
提出安全感知表征迁移法,缓解多模态大语言模型跨模态安全漂移,增强视觉触发危害请求的拒答,保持效用。
ExecRetrieval:度量代码嵌入检索中的功能正确性差距
ExecRetrieval基准:939个Python任务各配执行验证的错误变体,衡量顶级系统exec@1仅0.331,错误常排正确前,揭示嵌入检索的功能正确性差距。
隐私粉饰:检测隐私政策中的内部矛盾
构建四阶段流程与三模型专家小组检测隐私政策内部矛盾跨语料多次重验显示第三方共享矛盾为主且稳定复现
Counter-GEO-Bench:评估针对信息扭曲型生成引擎优化的防御
构建防御GEO误导的基准,现有防御效果有限,新基线C-GEO Guard将攻击成功率降低47.6%且近乎无损。
后训练语言模型以在编程竞赛中取得金牌表现
提出结合SFT、RL与GenCorrect的后训练流水线,在IOI竞赛中超过金牌线,首个超越人类最高分选手的AI系统。
SonicCaps:提升音频检索的大规模多样细粒度音频描述生成
提出大规模音频字幕集:约70万音频配1500万条多样细粒度描述,更细更准,训练检索模型可提升音频检索与分类能力。
ViSAR:面向视觉文档问答的免训练自适应k检索
免训练自适应k检索ViSAR:基于查询相似度矩阵动态选页,降低RAG延迟58.7%,保持或提升精度。
ShallowStream:先浅层索引,后深度作答的流式视频理解
提出ShallowStream,用浅层建索引、深层作答,流式视频理解性能媲美最强方法,单帧预填充延迟降低52倍以上。
语言模型的荷兰赌
基于德菲内蒂定理,用线性规划测语言模型概率预测的连贯性,发现逻辑关系与无关细节会显著加剧不一致性。
增量式池化LLM评估用于经济高效的检索模型选择
增量池化LLM评估复用判断,新系统仅评新增文档,与黄金标准强相关,97%顺序保留,成本为1/4.9。
从检测到特征刻画:日本X平台上引战内容的大规模研究
借助大模型标注并训练集成分类器用于日本X平台帖子发现引战内容多发于争议话题传播更快且引发更多负面情绪
可扩展方向跟随语音合成:基于声音印象引导的伪三元组构建
基于声音印象的可扩展伪三元组构建,无需真实数据即可训练保持音色的方向跟随语音合成,结合真实数据更优。
面向效率的基于Transformer语言模型综述
综述312篇文献,从数据、模型设计、压缩、动态推理及适配策略探讨Transformer大模型效率提升,评估30余模型,助力NLP可持续发展。
SignBind-LLM:用于手语翻译的多阶段模态融合
提出SignBind-LLM,分三个专家流处理手语、指拼与唇读,融合后由语言模型翻译,性能最佳且训练成本低。
DLM-One:一步序列生成的扩散语言模型
DLM-One通过分数蒸馏实现一步生成,省去迭代,提速数千倍,保持文本质量,防退化。
利用大语言模型在奥地利增值税法中进行法律决策:一项比较研究
实验评估微调与检索增强生成在奥地利增值税法决策中的能力,可辅助税务顾问,但未达全自动化。