将研究关注度表示为上下文结构化流
提出上下文结构化流表示研究关注度,比信号和序列更优,支持结构比较与鲁棒性,为研究评估提供新基础。
与不确定性共处:LLM间模拟对话中人工道德顾问的不确定性支架策略
三种不确定性策略提升对话参与质量而非立场修正量。
EMBER:面向长时程智能体的基于预算证据保留的高效记忆方法
提出EMBER预算证据保留策略,在固定预算下显著提升长时程记忆性能,F1从0.1765升至0.3017。
ACE-SQL: 通过经验信用分配实现文本到SQL的自适应协同优化
基于执行反馈联合优化模式检索与SQL生成,双向自适应,以极低令牌开销实现高准确率。
EGTR-Review:基于多智能体教师蒸馏的高效循证科学同行评审生成
提出EGTR-Review框架,通过多智能体蒸馏生成有据可查的评审,效果优且成本低。
更好的文学翻译:一种多维度数据生成与大语言模型训练方法
提出多维度迭代框架,利用LLM生成高质量翻译参考与偏好数据,结合SFT和GRPO训练,英中文学翻译性能媲美Claude。
大语言模型对部分政党感到困惑
研究发现大模型对极右翼政党文本困惑度更高,政治公平性源于预训练,指令微调影响甚微。
多模态与否:通过主动模态检测实现查询自适应的视听人物检索
提出查询自适应框架,利用跨模态分数一致性检测活跃模态,在BBC语料上达94.2%P@1,优于单模态和固定融合。
语言模型中的认识论不公:预训练过滤器和护栏的审计
审计发现预训练过滤器和护栏对边缘群体过度标记,造成认识论抹除,而人类标注者更宽容。
中文标题:测量基于LLM的结构化提取对临床出院小结中提示、模型和模式选择的敏感性
中文摘要:评估LLM在临床文本提取中,不同配置(提示、模型、模式)对输出一致性的影响,发现分歧主要源于“缺失”与“沉默”的区分,以及模型对多类分类的支配作用。
超越对齐:价值多样性作为多元文化智能体系统中的集体属性
提出价值多样性作为多元文化多智能体系统评估新维度,发现其与对齐不相关,且当前系统多样性远低于人类社会。
生成者-消除者悖论:负责任的大语言模型辅助方言资源创建社区指南
LLM加速方言资源开发却可能造成语言消除,本文提出理论框架、12条社区指南及阿拉伯语案例,以保护多样性。
社交媒体立场检测中的上下文提示方法
大语言模型生成目标描述提升检测,但用户元数据和同用户其他推文因噪音损害性能,模型区分上下文能力有限。
利用结构上下文增强实体对齐基础模型
ContextEA通过跨KG交互编码器和结构校准解码器增强结构上下文利用,在29个数据集上超越强基线,显著提升迁移能力。
NAVIRA:面向掩码扩散语言模型的解耦随机重掩码
NAVIRA通过解耦检测与重生成,采用随机重掩码策略,提升文本流畅性与多样性,在LLM评估中表现更优。
多任务学习不足:双输出第二语言语音识别中的表征纠缠
多任务学习改善语义但降低表层转录,源于编码器表征纠缠,需设计缓解框架。
通过多语言迁移学习实现英语到普拉克里特语的机器翻译
通过多语言迁移学习将普拉克里特语映射至印地语标签,实现英语到未支持古典语言的翻译,BLEU提升,但受数据稀缺和方言差异限制。
IA-RAG: 区间代数驱动的时序推理与动态知识检索
IA-RAG以时间区间建模事实,基于Allen区间代数进行时序检索与推理,在复杂时序问答中取得强性能。
SkillComposer: 学习进化智能体技能以实现规范与泛化
SkillComposer将技能构建分解为创建、改进和合并操作,使模型自进化,提升规范与泛化能力。
语音翻译错误的自动标注
提出STEL方法自动标注语音翻译错误,发现纯文本与多模态系统精度约为人一半,直接语音处理必要且两者互补。
LatentSkill:从上下文文本技能到LLM智能体的权重隐式技能
LatentSkill将文本技能转为LoRA权重,减少上下文令牌,提升任务成功率,支持模块化组合。
IR3DE:大型语言模型的线性路由器
IR3DE线性路由器基于岭回归,低成本快速路由,性能优异且支持动态专家管理。
CHALIS:面向困难场景的语言识别挑战数据集
CHALIS数据集聚焦亲属语言与正字法噪声难点,评估四种系统均表现不佳,尤其低资源语言。
针对机构文档中数据快照提取的开源布局检测模型基准测试
提出数据快照提取基准,评估开源模型发现其难泛化至机构文档,存在内容混淆、片段化等不足,揭示实用差距。
Ouvia:面向用户的真实通信场景语音翻译可用性测量框架
Ouvia框架评估显示,真实场景中语音翻译可用性仅约一半,且存在人群差异,QA指标比常规方法更有效预测可用性。
大语言模型能泄露训练数据但甘愿吗?面向倾向性的记忆评估
模型受攻击时可泄露数据,但普通使用下极少,审计应同时报告最坏和普通情况。
使用大语言模型改进基于上下文的问答系统中的答案抽取
微调RoBERTa于SQuAD1.1,提升答案抽取精度,ROUGE-L达86.84%,验证了微调提高问答系统可靠性。
基于FiLM的说话者条件化语音大语言模型用于病理语音识别
利用FiLM向ASR编码器注入x-vector,实现病理语音说话者条件化,效果与微调相当且保持通用性。
征兆范数:$\ell_2$幅度作为大语言模型推理动态的信号
发现隐藏状态l2范数可指示LLM推理强度,据此提出三种测试时缩放技术,显著提升推理性能。
密集上下文是困难上下文:词汇密度限制LLM的有效上下文
词汇密度被忽视但显著影响LLM长上下文性能,高密度下检索得分骤降,有效上下文受密度制约。
多种电路,同一机制:输入变化与电路发现中的评估粒度
电路结构差异未必对应不同机制,实验揭示“幻象特化”现象,需边缘级评估和跨条件测试。
FOXGLOVE:理解专家与大语言模型在议论文写作中的目标导向与锚定式反馈
教师与LLM的写作反馈目标相似,但具体句子选取不同;LLM反馈更复杂且评分更高,优势部分源于长度。
从自我到他人:评估大语言模型在仇恨言论标注中的人口统计学视角采纳
本研究评估LLM在仇恨言论标注中模拟群体视角的三种能力,发现Llama 3.1替代提示最接近人类分歧模式。
EDIT:基于证据诊断的干预训练,实现规则忠实的LLM评分
利用内部状态诊断定位评分错误并修正,通过信念引导训练提升LLM评分规则忠实性,在多个基准上表现优异。
Decomposing Factual Sycophancy in Language Models: How Size and Instruction Tuning Shape Robustness
"Chi nas dal soch el sent de legn"——审计伦巴第语文本语料库
人工审计揭示伦巴第语语料库中网络数据存在严重误识别与噪声,高质量数据偏向西部变体,东部被边缘化,需社区驱动策展。
作为有意识AI方法的涌现语言
提出用多智能体涌现语言研究意识,在任务驱动下智能体自发形成自我指涉通信,因果归因于环境。
科米-亚兹瓦语-俄语平行语料库及零样本和少样本LLM翻译评估协议
首个科米-亚兹瓦语-俄语平行语料库含457句对,评估LLM极低资源翻译,少样本优于零样本但增益有限。
强化学习激发未见语言翻译的上下文学习
提出用强化学习以chrF为奖励,使大模型从上下文提取语言信息,实现未见语言的高效翻译。
修正上下文,转变模拟立场:审计基于LLM的在线讨论立场模拟
通过修订上下文审计LLM立场模拟,发现文本与多模态策略均能有效稳健地转变模拟立场。
CollabSim:基于CSCW的受控多智能体实验方法,探究LLM智能体协作能力
提出CollabSim框架,通过受控实验和内部状态探测,系统分析LLM智能体协作能力,揭示条件效应与模型差异。
基于归一化流的潜在推理
提出NF-CoT框架,在LLM中集成归一化流进行连续潜在推理,保留CoT优势,提升代码生成通过率并降低推理成本。
人类成人与大语言模型作为科学家:谁从主动探索中获益?
主动探索显著改善成人合取因果推理,但合取仍需更多测试;大语言模型推断准确率接近人类,但探索效率较低。
ColBERTSaR:基于乘积量化的稀疏化ColBERT索引
用嵌入量化将ColBERT索引转为倒排索引,索引缩小50-70%且效果不变。
扩散语言模型的自我增强检索
SARDI利用扩散模型丢弃的低置信度token进行前瞻检索,无需训练,吞吐量提升8倍。
只需索引一次:跨层稀疏注意力与共享路由
提出跨层稀疏注意力(CLSA),共享KV缓存与路由索引,实现7.6倍解码加速及17.1倍吞吐提升。
预算受限的微预训练中的分阶段因子筛选
分阶段因子筛选可识别高惩罚方向,确认锚点后局部优化,支持桥梁中心推荐。
操作引导的渐进人机文本转换多粒度AI检测基准
OpAI-Bench发现渐近编辑中混合作者文本比纯人类或AI端更难检测,揭示非单调模式。
大型语言模型中的时间偏好概念及其功能
因果定位LLM时间偏好子图,时间视界几何编码,贴现比人类平缓且不稳定,转向向量可调控。
MIRAI:高影响力学术研究的预测与生成
MIRAI用标题等预测论文影响力,并生成高影响力研究构思,效果优于基线。