裕度而非窗口:免训练的逐步骤有损推测解码
提出无需训练的逐步骤推测解码法,动态调整验证规则与草稿树形状,吞吐量最高提升56%,近乎无损。
反例作为智能体自我纠正的反馈
A-CEGIS以反例反馈评估多轮正则修正,四轮内解决90%,最终全解,平均2.7轮,77%稳健。
蒸馏快速嵌入迁移(DRET):基于优先级嵌入迁移的参数高效生物医学领域自适应
该技术从专用大模型向小模型迁移知识,使小模型无需重训即在生物医学分类上媲美十倍大模型,并保持高效。
双形式ASR:面向中文语音识别的语义感知逆文本规范化
提出DF-ASR框架,通过成对监督与序列级目标,同时支持口语与书面形式输出,在中文测试集上优于开源ASR-ITN系统。
统一语境下的语言任务与上下文集成
提出Conformal Relevance框架,用上下文学习与集成构造评分函数,在保证覆盖度时提升简洁性,减少人工提示工程,适用于七项NLP任务。
聆听潜在表征:通过隐藏状态交互在大型音频语言模型中的自纠正语音识别
提出Hybrid Search,利用ASR与基础LLM的隐藏状态交互特征,精准纠正高语义依赖词元,提升语音识别性能。
审思“以LLM为评审”:基于LLM的自动文本生成评估中的评分标准伪影问题
仅凭评分标准文本训练的模型即可预测评判结果,说明评分标准含有评估信号,导致LLM评审可靠性存疑。
Jina-OCR-v1:结合推测解码与稠密可验证奖励的高效文档解析
低算力显卡上的端到端文档解析模型,结合压缩视觉编码与推测解码,采用稠密可验证奖励训练,精度高且速度快。
大语言模型解决上下文知识冲突研究
提出六类上下文冲突和数据集,评测九种大模型仍欠佳;发现早期证据偏好,提出免训练引导法以改善冲突解决。
RL-ADA:一种面向对抗鲁棒企业对话代理的世界反馈框架
无标注RL-ADA以世界反馈驱动代理对抗共进化,银行客服路由错误消除、通过率翻倍,涌现上下文伪装。
SHELF:多任务书目基准测试的合成框架
SHELF提供多任务书目基准,含六万余文档;评测显示稀疏方法有竞争力,但分数不能预测实际目录数据。
老语言学家无处可依:大语言模型-大脑对齐对神经计算构成欠定
LLM与大脑对齐无法确定神经机制,从对齐推出共享计算原理或机制模型存在逻辑、因果和计算欠定。
LexIssue:中国民事诉讼争议焦点识别的基准评测
构建中国民事诉讼争议焦点识别基准,430案例及1303条专家标注,提出生成与分类任务,用法律知识库检索增强。
对多步骤临床大语言模型智能体的反事实公平审计需要实测的逐动作不稳定底限
反事实翻转率单看无意义;同一条件重复运行动作改变8.7%,且因动作而异,须报告逐动作不稳定底限。
将话轮转换与语义解耦:面向基于有限状态机的全双工对话的解耦数据方法
提出解耦数据方法:从真实人人对话学话轮转换,从人机文本配语义,并设计源感知校准损失,兼顾两者。
MemoryLACE:记忆生命周期感知的整合与证据检索
MemoryLACE以稀疏关系建模文本证据生命周期,重构证据单元,性能领先并降耗时66.6%。
提示词中的分析师:LLM金融分析中的角色、检索与记忆偏差
大模型金融分析受用户上下文影响,偏差主要源于解释而非证据检索;缓解策略效果有限且因模型而异。
大语言模型基于规则的上下文学习优于基于示例的上下文学习
研究表明,模型从规则学习比从示例更可靠,额外示例无增益;指令调优增强规则学习优势。
上下文泰米尔语拼写与语法校正:基于渐进微调序列到序列Transformer
提出渐进微调mT5/mBART的端到端泰米尔语句级纠错法,分四阶段处理噪声、语法、sandhi,最佳模型精确匹配率达69.3%。
SWIM:基于熟练度条件生成的学生写作模拟
提出SWIM任务模拟学生写作:仅提示控制有限,监督微调与强化学习显著提升各写作特征对齐,但真实低水平写作仍难复现。
PACE:揭示用户请求中的隐藏冲突
提出PACE数据集与PaceMaker多智能体框架,用于发现用户请求中隐含冲突并检索关键证据,性能优于现有方法。
SGD-KV:摘要引导的KV缓存压缩
SGD-KV:摘要引导识别关键注意力头,KV缓存压缩率最高75%,支持百万上下文。
还有什么需要修复?探索对话生成产物中修订传播的高性价比测试时计算
针对对话生成产物,新基准评估九种修订法;最优为并行采样三次后选优,提升准确率2.2-9.7%
少即是道德:一种用于支持行为中道德基础检测的CHARM框架
CHARM以轻量微调LLM融合道德理由与仇恨信号,跨域检测优异,并揭示新冠疫情中道德一致性与在线支持行为强相关。
FPCO-Dialog:用于视觉语言模型纠正与协作的多轮错误前提基准
提出FPCO-Dialog基准,评估多模态模型多轮对话中重复错误前提下的纠正与协作,揭示跨模型显著差异。
随机注意力:重新思考KV缓存驱逐以实现高效推理
随机注意力不计算分数、随机驱逐缓存,因提示词关键且推理轨迹有冗余,故与最优方法相当且吞吐更高。
基于有据、忠实、一致且可操作理由的可问责AI:VERDICT临床试验匹配案例研究
提出VERDICT,用SMT/MaxSMT求解临床试验匹配,实现政策一致与忠实理由,可问责且准确率最高。
扰动如何传播:大语言模型鲁棒性的多层次分析
分析输出、隐状态、注意力头三层的扰动传播:单一行为或表征指标评估鲁棒性会误导,需多层次。
TabScope:问题自适应的表格问答范围选择
提出自适应表格问答框架,按问题类型动态选择局部或全表推理,实验证明自适应选择效果最佳。
大型语言模型在多大程度上理解孟加拉语习语?
建立首个孟加拉语习语基准及问答数据集,测试多模型在释义、习语定位和含义识别中的表现,结果显示无模型全面占优。
情绪明暗对照:基于评价理论的对比情绪基准
提出对比情绪基准,基于评价理论刻画同一诱因引发的正负情绪;现有模型效果差,但作为训练信号可提升下游识别
Lngram v2:具有可解释离散表示的潜在N-gram记忆
Lngram v2解耦各维度,用分组查询读出与反事实梯度训练,扩至30B并降参,离散ID保留语义。
FrameBench:基于框架语义学的语言理解基准
构建基于框架语义的语言理解基准,检验模型能否区分同一动词在不同语境下激活的框架;小模型有挑战,大模型超人类。
检索何时有益:单轮心理健康问答中的选择性检索
单轮心理健康问答中检索并非总有益,选择性检索优于始终检索,可避免质量下降和安全风险。
知识图谱嵌入的模式过度泛化
提出PogRE方法,用密集线性变换抑制模式过度泛化,提升链接预测性能。
解耦分析与评判:复杂多步创意任务中基于LLM的自动创意评估器
提出CreaEval,将评判解耦为记忆分析与证据评判,降低LLM偏见,创意评估性能提升22.74%。
基于合成语音构建与评估固定音色泰语TTS
用合成语音构建固定音色泰语TTS,设备端运行,性能逼近Gemini。
当用户不主动提问时:对话代理中上下文驱动的记忆检索基准测试
提出LOCOMO-CONV对话记忆基准:对话框架暴露检索差距,强检索并不等于响应质量,隐式查询存在静默接地。
回忆与重加权:利用经验记忆和置信度估计增强多智能体辩论
提出R²-MAD框架,用历史辩论经验校准先验,按可靠性加权,修正多智能体辩论中的共性错误,提升推理性能。
合成数据能将泰文OCR推进到何种程度?
研究合成数据对真实泰文OCR迁移的影响,据此训练Wayu-Paxa-OCR-Zero模型,无需真实标签即可大幅降低印刷与手写错误率,优于更强基线。
语言、语言模型,以及我们谈论的对象
以意大利语模型为例,质疑训练于翻译与合成数据的语言模型是否仍关乎语言,呼吁区分技术产品与语言研究工具。
迷失于重排:语义保持扰动下多语言大模型的结构敏感性
多语言大模型对语义等价的句法重排高度敏感,推理性能显著下降,源于实体-数量对齐中断,缺乏结构不变性。
KhatianDoc:人工验证基准,诊断多模态大语言模型在孟加拉法律土地记录上的失败
构建孟加拉土地记录基准,发现多模态大模型在近四成类别零正确,算术劣于常量基线,证实为能力缺失而非性能差距。
打开思维之窗:通过解析架构的策略
电声作曲中封闭音频处理器主导,损失内部过程可见性。以史罗德混响为例,重建科学方法,构建分析工具实现自觉研究。
超越浅层对齐:后训练方法如何塑造拒答回路与引导稳健性
后训练方法重塑拒答机制,推理增强特有模式;但无一兼顾非脆弱拒答、能力保持与可修正性,安全对齐未成熟。
超越BLEU:重新定义手语翻译基准的倡议
手语翻译中BLEU-4不能衡量真实理解;提出的LLM问答协议更接近人工且稳健,并发现手语注释系统显著更优,BLEU无法反映。
基于大语言模型的类型学特征预测:一种上下文学习方法
利用上下文学习预测语言类型学特征,加入谱系与地理证据后,LLM显著超越基线,且提供可解释理由。
复数指称的电路:大语言模型如何表示和检索单数与复数实体
发现注意力头电路负责复数指称:表征实体、识别复数组合、传递信息;复数代词偏好与人类一致。
“</think>”并不能停止推理:虚假思维链终止分析
注入结束思考标记不总能使推理干净终止,推理会延续至回答阶段(虚假思维链终止);增强标记注意力可缓解。
IndicSafeEval:多语言说服性越狱攻击下大语言模型的安全鲁棒性
为印度语言构建说服性越狱评测框架,发现安全表现随语言和措辞波动,凸显多语言安全评估之必要。