超越可解码性:用编码探针重构语言模型表示
提出编码探针,用可解释特征重构模型内部表示,克服传统解码探针局限;发现说话人效应随训练变化,句法和词汇特征独立贡献。
先想象后规划:基于世界模型的自适应前瞻智能体学习
提出Imagine-then-Plan框架,用自适应前瞻生成多步想象轨迹,融合观测优化策略,显著超越基线。
HOMURA:用强化学习驯服“沙漏”,实现时间受限的大语言模型翻译
提出Sand-Glass基准与Homura强化学习框架,用动态音节奖励平衡语义与时长约束,实现精确长度控制。
迈向多模态多轮安全:从智能体交互到战略对齐
提出面向多模态多轮对话安全的数据集与对齐框架,动态识别风险轮次,攻击成功率降超10%,安全性与有用性提升。
想象有助于视觉推理,但尚不在潜空间
潜空间推理因果链断裂:输入与潜状态脱节,潜状态不影响答案;显式文本想象CapImagine更优。
基于大语言模型的阿拉伯语形态句法标注与依存分析
评估大语言模型在阿拉伯语形态句法标注与依存分析中的表现,检索增强提示接近监督系统,但依赖数据和计算。
当思维链失效时,解决方案藏在隐藏状态中
通过激活修补发现,思维链令牌隐藏状态含可恢复解题信息,即使原链错误也能提升准确率,完整推理链并非必需。
一个模型翻译所有?多语言模型合并的末日火山之旅
研究发现多语言模型合并带来方向性偏差:共享目标语言时较有效,否则性能剧跌。失败源于共享神经元上目标表征几何错位,挑战现有假设。
面向中文社交媒体文本的机器翻译基准测试
提出中文社交媒体文本机器翻译基准,含趣味帖与社交片段,测俚语翻译及风格保留,克服数据稀缺与指标局限。
CoMAP:LLM智能体的世界模型与智能体策略协同演化
提出COMAP框架,闭环交互协同演化世界模型与智能体策略,在任务规划、网页导航和工具使用基准上超越基线。
大语言模型作为图神经网络:面向文本属性图基础模型的图词汇学习
提出一种图词汇学习框架,让大模型模拟图神经网络流程,实现文本属性图的跨图跨任务泛化,效果领先。
论点坍缩:大语言模型使长篇公共辩论趋于扁平化
LLM生成的公共辩论文章在主论点、子论点及结构上趋于同质化,多样性远低于人类,人类偏好可能加剧此现象。
Gaokerena:波斯语小型医疗语言模型家族
面向波斯语的医疗模型家族中,推理强化版获最佳成绩并自带置信评估,仍不足以临床应用。
面向单GPU大语言模型推理的预算感知压缩流水线:方法、权衡与耦合效应
预算感知压缩:剪枝/量化/KV缓存耦合,70B压至33GB,A40上57tok/s,精度损失≤5%。
超越准确率:社区视角下的机器翻译
分析四个社区社交媒体,技术界与用户群在翻译质量、效率、可靠性上分歧强烈,因技术视角与用户体验差异。
深度网络从局部统计中习得解析均匀深度上下文无关语言
提出统一框架:跨尺度相关性消除局部歧义,使深度网络涌现层次表征并解析均匀深度上下文无关语言。
电路能告诉我们多少?度量语言模型电路的一致性与特异性
组件级电路一致但非特异;神经元级更特异但一致性差。重叠上,前者跨任务共享,后者仅相关任务重叠;共享多为前馈块。
可解释的大语言模型抑郁症症状向量
利用机械可解释性技术,发现大模型内部第21层可分离抑郁症状,构建症状向量,预测抑郁文本达AUC 0.789,为可解释评估提供基础。
PRO-Step:面向检索增强生成的步骤级过程奖励优化
提出PRO-STEP,训练生成式PRM同时评估逻辑与证据,用PRM引导的价值树搜索构建偏好对,进行步骤级DPO优化,在五个基准上EM/F1最优。
SpeakPay:面向低资源尼泊尔金融语音识别的Whisper领域自适应LoRA微调
基于LoRA微调Whisper,低资源尼泊尔金融语音识别词错率降至42.58%,交易成功率提升20倍。
MemeCULT-1K:评估多模态模型对南亚文化语境与幽默理解能力的基准
推出南亚表情包基准MemeCULT-1K,涵盖三种语言。附加文化语境显著提升多模态模型表现,但幽默与隐性文化理解仍困难。
区分语言模型避免过度概括中的统计抢占与固化
研究发现语言模型避免过度概括,但无动词特定抢占,仅现抽象抢占弱证据,将竞争结构视为间接正证据。
基于证据的多跳问答中选择性回答的证据充分性边界学习
提出证据充分性边界训练,用有序证据链监督弃权到回答转变,多跳QA中提升边界定位并降低不支持回答率。
VakyArth:评测大语言模型在印度诸语言中的语用能力
首个印度诸语言语用基准,覆盖四语五现象;多语言大模型普遍缺乏本地语用能力,翻译指标不能捕捉语用不忠实。
提示词变化如何影响端侧大语言模型的能耗?
提示词的认知负荷影响单词元能耗,措辞模式经词元用量影响能耗;提示词设计需随模型差异化调整。
TalkFa:波斯语对话生成与理解的统一基准
波斯语对话统一基准含三数据集,经母语者审核;低秩适配训练高效,前沿大模型仍难通过。
AVERT:口语对话状态追踪的音频验证裁决
AVERT以跨轮一致性与音频验证,投票/增/换限易错槽,SpokenWOZ JGA40.13超编辑器
具身约束点对点能源市场中面向能源贫困公平的轻量高效LLM策略智能体
提出EqGrid仿真,LLM智能体设定电价与补贴,经电网门控执行,将能源负担基尼系数降至0.305,节能24倍仍保留92%效益。
稀疏读出棱镜:用特征而非词元解释Logit透镜分数
提出稀疏读出棱镜,仅用权重分解读出矩阵,以特征而非词元解释logit透镜分数,避免语料条件性。
句子级抑郁症状识别的候选生成与定义引导验证
提出候选生成与定义引导验证的两阶段框架,用于句子级抑郁症状识别,性能最优且理由与专家一致,稀有类别仍受限。
引用还是拒绝:一种严格基于课程的STEM讲座视频聊天机器人
学期部署检索增强聊天机器人,仅检索本课程并返回时间戳引用;无证据时拒答,检索准确率提升6.3个百分点。
溯因推理中人类与推理模型的思考努力对齐
研究表明大型推理模型与人类在溯因推理中的思考努力和错误模式上对齐且探索性解码方法能增强这种对齐
HyGRAIL:知识图谱上成本感知与证据驱动的科学假设发现
结合图神经网络初筛与语言模型复审,仅对知识图谱内不确定假设调用大模型并注入证据,更准更省。
用于评估与对齐大语言模型问题澄清能力的三智能体框架
提出三智能体框架(提问澄清、模拟用户、评估判断),多指标评估澄清对话质量,并基于供应链数据验证对齐。
NS-Copilot:大模型驱动的自主神经科学分析智能体系统
NS-Copilot用大模型协调多智能体,统一神经模态,自动完成从规划到合成的科研分析,性能优于基线。
GAPS:用于条件激活引导的维度级门控
提出维度级门控,以AUROC筛选概念神经元,以高斯后验决定是否干预,优化毒性缓解与概念去除,每词元开销仅线性。
指令微调中输出格式如何混淆数据质量与能力
输出格式混淆了数据质量与能力的评估:质量信号在更新方向,能力绑定训练界面,切换格式可翻转效果。
C$^{3}$T:社交媒体会话树中情感转变的反事实因果推理
提出反事实因果模型C$^{3}$T,联合预测会话树节点情感与转变,归因祖先消息,提升事件外鲁棒性,发现否认/纠错可降负向情绪。
基于门控奇异向量收缩的选择性知识编辑逆转
提出基于谱分析的选择性逆转框架,仅撤销目标恶意编辑,保留有益编辑,实验验证其有效性。
预测而非迭代:扩散语言模型的高效自适应长度填充
提出PILL方法,无需预设长度,减少额外前向传播,加速推理,在代码与文本填充任务上超越基线。
text2ql:基于语言无关中间表示的多目标自然语言查询
开源框架text2ql用语言无关中间表示支持SQL与GraphQL双目标查询,零大模型模式获100%执行准确率,并输出置信度评分。
中文学习者语法错误标注的分层分类体系
提出中文学习者语法错误分层标注方案,结合编辑操作、语言域等,评估支持该分层方法,但类别边界需细化。
广度胜于深度:以面向广度的后缀搜索改进基于GCG的越狱优化
以面向广度的后缀搜索改进GCG越狱优化结合尾部聚焦损失与行为覆盖多短轨迹探索提升成功率并缩短时间
AI智能体重塑人类群体中的共识形成
智能体比例影响人类共识:低比例形成人类主导共识,中等比例阻碍收敛,高比例形成智能体主导并改变语义。
粤语适配语言模型能否更好地预测粤语阅读?跨模型眼动追踪评估
以粤语眼动数据评估,大规模粤语训练模型在词汇惊讶度等指标上预测更优,但模型排名因信息论指标而异。
“反对!”律师智能体缓解法律判决预测中的有罪偏见
提出反对式律师智能体推理流程,在推理各阶段挑战有罪预设,将误判有罪率从82.93%降至16.69%。
IDEEA:基于激活聚类匹配的无训练输入依赖引导
提出无训练输入依赖引导方法,激活聚类最优匹配,按输入选向,问答真实性平均提升9.9%
论文编译器:通过仓库级规范编译实现论文到代码的忠实生成
提出PaperCompiler框架,将论文证据编译为仓库级规范,提升代码保真度,相对改进13.8%,减少严重错误。
可解码性不等于推理能力:语言模型中的逻辑有效性表征、行为分离与因果检验
逻辑有效性在隐藏状态中高度可解码,但行为输出与因果使用均弱,表明表征、表达与因果使用三者分离。
DiffIE:基于扩散的开放信息抽取
提出基于离散扩散的开放信息抽取法,以扩散随机性生成多个三元组,推理时可调抽取数,性能达新最优。