面向自然语言推理的多粒度推理
提出多粒度推理网络,利用分层语义特征交互推理,在NLI基准上超越基线模型。
从评分到解释:评估SHAP与LLM在基于量规的教学质量评估中的理据
提出SHAP与LLM解释框架,发现SHAP在忠实性和可迁移性上优于LLM,适用于高利害教学评估。
预测与重构:自监督语言表征学习的联合目标
混合JEPA与MLM的预训练目标,生成更均匀、语义更丰富的文本嵌入,优于纯MLM。
基于循环一致性机器翻译的多语言共指消解
利用循环一致性机器翻译生成数据,通过反向翻译和BERT相似度加权训练,显著提升低资源语言共指消解性能。
ReasoningFlow:用于理解LLM推理轨迹的话语结构
ReasoningFlow将推理轨迹转化为细粒度有向无环图,发现不同大模型推理结构相似,多数错误步骤不用于最终答案。
语言模型隐藏状态中的轨迹动力学超越惊奇度预测人类处理成本
轨迹外推误差与惊奇度正交,独立预测人类阅读时间,揭示处理成本包含词级预测误差和局部动量敏感性。
当证据稀疏时:对话和LLM-智能体轨迹中的弱监督早期失败预警
提出弱监督注意力方法,从稀疏轨迹证据中预测失败风险,结合α-STOP策略实现可控预警,在多个任务上提升前沿质量3-42%。
可执行模式合同:从自动摄入到多源检索
提出自动发现可执行模式的系统,作为共享合同构建知识图谱,通过多工具检索提升零样本问答性能。
LoRi:面向隐式推理的低秩蒸馏
提出低秩蒸馏框架,对齐轨迹统计量,提升隐式推理性能,接近显式CoT。
基于概率信念追踪的多轮人类可说服性模型
提出PERSUASIONTRACE框架,记录多轮说服中信念变化,发现贝叶斯网络模拟更接近真实人类动态。
The Granularity Gap: A Multi-Dimensional Longitudinal Audit of Sycophancy in Gemini Models
ComplexityMT:文本复杂度与机器翻译交互作用的基准测试
ComplexityMT评估文本复杂度与机器翻译交互,发现高CEFR等级增加翻译难度,且机器翻译改变目标文本CEFR等级。
自监督用户画像生成用于个性化
BUMP自监督框架通过双向批内排序训练生成用户画像,无需下游标签即可提升个性化,性能媲美有监督方法。
用探针目标归因定位大语言模型中的提示模糊性
提出PRIG方法,用探针归因定位提示模糊性,在合成和人工基准上AUROC达0.84-0.89,优于基线。
MASF:面向抽象式文本摘要的多模型自适应选择框架
提出多模型自适应选择框架,整合多个Transformer模型自动选优摘要,在新闻数据集上BERTScore达88.63%,超越大型语言模型。
TensorBench:基于编译器张量框架的编码代理基准测试
TensorBench严格评测编码代理在编译器张量框架上的任务,最优通过率64.8%,代理间一致性低。
基于语音的多语言阿尔茨海默病检测:一种跨语言迁移学习方法
跨语言迁移学习实现多语言阿尔茨海默病语音检测,四种语言F1达82%,推理0.5秒,支持实时全球筛查。
ArcANE:角色扮演语言代理能否在恰当时机保持角色?
提出ArcANE基准评估角色心理轨迹一致性,条件化角色弧策略最佳,微调模型在源文本外场景优势更显著。
InfoShield:基于信息论优化的心理健康筛查隐私保护语音表征
提出InfoShield,优化互信息最小化,在保护隐私同时保持抑郁筛查精度,F1达0.784。
AURA: 面向意图的探测——情境化LLM代理中的隐含需求挖掘
AURA通过意图导向探测,在情境LLM代理中显著提升隐含需求覆盖,同时减少80%以上冗余探测和零违规。
使用大型语言模型支持本科生研究项目的高容量申请审查
LLM工具辅助评审1200份申请仅需4.6小时,将评审时间从数周缩至4小时。
CHASE:使用强化学习的对抗性红蓝队协作提升大语言模型安全性
CHASE通过强化学习实现红蓝队协同进化,使攻击成功率降低43.2%,且对良性提示零误拒。
基于语言特定统计图的域感知发音错误检测与诊断
提出语言特定统计图方法,学习音素混淆模式并捕捉母语背景差异,在L2-ARCTIC上F1达59.52%,优于基线。
AdaPlanBench:在世界和用户约束下评估大语言模型智能体的自适应规划
提出AdaPlanBench基准,测试LLM在逐步揭示的双重约束下自适应规划,最佳模型准确率仅67.75%,用户约束挑战更大。
超越标记:基于LLM的多智能体系统中潜在通信的统一框架
提出潜在通信统一框架,三维度分析18种方法,识别5种设计模式,揭示跨架构对齐等挑战。
普通话自闭症儿童递归处所加工的ERP研究
自闭症儿童递归加工中早期预测减弱,语义整合成本增加,重新分析效率降低,呈级联效应。
当新生成器出现时:基于岭特征迁移的终身机器生成文本归因
提出RidgeFT框架,通过特征稳定的闭式岭回归更新,兼顾旧类保留与新类适应,优于基线方法。
利用执行反馈自举语义层以服务于文本到SQL
GATE方法通过执行反馈自举缺失语义映射,形成可复用记忆,有效提升文本转SQL性能。
QueryAgent-R1:弥合查询生成与商品检索的电商查询推荐
提出QueryAgent-R1框架,通过链式检索优化与RL一致性奖励,联合提升查询相关性与转化率,在线CTR+2.9%、CVR+3.1%。
混合专家模型路由一致性量化的值结构对齐
VSRAQ通过值对齐和结构对齐保持量化前后专家选择一致,减少性能退化,无需额外开销。
大语言模型持续预训练中最优超参数的可预测缩放规律
提出可预测缩放规律,两阶段框架预测最优超参数,减少90%搜索开销,效果更优。
从KV缓存压缩视角重新思考LoRA记忆
文档LoRA在KV缓存压缩时可恢复13-21 ROUGE-L点,作为补充记忆通道,上下文稀缺时价值显著。
名字里有什么?LLM在药理学中的形态学捷径
LLM通过药物词缀推断药理,生成看似合理的虚构临床内容,存在形态学捷径安全风险。
通过风格激发提示解释风格表示
提出用风格提示解释表示,训练解码器生成提示,在风格描述和模仿上优于基线,提供可解释接口。
Narrative Knowledge Weaver: Narrative-Centric Retrieval-Augmented Reasoning for Long-Form Text Understanding
AdaPLD:面向高效无模型推测解码的自适应检索与重用
AdaPLD通过自适应检索与重用,无需训练即可提升无模型推测解码效率,实现高达3.10倍加速。
迈向真正的多语言ASR:将代码切换ASR泛化到未见过的语言对
研究显示,合并的双语CS-ASR模型能适度泛化到未见语言对,但跨语言对迁移能力有限。
MARDoc:用于多模态长文档问答的记忆感知精炼智能体框架
提出MARDoc框架,通过三个解耦智能体与结构化记忆,减少噪声,在多模态长文档问答中取得领先效果。
CollabBench:通过主动参与评估并释放大语言模型与多样化玩家的协作能力
提出CollabBench基准,通过多样化玩家模拟和协作训练,使LLM协作效率提升19.5%,情感表现提升24.4%。
PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models
Can LLMs Be Constrained to the Past? Improving Knowledge Cutoff through Recall-Based Prompting
ProSPy:面向企业文本到SQL的基于性能分析的SQL-Python智能框架
ProSPy通过自动分析与模式剪枝,结合SQL和Python,提升企业级Text-to-SQL准确率。
基于CoRe头部的多模态大模型功能稀疏性机制研究
多模态大模型中CoRe头部作为专用提取器,仅5%即决定性能,利用稀疏性可加速推理。
宽恕或遗忘:理解音频检索系统中的仇恨语境
提出因果去偏框架,通过重排过滤与反事实提示减少音频检索毒性,保持准确性。
ReverseEOL:通过仅解码器LLM中的文本反转改进无训练文本嵌入
提出ReverseEOL,利用文本反转补充上下文,增强冻结LLM表示,显著提升无训练文本嵌入性能。
TARPO: 基于动作路由策略优化的逐词隐式-显式推理
提出TARPO框架,通过动作路由策略优化实现逐词自适应切换离散与连续推理,联合优化提升LLM性能。
使用简单基于图的检索增强生成减少复杂问答中的幻觉(长版)
通过轻量图结构增强检索生成系统,事实正确性精度和召回率显著提升,幻觉数量减半,取得最高细粒度真实性分数。
大语言模型中的忽视零效应分析
通过结构启动实验,发现大语言模型可能不存在人类认知中的忽视零效应。
YouZhi:基于自适应GQA-to-MLA转换的高并发金融大语言模型
自适应GQA-to-MLA转换压缩KV缓存,结合蒸馏与微调,在昇腾上实现金融LLM高并发,并发提升2.4-2.7倍。
评估多模态大语言模型中的随机坍缩与隐性偏差
提出RandomBench发现多模态大语言模型在逻辑中性场景下存在随机坍缩,无法保持均匀随机性。