DECOR:通过信息操纵理论审计大语言模型欺骗行为
DECOR框架分解信息单元并多维度评分,生成可解释操纵图谱,高效检测大模型欺骗。
FormalASR:端到端中文口语到正式文本转换
提出端到端模型FormalASR,直接转换中文口语为正式文本,CER降低37.4%,无需后处理LLM,轻量部署。
OpenCompass:大语言模型通用评估平台
提出OpenCompass一站式通用LLM评估平台,支持多领域基准,实现高效并发评估。
解释之困:跨语言解释中合理性与忠实性的权衡
跨语言解释中,英语解释合理但忠实性差(降5.7倍),建议用输入语言审计并报告多维度忠实性指标。
推理是必要且充分的吗?微调大语言模型实现可解释虚假信息检测
提出LONSREX管道,量化验证步骤贡献以精炼推理,解决理由不足或多余问题。
LambdaPO:面向推理语言模型的Lambda风格策略优化
LambdaPO通过成对偏好比较和语义密度奖励,从轨迹组中挖掘细粒度信号,提升推理模型性能。
检索增强的语言校准
提出语言置信度分布建模与忠实度散度指标,构建检索增强后处理管道RALC,提升校准与忠实度达66%和58%。
A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item Generation
HalluWorld:基于参考世界模型的幻觉可控基准
提出基于参考世界公式的可扩建基准,自动生成标签,发现前沿模型感知幻觉近解,但多步追踪和因果模拟仍难,失败模式多样。
文档解析器如何失效?文档智能中的结构脆弱性审计
提出结构脆弱性审计框架,发现B-SLR比足迹更能衡量扰动影响,小结构目标扰动同样导致下游任务降级。
IMLJD:印度婚姻诉讼分析计算数据集
涵盖3613份印度法院判决,发现最高法院撤销率57.6%高于高等法院39.7%。
SciCustom:面向大型语言模型科学能力自定义评估的框架
SciCustom通过本体知识单元与多模型投票共识,从大规模数据自定义构建基准,无需人工标注即可揭示LLM科学能力的细粒度差异。
驯服思考者:条件熵塑造实现自适应LLM推理
提出条件熵塑造框架,动态控制响应熵,在简单问题生成简洁解,难问题鼓励深度探索,提升准确率并缩短响应长度。
EmbGen: 使用重组语料进行教学
EmbGen分解重组语料生成QA对,在异构数据集上准确率提升最高88.9%。
K-量化及其对输出性能的影响
研究8个LLM在2-6比特量化下的性能,发现高精度收益递减,激进量化损失有限,但影响因模型和任务而异。
偏离即回溯:缓解大语言模型推理蒸馏中的双重暴露偏差
MOTAB动态监测学生推理,偏离时回溯纠正,缓解双重暴露偏差,提升推理性能约3%。
m3BERT: 一个现代、多语言、嵌套式双向编码器
m3BERT通过联合优化层与嵌入维度的预训练策略,实现单模型适配多种资源与精度需求,在工业检索中显著超越现有模型。
GoLongRL:面向能力的长上下文强化学习与多任务对齐
开源23K样本覆盖9种长上下文能力,TMN-Reweight优化异构奖励,性能超越闭源数据集。
基于理论语言学专家标准的习语性数据驱动方法
分析286个多词表达,基于16项专家标准,发现无绝对习语,词汇标准最关键。
优化一切:用于优化任意文本参数的通用API
首个LLM优化系统实现跨六类任务最优,证明文本优化是通用问题解决新范式。
LLMEval-Logic:一个求解器验证的、具有对抗性加固的中文大语言模型逻辑推理基准
LLMEval-Logic中文逻辑推理基准含246基础与190困难题,经求解器验证和专家审计,评测14模型最佳准确率仅37.5%。
基础模型在AI检测器眼中被视为人类
基础模型文本常被检测器判为人类,HIP迭代释义法有效提升人性化。
用于精炼离散扩散语言模型的漂移目标
TokenDrift漂移目标可提升离散扩散模型生成质量,在MDLM和DUO上分别降低Gen.-PPL达89%和86%。
探究跨模态技能注入:场景、方法与超参数
研究跨模态技能注入的场景、方法与超参数:指令遵循和跨语言场景表现优,数学推理差,TA和DARE方法最佳,定量分析超参数调优。
LP-Eval:衡量法律命题生成质量的评估标准与数据集
LP-Eval评估标准与数据集显示:LLM生成法律命题质量高,但专家评估发现案例时效性影响,且LLM评估缺乏细粒度。
基于大语言模型的阿拉伯语金融情感分析:来自沙特市场的证据
针对阿拉伯语金融情感分析挑战,构建多源数据NLP框架,在沙特市场实现可靠可扩展的情感分析。
大型语言模型能否可靠纠正低资源ASR中的错误?一项关于西弗里斯兰语的污染感知案例研究
研究用污染感知实验证明LLM生成式纠错可提升低资源弗里斯兰语ASR,最佳结果超越oracle WER。
TERGAD:面向图异常检测的结构感知文本增强表示
利用大语言模型将节点拓扑属性转为语义嵌入,与原始特征融合重构,有效检测图异常。
CAIT:面向儿童-成人互动的句法分析工具包
基于CHILDES语料库,训练专用依赖解析器,并发布词性标注和结构标注工具,助力大规模语言习得研究。
大型语言模型中的数学推理:基准、架构、评估与开放挑战
综述LLM数学推理,涵盖基准、架构与评估,指出推理忠实性等挑战及改进方向。
长期病史感知型医疗对话的合成与评估
提出合成长期医疗对话框架,创建数据集MediLongChat,设立三项记忆基准任务,实验显示顶尖LLM仍难应对。
社交互动代理中的信任校准:基于LLMs的性别化多模态行为生成研究
LLMs可生成体现能力与善意的多模态行为以校准信任,但存在性别刻板印象,用户研究验证有效性。
ContextRAG:免提取层次图构建方法用于检索增强生成
ContextRAG免提取构建图结构,索引仅需30次LLM调用,性能达33.6%F1,成本远低于基线。
德语法典的分块策略
研究德国法律文本分块,发现基于结构(章节/分段)的简单方法召回率最高,复杂方法效果不佳,凸显保留领域结构的重要性。
重新思考记忆方式:超越原子事实的终身LLM智能体记忆
提出TriMem,维护三种粒度记忆表示,结合提示优化,实现终身记忆进化。
奖励信念,而非行动:一致性引导的长期智能体信用分配
ReBel算法通过信念一致性监督和信念感知分组,在部分可观测长期任务中提升成功率20.4%、样本效率2.1倍。
CLIF:面向透明瓶颈模型的概念级影响函数
提出概念级影响函数,无需重训即可识别关键样本与概念,恢复模型性能,提升可解释性。
工具总是有益的吗?自适应调用工具的双模式多模态大模型推理
提出AutoTool模型,自适应决定是否调用工具,提升准确率21.8%,效率提升44.9%。
What Are LLMs Doing to Scientific Communication? Measuring Changes in Writing Practices and Reading Experience
基于编码器的语言模型中,作者身份信号出现在哪里?
评分机制决定作者身份信号位置:平均池化集中在前中期层,后期交互则在后期层,造成四倍性能差异。
关注音拍:基于正字法意识的日语神经形态生成错误分析
对日语过去式形态生成的错误分析发现,送气音变相关错误占75-80%,且模式高度一致,凸显正字法意识评估的必要性。
语言突变维持社交媒体上阴谋论的持续传播
研究表明,语言突变(语义与心理语言学特征)显著延长阴谋论传播寿命,存在简化和同化两种模式。
FlexDraft:通过注意力调优与奖励引导校准的灵活投机解码
FlexDraft通过注意力调优和奖励引导校准,实现灵活投机解码,在批量大小变化时避免质量下降与吞吐量崩溃。
PromptRad:面向低资源放射学报告标注的知识增强多标签提示微调
提出PromptRad,用提示微调和UMLS知识增强,仅需32例标注即可高效进行放射学报告多标签标注,性能优于传统方法,媲美GPT-4。
TIDE:基于I/O感知专家卸载的高效无损MoE扩散大模型推理
TIDE利用专家激活时间稳定性,以I/O感知策略实现无损加速,吞吐量提升1.4-1.5倍。
基于强化学习的文本到SPARQL生成:DBLP上的GRPO方法
使用GRPO强化学习训练小模型零样本文本转SPARQL,优于零样本基线,但监督微调更准确。
MixRea:评估大语言模型显式与隐式推理能力的基准
受人类“不注意盲视”启发,发现最佳大模型在显隐推理中仅42.8%一致性,提出PRCP方法改善。
中文标题
ThoughtTrace首个大规模用户思维数据集,揭示人机对话中隐藏的认知动态,提升行为预测与个性化。
BalanceRAG:级联检索增强生成中的联合风险校准
BalanceRAG联合风险校准优化级联RAG阈值,在控制错误率的同时提高覆盖率并减少不必要检索。
CopT:面向通用与智能体推理的连续空间对比策略内思考
CopT反转思考与回答顺序,通过连续嵌入对比验证答案可靠性,无需训练,准确率提升23%,token节省57%。