共享子电路让大语言模型跨任务进行倒计时
发现大语言模型中的通用倒计路子电路,可跨任务追踪剩余token数,并揭示其几何结构与跨模型共享基序。
FinResearchBench II: 一种基于共识衍生黄金评分准则的深度研究基准,用于区分财务报告质量
提出可扩展管道自动生成共识黄金准则,无需人类专家,有效区分10个金融深度研究系统性能。
LakeQuest:跨数据湖的接地问答三领域基准
LakeQuest基准含9846个QA对,覆盖三领域,揭示高检索不保正确推理,暴露跨模态合成关键失败模式。
超越二分类检测:Reddit癌症错误信息的多维分类框架
提出癌症错误信息多维分类法,发现Reddit约6%讨论含错误信息,少样本提示能提升分类性能。
评估低资源语言中的健康谣言:融合小型语言模型与文化敏感的责任自然语言处理框架(以孟加拉语为例)
针对低资源语言健康谣言,提出融合小型语言模型与文化敏感责任NLP框架,孟加拉语实验显示Phi-4最优。
面向文本到SQL的列级访问控制的策略条件约束解码
PCC-SQL通过逐token掩码强制列使用合规,实现0%泄露率、高达88.7%覆盖率,令牌增加不超过10%。
基于QUBO优化的证据选择用于非常规求解器的检索增强问答
将证据选择转化为QUBO优化,平衡相关性、覆盖度等,低能解得紧凑子集,性能媲美LLM选择器,兼容非常规求解器。
诱导情绪是否会偏倚大语言模型在序贯决策中的行为?
LLM能感知情绪,但平均上诱导情绪不显著影响决策;愤怒会降低惩罚敏感性和早期探索。
单词语境普查:44个语言模型答案选择的趋同现象
44个模型从大量选项中选词时41%选"serendipity",趋同显著,但不同模型差异超四倍,最新旗舰最趋同,而人格调优模型最不同。
分离、精炼、整合:将多模态融合分解用于情感分析
提出SeRIn方法,将多模态融合分解为分离、精炼、整合,解耦模态特定与跨模态交互,在情感分析基准上取得最优。
认知立场灵活性探测:测量大型语言模型中提示条件驱动的语域转换
提出ESFP基准测试,发现LLM的认知立场适应性独立于通用能力,立场内容密度是核心指标。
从Critic到Confidence:基于PPO的语言定量预测与置信度估计
CARE-PPO结合置信度估计与PPO微调,实现高精度预测与可靠置信,在医疗金融任务中优于基线并减少过拟合。
使用简洁的机器无关轨迹的语言识别
本文提出用简洁机器无关轨迹实现语言识别,只用小字母表,无需底层机器模型,突破了以往限制。
更少专家,更快解码:面向混合专家模型的开销感知推测解码
提出EcoSpec框架,通过成本感知的草案选择减少专家分散,提升MoE模型推理速度,最高加速1.62倍。
KnowAct-GUIClaw:深度认知与精准执行——具备自进化记忆与技能的个人GUI助手
KnowAct-GUIClaw框架通过积累经验实现跨平台GUI自动化,在MobileWorld基准上基于Kimi-2.6达64.1%最佳性能,超越GPT-5.5等闭源模型,且记忆技能可迁移提升8.5%。
翻译作为一种计算高效的桥梁:英文BERT在低资源语言中的可行性
翻译微调英文BERT在多数任务上效果可比或更优,对句法任务和相近语言有效,为低资源语言NLP提供高效路径。
WikiSTAR:揭示科学维基百科文章隐藏历史的系统
WikiSTAR用AI分类科学修订,交互追溯维基百科文章的知识演变历史。
从文字到控件:实现可控的LLM生成
提出可塑提示技术,将偏好转为GUI控件,用户配置引导生成并可视化影响,提升可控性与透明度。
PalmClaw:一个原生手机端代理框架
PalmClaw是手机原生代理框架,可直调设备能力,任务成功率提升11.5%,耗时缩减94.9%。
FAIR GraphRAG:一种面向语义数据分析的检索增强生成方法
FAIR GraphRAG融合FAIR数字对象与图检索,提升生物医学复杂问答的准确性、覆盖率和可解释性。
面向主权企业语言模型的本体增强蒸馏与语境性审计:一项机制证明与负面结果方法的联合研究
本体蒸馏模型性能持平GPT-5但未证明优越;语境性审计无显著信号。
QDEvo:一种用于自动化启发式设计的多目标质量-多样性框架
QDEvo集成LLM与分层自反思,维护语义多样存档,显著超现有方法,发掘高性能高效多样启发式。
LLM能否生成可靠评分标准?实验复现的元评估
首次元评估LLM生成论文复现评分标准,增强设置接近人类基线,但存在偏倚与适应性不足。
无知识语言模型:抑制参数记忆以实现基于证据的语言建模
匿名化实体预训练抑制参数知识,促使模型依赖上下文证据,显著提升问答、验证等任务的鲁棒性与校准性。
评估大型语言模型在多轮医疗对话中处理误解的能力
多轮对话中LLM纠正误解能力从85%降至50%,误差传播导致不安全风险。
中文标题:无参考答案时,LLM裁判易过度宽容
中文摘要:无参考答案时LLM裁判易高估错误回答,加入参考答案可改变判决达85%,需校准。
鲁棒性的错觉:聚合准确率掩盖了任务无关上下文下的预测翻转
任务无关上下文掩盖了模型个体预测的翻转,随机字符即导致性能波动,影响具模型特异性。
缺失之声:音频-语言嵌入模型难以处理否定
现有音频嵌入模型无法区分肯定与否定描述,新框架揭示其严重缺陷,需专门训练。
从成功流程中追溯智能体失败
提出OAT,仅用成功轨迹训练,通过神经受控微分方程建模动态,高效归因失败步骤,速度快、准确度高。
函数感知的中间填充作为编码智能体基础模型的中期训练
提出函数感知中间填充中期训练,提升编码智能体基准性能,并缓解后训练对非编码能力的侵蚀。
基于第一性原理的可提取记忆
通过匹配训练与非训练序列概率校准阈值,区分记忆与预测,验证可提取记忆的可靠性。
学习率门控的GRPO在小型语言-视觉语言模型Web代理中的失败:受控零结果及其机制
GRPO在小模型上无提升,仅在有改进空间时有效;失败归因于学习率门控的双重分离机制。
4B参数设备端深度研究:暴露限制忠实度,检索限制覆盖率
设备端4B模型研究:暴露决定引文忠实度,检索决定覆盖率;提高暴露可提升忠实度,但覆盖率受限于检索召回率。
优化并非万能
优化无法区分文本错误与创新,却已取代传统权威成为语言规范制定者。
GRID:面向企业SQL生成的语法约束解码
GRID基于LALR(1)解析器状态进行语法约束解码,保证语法正确、角色策略与安全审计,每token成本近恒定。
Code-MUE:通过基于执行的语义交互图测量代码大语言模型的不确定性
Code-MUE使用执行语义交互图计算冯诺依曼熵,量化代码LLM不确定性,与功能正确性强负相关(-0.98)。
我们真的需要超过10亿参数的多模态情感语言模型吗?
质疑大模型必要性,提出Light-MER轻量框架,通过知识蒸馏实现高效多模态情感识别,性能优越。
利用大型语言模型学习化学反应机理推理
构建反应机理推理数据集和基准,微调模型达8.3%精确匹配,超越专用模型,增强化学推理。
迷失迷宫:克服长周期自主搜索中的上下文限制
SLIM框架通过分离搜索/浏览工具及定期总结,以低成本、少调用实现长周期搜索性能提升8-6个百分点。
MemOps:长程对话中生命周期记忆操作的基准测试
MemOps将对话记忆重构为生命周期操作序列,通过操作级探针诊断记忆失败模式,超越传统问答评分。
谁给评估者打分?为自我改进的LLM代理共同演化评估指标和技能
提出双重棘轮方法共同演化指标与技能,使LLM代理在没有可靠指标时保留88-110%性能,并通过锚点和审计保障安全。
长出尾巴:提升大型语言模型输出多样性
大语言模型输出缺乏多样性,人类反应呈长尾分布;通过随机采样、多样化提示与模型聚合可改善,但不及人类,影响AI政策与文化多样性。
AI代理能否判断任务难易?迈向复杂度感知的推理与执行
提出E3方法,通过估计、执行、扩展实现任务感知,在保证成功同时削减成本85%、令牌91%、文件92%。
建模故事预期:使用大型语言模型的生成框架
用LLM生成想象的故事续写,提取情感等特征,验证与人类预期和实际结果吻合,并预测读者参与度。
FairCoder:通过编码任务探究LLM在高风险决策中的偏见
提出FairCoder基准和FairScore指标,通过编码任务揭示LLM在雇佣、教育等高风险决策中的隐性偏见。
催化剂代理:基于LLM代理的自主异相催化剂筛选
提出基于LLM的自主催化剂筛选代理,高效发现新候选材料,成功率远超随机筛选。
UXBench:评估AI助手的用户体验
提出首个基于真实用户反馈的AI助手体验评估基准,揭示模型感知与预测能力。
面向大语言模型评估的自适应测试:静态基准的心理测量替代方案
ATLAS基于项目反应理论自适应测试,减少90%项目,保持精度,能力估计可重建准确率。
预测检索!检索增强生成的测试时自适应
提出TTARAG方法,通过预测检索内容动态调整参数,显著提升RAG在专业领域的性能。
一种神经符号方法用于自然语言形式化与验证
ARc服务结合LLM与自动推理,冗余验证策略,实现超99%正确率和近零假阳性。