面向高效短文本生成的大语言模型全息特性探究
大语言模型生成初即捕获目标关键词,称全息特性;据此HOLO插件快速提取关键词补全句子,性能相当且高效。
DRIP-R:零售领域现实政策模糊性下的决策与推理基准
提出DRIP-R基准,利用零售政策模糊性构造无唯一正确答案场景,测试显示前沿模型存在根本分歧。
达到临床医生水平的一致性却缺乏临床谨慎:医学AI基准测试中LLM评估者的局限
德国医学开放式基准测试显示,LLM评估者虽与医生一致性相当,但缺乏临床谨慎,且存在血缘偏差。
"别在我家后院":大语言模型揭示线上与线下针对无家可归者的社会偏见
发布首个多领域无家可归者偏见语料库,测评发现大语言模型过度标记邻避、漏检事实性声明,可用于市政偏见监测
什么促成了销售?用大语言模型智能体模拟端到端买卖双方零售动态
提出RetailSim,用大语言模型统一模拟零售全流程,经人类评估与经济规律校验,可复现消费行为,助力策略评估。
低资源印度语言中音频滥用检测的少样本对比适应
利用音语联合模型直接检测辱骂,跨十种印度语超出零样本,接近全监督,仅需少量标注。
AI辅助开源软件提交预审:BOSC 2026经验报告
BOSC 2026用AI预审摘要六项标准,并容器化测试可运行性;评审者认为有用,但需人工核对。
选择零样本意图分类的开源权重语言模型:对41个模型的系统评估
系统评估41个开源模型,3B指令微调可超7B基座,主流基准已饱和,需关注校准与部署效率。
实践中的提示链:自动化学术报告生成的案例研究
提出多阶段提示链方法,用于自动化学术报告生成,成功率100%,ROUGE-L分数优于单次提示。
共情框架:评估跨社会人口群体的AI对齐
评估LLM对新闻框架的情感对齐,发现模型间差异大,领先模型整体对齐但各群体间存在显著差异。
BridgeAlign:架接人文社科领域的偏好对齐
提出BridgeAlign,三阶段偏好对齐管线,经21万样本训练,使Qwen3-8B在17项基准上平均最优,兼顾人类偏好与知识能力,无权衡。
LayerRAG-Bench:智能体检索增强生成的跨层可靠性基准
提出跨层可靠性基准,揭示仅靠模式规范化或证据性评估无法全面修复各层故障。
HSS-Synth:面向大语言模型的人文与社会科学数据合成
提出HSS-Synth人文社科数据合成流水线,生成23.7万高质量指令样本,微调Qwen3-8B超越14个基线,达到新SOTA。
相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解
临床语言模型存在叙事锚定:相同事实不同表述致诊断分歧。NarrativeShield可将其降至近零。
AHA-Memes:面向阿拉伯语表情包中仇恨理解的细粒度多模态基准
首个大规模阿拉伯语仇恨表情包基准:含5K细粒度标注与66K银标,评测多种模型并开放数据。
大语言模型在概率算子上的逻辑推理能力基准测试
提出概率算子推理基准(1.4万提示/15模板),测29模型:多数有独立于逻辑形式的是/否偏好,仅9个优于随机。
ICLE++:面向整体作文评分的细粒度特征建模
介绍带整体与特质评分的ICLE++语料库,用于测试AES模型泛化性及支持多特质、跨提示评分。
SkillSmith:学习组合参数化技能与文本知识
将模型权重视为额外模态,结合文本与参数技能,SkillSmith通过前缀调整实现指令引导的参数合成,显著提升性能。
通用型与专家型大语言模型社交网络中的信念协同演化
专家型LLM使共识偏移翻倍并引发影响力不对称;异质群体模拟需多种底层模型,而非仅角色提示。
自监督语义扩散:像训练参数一样训练技能
无监督自演化框架借鉴扩散模型损坏-重建范式,用人类作品作自监督信号,自动提取技能提升专业生成能力。
超越相似性:中国古典史籍互文性的智能体锚定抽取与专家裁定评估
将互文性抽取转为智能体任务,锚定字符跨度并五维标注;专家裁定基准评估十二模型,扩展至二十四史揭示结构。
可审计知识引导AI系统AWARE-FX,用于衡量企业外汇对冲披露
AWARE-FX是可审计AI系统,将年报文本转为可追溯的对冲披露指标,香港24,909公司年验证,表现稳健,严格分数与外汇敞口负相关。
Harness-G:面向搜索代理的图结构检索框架
提出图结构检索框架Harness-G,将查询生成转为有限动作选择,解决检索别名坍塌,在六项QA基准上平均F1大幅领先。
从单文档到跨文档:大语言模型多粒度事件分析的基准测试
提出多粒度事件分析基准MiGUE-Bench,含四任务,揭示LLM在跨文档事件分析中的不足。
DualAnchor:在无词表手语翻译中保留语言先验并提升词汇保真度
提出DualAnchor框架,通过词级先验锚定和最优传输对齐,保留语言先验并提升词汇保真度,在基准上表现优异。
极简RAG模型:B1ade 335M嵌入与1B参数小语言模型
极简RAG:335M嵌入零训练居首,1B模型经强化学习涌现引用归因,无需显式监督,端到端较微调提升10.8%
ChronoMem:面向大语言模型智能体记忆的版本控制与语义回滚
ChronoMem为LLM智能体记忆提供语义版本控制与回滚,支持自然语言撤销,显著提升回滚后问答与摘要一致性。
先召回再排序:基于相似性引导的Top-K复用实现高效长上下文注意力
提出ReTopK:复用相似查询的历史检索结果,以极少精度损失加速长上下文Top-K稀疏注意力。
LVLMs能否揭示视觉错觉背后的真相?感知与推理能力分析
提出用视觉错觉评估LVLMs,构建基准,发现其推理能力不如所声称的先进。
超越情绪好转:能力维持型情感对话的纵向研究范式
提出能力维持型情感对话(CSED)纵向范式;审计显示95%研究仅求缓解,无一评估能力。
全局稀疏一瞥:免训练自推测解码
提出免训练自推测解码框架,稀疏化可召回键值缓存与熵控推测长度,实现长上下文加速且保持输出分布。
推理共识:基于加权DAG聚合的LLM推理结构集成
提出加权DAG聚合多模型推理链的共识推理框架,优于多数投票基线,并生成可检查的共识推理图。
多模态情感分析的语义对齐结构抽象
提出SentiLLM框架,用语义对齐结构抽象将非语言信号蒸馏为紧凑词元,双流校准建模情感变化,MSA效果优异。
超越借用历史:面向交互式角色扮演评估的个体对齐用户模拟
针对固定历史与评分标准之弊,提出PALATE:用个性化用户模拟器评估角色扮演,生成可解释的用户级评价。
自动监督:用有依据的修订验证实现科学工作流反馈闭环
自动监督利用同行评审记录评估稿件修订是否解决审稿关切,在5.6万篇论文上实验发现证据验证仍是瓶颈,最佳模型仅0.501。
用于设备端上下文学习的无梯度任务条件检索
CoRA无梯度,闭式岭回归对齐候选表示到任务条件空间,低秩基支持查询仅输入,离线索引,无需微调。
大规模记忆解码器:一种预训练的参数化长期记忆
将记忆模块扩至69亿参数,独立扩展预训练记忆比扩大基座模型更高效,以更少参数超越更大模型。
RepBench:将基准编译为大型语言模型的能力表示
RepBench构建能力基准数据层,覆盖94项能力,跨基准评估揭示读出方法与聚合标准影响显著。
FinanceHarness:自主金融深度研究框架
提出金融深度研究框架FinanceHarness与基准FinanceGym,专家验证通过率82%,顶尖模型低于40%,框架提升至32.4%
GGC:面向可靠文本到SPARQL生成的选择性查询纠正
提出生成-门控-纠正框架,仅对高风险查询进行纠正,将查询准确率从90.23%提升至98.33%,同时减少45%推理开销。
RRM:面向长时程多模态推理的经验驱动式反思检索记忆
RRM反思检索记忆从历史轨迹提炼检索策略,仅用当前事实生成答案,在多模态长视频基准上超越SOTA。
LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR
LEEPS利用潜在引导平衡探索-利用,筛选提示减少无效生成,在数学推理及泛化任务上提升性能,开销极小。
重新思考LLM评判的有用性作为教学信号:跨辅导模型的预注册审计
通用有益性评分不可靠且随评判者反转,教学评分排序稳定,应结合确定性过程指标。
FinSMART:面向算法交易的市场对齐强化学习金融情感分析
提出首个市场对齐强化学习金融情感分析框架,利用实际市场结果优化信号,收益较基线提升220%,支持动态再训练。
人类与大语言模型标注中的挑战:以评价性语言为例
大语言模型标注评价性语言表现优于新手、接近专家,微调F1达0.77,可辅助复杂标注任务。
智能体能否欺骗?——利用社交推理游戏评估 ParliamentBench 中的推理与欺骗
提出ParliamentBench基准,基于社交推理游戏评估大模型,前沿模型欺骗能力强,但多数模型欺骗一致性不足五成。
公平性剪枝:通过差分激活定位GLU-MLP层中的人口统计偏差
提出公平性剪枝,定位LLM中人口统计偏差神经元。零化少量神经元可扰动偏差但方向不定,几乎不损模型能力,证明偏差与能力可分离。
保真不是安全:轻度压缩大模型通过所有无数据质量检查,却在智能体执行中虚构操作步骤
轻度压缩模型通过困惑度、MMLU和保真度检查,却会虚构操作步骤;低秩压缩特有,可用双轴统计筛查。
MADRS流程:支持临床试验中的抑郁症评估
构建音频转文本的LLM流程,映射MADRS十项症状并评估严重度,与专家评级相关性达0.867。
基于倒置自注意力的多变量时间序列因果发现
提出倒置自注意力因果发现框架用于多变量时间序列,强调潜在间接因果,配合全局算法与验证模块,优于现有方法。