谁给评估者打分?为自我改进的LLM代理共同演化评估指标和技能
提出双重棘轮方法共同演化指标与技能,使LLM代理在没有可靠指标时保留88-110%性能,并通过锚点和审计保障安全。
长出尾巴:提升大型语言模型输出多样性
大语言模型输出缺乏多样性,人类反应呈长尾分布;通过随机采样、多样化提示与模型聚合可改善,但不及人类,影响AI政策与文化多样性。
AI代理能否判断任务难易?迈向复杂度感知的推理与执行
提出E3方法,通过估计、执行、扩展实现任务感知,在保证成功同时削减成本85%、令牌91%、文件92%。
建模故事预期:使用大型语言模型的生成框架
用LLM生成想象的故事续写,提取情感等特征,验证与人类预期和实际结果吻合,并预测读者参与度。
FairCoder:通过编码任务探究LLM在高风险决策中的偏见
提出FairCoder基准和FairScore指标,通过编码任务揭示LLM在雇佣、教育等高风险决策中的隐性偏见。
催化剂代理:基于LLM代理的自主异相催化剂筛选
提出基于LLM的自主催化剂筛选代理,高效发现新候选材料,成功率远超随机筛选。
UXBench:评估AI助手的用户体验
提出首个基于真实用户反馈的AI助手体验评估基准,揭示模型感知与预测能力。
面向大语言模型评估的自适应测试:静态基准的心理测量替代方案
ATLAS基于项目反应理论自适应测试,减少90%项目,保持精度,能力估计可重建准确率。
预测检索!检索增强生成的测试时自适应
提出TTARAG方法,通过预测检索内容动态调整参数,显著提升RAG在专业领域的性能。
一种神经符号方法用于自然语言形式化与验证
ARc服务结合LLM与自动推理,冗余验证策略,实现超99%正确率和近零假阳性。
设计上声明式,但仅依惯例可辅助:多智能体框架的AI可辅助性基准测试
惯例对齐驱动AI可辅助性,Agno得分最高(0.55),DSPy最低(0.07)。
Rethinking Evaluation in Retrieval-Augmented Personalized Dialogue: A Cognitive and Linguistic Perspective
数据生成过程中的层次潜在结构统一跨尺度的机制现象
研究发现,语言模型的三个神秘现象由数据生成过程的层次潜在结构、梯度去相关和表示几何凹性统一解释。
筛选推理分数:基于模型最自信轨迹的推理质量评估
提出FRS指标,仅用最自信的推理轨迹评估质量,能区分准确率相同的模型并反映可迁移推理能力。
大语言模型是否自知?基于信号检测理论的元认知效率测量
应用信号检测理论发现LLM置信信号具不等方差结构,元认知效率与准确性反向关联,且具领域特异性和温度解离现象。
面向语音用户界面的隐喻流动对话设计
提出隐喻流动设计,动态调整隐喻适配不同语境,提升用户接受度与愉悦感,但需个性化。
PerfCodeBench:面向系统级高性能代码优化的LLM基准测试
本文提出PerfCodeBench,评估LLM代码优化能力,发现模型与专家实现差距显著,尤其并行和GPU任务。
监督式金融NLP中的测量风险:基于JF-ICR的评分标准与度量敏感性
评分标准措辞改变标签,部分度量失效,需审计可识别度量才能得到可靠排名。
大型推理模型的自适应自蒸馏熵保持监督微调
CurioSFT通过自适应自蒸馏保持熵,增强探索能力,数学推理任务SFT提升2.5-2.9点,RL提升5.0点。
设计即忠实:评估与改进面向多方受众的LLM临床试验摘要
提出LLM临床试验摘要忠实度评估框架,发现“无依据主张”是主要错误,知识图谱增强检索显著提升忠实度。
非英语语言推理的代价:日语案例研究
训练日语推理模型可行,但性能不优于英语基线,且无助于文化相关任务。
工作负载驱动的设备端实时字幕翻译优化
设备端短输入字幕翻译,替换64k词汇tokenizer,嵌入校准与微调,胜率59.2%,速度提升1.63倍。
Index小语言模型技术报告
B站发布开源Index-1.9B小语言模型系列,在多项基准测试中性能优异,媲美数倍规模模型。
CLIR-Bench:对不规则临床时间序列的多模态问答进行基准测试
提出CLIR-Bench基准,用于评估不规则临床时间序列问答,揭示现有模型在稀疏证据推理上的不足。
RouteRec: 推荐智能体选择与聚合的严格评估
RouteRec框架表明,请求级硬选择效果不佳,项目级学习聚合在稀疏固定候选中更有前景。
基于语言模型的全球并购套利预测
结合专家引导与微调,语言模型预测并购套利结果,Brier分数降至0.151,优于市场与XGBoost。
量化大语言模型推理中的隐性失败:基于分类法的空洞收敛与失败模式转移分析
量化后准确率稳定,但推理出现空洞收敛与失败模式转移,标准评估无法检测。
大规模网络抓取语料中鲁棒、可扩展的文本包含检测
FindMyText利用匹配指纹序列链检测文本包含,可扩展至大型网络语料,性能优于现有方法。
高效适配口语语言模型至新加坡语境
提出LoRA微调与多任务适配方法,构建504k多语言QA数据集,5B模型超越7倍大模型,仅损失2%原始能力。
消除尼日利亚金融科技行业的结构性不平等
提出分层人机分诊模型,通过三阶段路由和动态影子价格消除结构性偏见,显著提升欺诈召回率并缩小区域差距。
同等精度,不等证据:搜索API作为工具使用代理的决策界面
三种搜索API准确率相近,但证据经济性差异显著,选择需权衡检索预算与策略。
超图的指令集与语言
提出IsalHG方法,将超图编码为指令字符串,贪心算法生成规范字符串,用于超图同构判定。
语言再生:信息局部性对重构影响的探究
研究信息局部性对语言模型重建自然语言的影响,发现恢复结构偏好更短依存距离,且难度随局部性破坏增加。
PolyInterview:基于大语言模型的沉浸式模拟面试平台与多模态评估
基于LLM的沉浸式模拟面试平台,生成个性化问题并全面评估多模态表现,提供行为证据与可行建议。
极化检测:面向低资源与高资源场景的AfroXLMR-Social与DeBERTa混合方法
本工作用DeBERTa检测英语极化,AfroXLMR-Social处理豪萨语及细粒度子任务,结合LoRA与数据增强,实现高效检测。
PTEI:整合人格特质以增强大语言模型的情商
PTEI框架通过提取人格特质并利用对比学习与链式推理,提升大语言模型情感理解能力,GPT模型准确率提高4%。
共识 vs 异议:群体推荐中主观偏好的动态LLM建模
微调LLM动态选择聚合策略,模拟人类对公平与共识的感知,提升群体推荐满意度。
一个机制对应多种心理空间:语言模型中基于值槽的共享路由器
语言模型通过共享值槽和空间索引路由器,实现了跨心理空间的统一控制机制。
哪些语言最能迁移到瓦勒皮里语?一项基于相似性的低资源ASR研究
结合声学与语言特征的相似性框架,发现声学相似预测微调性能,音位和类型学相似预测零样本迁移。
CAFE:一种复合AI因子评估框架
提出CAFE开源平台,通过因子设计评估复合AI系统组件对答案质量的影响,并分析效应与显著性。
结构化思维:提升推理与上下文剪枝
提出<try>/<outcome>块组织推理,微调提升8.08%性能,上下文剪枝节省85%内存,性能降8.67%。
无元数动作的非二叉自底向上成分句法分析
提出分隔符引导的非二叉树分析,消除元数动作,减少动作库存,性能持平基线,准确保留高元数成分。
用于长文档摘要的逐步提问专家-编辑器多智能体框架
本文提出专家-编辑器逐步提问多智能体方法,通过提问与线索引导改进长文档摘要,实验证明有效。
享受你的对话:一个以人为中心的多轮对话基准,采用解耦的用户模拟、目标建模与评判
EYT-Bench以人为中心,解耦用户模拟、目标建模与评判,发现模型客观意图跟踪差异达9倍。
当推理损害法律起草:专利权利要求生成中的言语化瓶颈
显式思维链导致信息瓶颈,降低专利权利要求生成质量;隐式思维链更优,因其避免关键细节抽象等三种损害机制。
使用转向解码的大型语言模型幻觉检测
提出转向解码法,主动挑战生成过程提取不确定性特征,高效检测LLM幻觉,性能优于现有方法。
清晰直觉还是真正分析?评估LLM作为评委的认知可靠性基准
基于双系统理论构建Kahneman4Review,发现LLM评委决策层级与文本质量不对齐,ICLR评审在LLM普及后出现诊断偏移。
UNIBROWSE: 面向多模态浏览理解的从数据到智能体框架
提出UniBrowse统一数据流水线,覆盖三种信息流模式,训练35B智能体在多模态浏览基准中平均准确率54.4,超越GPT-5等闭源模型。
大规模人口统计提示:更多属性何时损害LLM与人类一致性
高信号属性1-3个提升一致性,过多则降低;效果取决于属性质量、任务和模型。
MafiaScope:用于社交推理游戏中LLM代理的非侵入式、时间分辨信念探测
提出MafiaScope测试平台,通过私密探测揭示LLM代理信念轨迹,发现校准误差0.17,过度预测被怀疑1.5倍。