"What Are You Really Trying to Do?": Co-Creating Life Goals from Everyday Computer Use
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection
HoneyRoute: Honeypot-Model Routing for Adversarial LLM Serving
Copying explains the collective behavior of AI agents in the wild
评分准则引导的大语言模型用于阿片类药物使用障碍可计算表型识别
开发评分准则引导的LLM识别OUD,253例中F1达0.774、AUROC0.934,优于机器学习及零样本LLM,具可解释性。
召回率不是保护:对照模型遵从性评估安全监控器
安全监控器对可诱发模型遵从的有害提示召回率显著更低,漏报提示更易被遵从;标准召回率高估实际保护效果。
MedWER:一种可复现、无模型的医学语音识别评估协议
MedWER以固定医学术语表替代NER模型,避免临床错误被词错误率掩盖,实现可复现医学语音识别评估并报告置信区间。
中文标题:危机话语中方面级情感与情绪分析的五阶段知识蒸馏框架CrisisKD
中文摘要:提出 CrisisKD 五阶段师生蒸馏框架,用大模型标注指导小模型完成危机文本方面级情感分析,提升精度并降低推理成本。
面向共同上下文问答的提示内并行解码
提出IPPD,在单提示内并行回答共同上下文问题,共享注意力计算,无需微调,吞吐量提升7倍且质量无损。
泰米尔语电话语音语义话轮结束检测数据集与模型TamilEOT
发布泰米尔语电话对话数据集TamilEOT(18,485个边界),微调检测器使准确率从70.30%升至86.13%,CPU运行快于150毫秒。
词元如磁铁:揭示语言模型各层中的语言组织
大模型有磁性向量,吸引/排斥词元:功能词早层排斥,任务词元成磁铁,移除不同层磁性破坏语法或语义。
谁在维护智能体技能?人治与AI辅助技能维护的纵向研究
研究发现:技能编辑均由人类账号主导,62%有AI合著;编辑多为内容增改;规则相似性编码不可靠。
强RAG基线下的互补查询重写:协同更优
查询重写单独用不比强基线好,但多种重写互补融合可显著提升RAG;按需路由控制成本,取得增益。
智能体治理何时奏效
提出GAMPO框架:治理收益受模型余力制约;基于案例的完成标准优于通用流程,预授权率升至84%。
AtomCite:多页文档中页面级引用的验证与纠正
提出框架AtomCite,逐条核对引用页图像并修复错误;构建基准DocCite,验证准确率约93%,引用精确率从34%提至87-90%。
同声传译中的动态滞后策略
用稳定前缀微调大语言模型,感知源前缀并推进已定译文;单一阈值优于其他延迟控制,取得更优质量-延迟均衡。
求解与验证:捕捉税务推理系统中的矛盾
税务推理中,模型遇矛盾仍会计算,但验证能捕捉矛盾;一次额外验证可恢复弃权,准确度损失很小。
CONDUIT:视觉语言模型中KV缓存复用的统一残差流恢复框架
提出免训练键值缓存刷新框架,以残差流恢复统一单/多图复用,少量刷新保高质量并显著提速。
SinoGlyphBench:面向语言模型审核的中文字形级混淆诊断基准
中文字形混淆诊断基准测试十二模型:混淆提升漏报误报率,降低准确率,模型仍脆弱。
如果大语言模型自食其词:多轮交互中的历史因果效应
多轮交互中,助手历史有因果效应但具选择性;中和历史文本可显著影响后续表现,并能逆转部分失败。
从叙事到可审计预测:智能体预测的结构化脚手架
提出审计预测框架:用基线模型与赔率空间机械更新替代叙事聚合,提升准确率、校准度与可审计性。
神经元引导的微调:解锁大语言模型的高效对齐机制
提出NGFT框架,以神经元激活为统一信号,协同神经元选择、数据筛选与激活对齐,提升微调效率并缓解灾难性遗忘。
UniRRM:跨语言与评估范式的统一推理奖励模型
提出跨语言统一推理奖励模型,配多语种数据集,支持多种评估范式,性能接近最优,消融验证有效。
AlignDiff:利用模型内在信息优化偏好数据选择
利用模型内在信号筛选偏好数据,先选明确偏好样本,再以平均负对数似然差距选难样本,提升对齐性能。
DPH解析器:一种用于联合成分句法分析的基于语法的自底向上解析器
提出语法驱动的自底向上DPH解析器,联合生成成分和依存结构,结果可解释,虽准确率低于神经解析器,但验证了规则方法的可行性。
文档级翻译评估的盲区
对照实验表明,文档一致性不影响评分、排序或错误标注;失明的是评估协议而非评估者,相关投入或未衡量预期目标。
通过刻板印象对齐:LLM为文化适应牺牲个体独特性
人口统计画像提升价值对齐准确率,却将回答拉向群体中心、牺牲个体独特性,即刻板对齐;规模扩大加剧此权衡。
超越跨语言迁移:多语言大语言模型遗忘传播边界的基准评测
提出CLLPU多语言遗忘基准,揭示通用遗忘不彻底、条件遗忘越界两种相反失效,并公开数据集。
Tri-PvP:通过感知与命题证据冲突揭示全模态大语言模型中的模态偏见
提出Tri-PvP基准,发现全模态大模型普遍存在视觉偏见,且视觉偏重感知证据、音频偏重命题证据,偏见早现且难消除。
依赖长度最小化在神经智能体模拟中涌现的影响因素
研究发现,仅在增量处理压力下,神经智能体才稳定涌现依赖长度最小化偏好,表明人类认知限制可能塑造该偏好。
SurveyAgent-HKA:融合大语言模型与人类知识增强的多智能体科学综述生成框架
多智能体框架融合已发表综述大纲与同行评审意见,分步检索生成科学综述,提升引用质量与结构一致性。
利用GRPO生成机器翻译对抗文本
提出基于GRPO的强化学习重写方法,将WMT25的COMET从0.63降至0.48,保持语义语法,并可泛化至未知基准。
避免检索到生成之间的实体丢失:面向多跳问答的双实体恢复RAG
多跳问答中,查询与语料分解均会丢失实体信息,导致检索与生成环节出错。提出DER-RAG,通过双向查询分解与主语前缀,无需微调即可恢复实体,性能超越强基线。
模块化相位网络:标准Transformer中实现可计算语义层级、方向与上下文一致性的有限循环相位几何
提出用有限循环群量化相位并附加到标准Transformer,可计算语义层级、方向和上下文一致性;无量子硬件,仅理论无实验。
STQA:面向历史与预测数据的股票表格问答基准
提出STQA基准,含4417只股票和31400问答对,测试历史与预测推理,发现大模型预测推理不足。
从两遍到一遍:紧凑高效的目标-立场抽取
单遍联合架构同时预测目标与立场,参数减半,性能仅降4-7 F1;保留显式目标提及可提升F1至少6点,便于应用。
协议压缩改变付费方:跨组织LLM智能体通信中的双边成本
压缩协议因解析失败需额外调用模型,总令牌反增8%-11%;跨厂商谈判虽易达成协议却难完成任务,仅9/135成功,成本因提前终止而降低。
从边缘到联合的通行证:扩散语言模型中一步块生成的耦合噪声蒸馏
提出耦合噪声蒸馏,让扩散语言模型单次前向生成整块;测试中单步合法性大增,不同噪声场生成不同块。
窗口未含之物:审计文档型不稳定性基准中的证据来源
构建基准并审计,发现三十六项证据缺失;剔除后一致性降约五分之一,重切窗口未降不稳定性,仅相关。
不止于标记:临床框架弥合自杀风险测量中的审核差距
审核接口难测分级自杀风险,临床框架零样本提示显著提升精度,应依据分级风险而非二元标记履行责任。
操控几何:验证LLM操控空间中的人类价值几何
分布驱动操控恢复价值几何,行为中心法不行;规模增大提升保真,指令微调降低;几何对齐越好迁移越符合人类。
多模型LLM简答题评分的信度、效度与诊断证据
多模型LLM简答题评分信度高效度佳,诊断模式符合预期,优于传统基线,可作辅助而非替代人工。
SLATE:AI生成的幻灯片教学有效吗?——语言教学质量与学习者知识习得基准
新基准揭示人工智能生成幻灯片的视觉质量与教学效果脱节,教学设计比内容更促学习,前沿模型亦致负学习增益。
纠错即标注:面向中世纪拉丁语文献的依存句法分析器自举训练
专家纠错迭代标注1804句,仅33小时使词性准确率从0.80升至0.98,依存句法从0.48升至0.92,优于基线且训练数据少97%。
跨语言表示对齐的语言无关空间令牌级最优传输
提出CAROT方法,用最优传输在令牌级对齐跨语言表示并保留语言特有信息,显著提升多语言性能与语言一致性。
InsightChain:面向LLM驱动数据可视化的优化链式洞察分析
提出InsightChain四阶段可视化流水线及视觉引导优化方法,新指标IPM,实验优于基线。
DFlow:在块扩散投机解码中实现验证器信息流
DFlow复用验证器在拒绝后缀的隐藏状态,跨轮引导草稿生成,提升解码效率。
SAGE:叙事阐释性文学质量的分层评估框架
SAGE六层框架评估LLM叙事:情感心理接近人类,文化批判与哲学深度差距加倍,甚至不如商业小说。
利用E值发现值得翻译的语言
利用配对e过程,统计受控且随时有效地识别值得翻译的语言,决策可审计,提升分类准确率。