MedRAGChecker:生物医学检索增强生成的声明级验证框架
提出MedRAGChecker,以声明级验证生物医学RAG输出,结合NLI与知识图谱信号,诊断检索与生成故障,评估安全关键错误率。
StruProKGR:稀疏知识图谱推理的结构与概率框架
提出StruProKGR:距离引导路径收集与概率聚合,实现稀疏知识图谱高效可解释推理,优于现有方法。
DFM Mimir v1:仅用合规后训练数据,1B参数开源HRM实现前沿性能
基于HRM架构的1B参数模型,仅用合规数据训练,英语优异、丹麦语达SOTA,媲美更大模型。
与什么相比?反事实提示的基线与度量
反事实提示需对照改写基线,否则会高估敏感性。提出统计比较框架后,多数声称的效应不再显著。
注意风格:沟通风格对人机交互的影响
友好型聊天机器人提升满意度与任务成功率,但不交互时成功率最高;性别无显著调节,语言适应有限。
LLM生成代码中的库幻觉:基于开发者查询的风险分析
研究揭示代码生成中库幻觉受用户提示变化影响,错拼或虚构库名可致高比例幻觉,并提出评测基准。
Mint-Agent:金融原生的智能体基础模型
Mint-Agent金融原生智能体模型,兼顾可靠操作与长程可审计,在多项金融基准上超越强基线。
当更好的教师未必培养出更好的学生:重新审视VQA中CLIP模型的知识蒸馏
更强教师未必带来更好学生,现有蒸馏框架难扩展,导致VQA等下游任务性能下降,挑战传统假设。
关于阿尔茨海默病检测中的类内变异问题
针对AD检测的类内变异,提出软目标蒸馏与实例级重平衡,估计样本概率以重平衡,提升检测性能并与认知评估吻合。
何时深思:通过测试时训练实现代码生成的适应性计算分配
提出PonderTTT,用TTT重构损失门控触发测试时训练,无需训练,单阈值自适应,代码生成达82-89% Oracle恢复。
LTR-ICD:一种面向排序的自动ICD编码框架
提出LTR-ICD框架,将ICD编码视为分类与排序任务,提升主诊断码排序准确率及F1。
Vibe Coding 安全吗?真实世界任务中智能体生成代码漏洞的基准测试
SUSVIBES评估12种智能体生成代码安全率仅11.8%,加固策略无效,Vibe Coding风险高。
人类级Text-to-SQL:基于验证数据的强化学习,无需流水线工程
用RLVR在干净数据上微调LLM,无需流水线即达人类水平。构建修正61%错误的BIRD-Platinum,提出ReViSQL-BIRD奖励塑形,K2.6准确率92.96%。
RefusalGuard:面向LLM安全的几何保持微调
提出RefusalGuard,在表示空间约束微调以保持安全相关几何结构,避免拒答退化,兼顾安全与任务性能。
RouteScan:基于专家路由遥测的MoE大语言模型非侵入式安全审计方法
利用混合专家模型的路由GPU遥测,非侵入式识别有害行为,跨域AUC超0.91且保护隐私
SafeSteer:局部在策略蒸馏实现高效安全对齐
提出局部在策略蒸馏方法,仅对安全令牌训练,用100个有害样本兼顾安全与通用,大幅降低对齐成本。
STS:基于推测性令牌稀疏化的高效稀疏注意力
STS无需重训,借草稿模型注意力建掩码,约九成稀疏度下加速2.67倍,精度几乎无损。
基于时间序列检索的多模态语言模型剩余使用寿命预测方法
提出时间序列检索增强多模态大模型剩余寿命预测,在C-MAPSS上优于随机基线,但收益依赖模型能力。
文献中生物信息学软件命名实体自动识别
SNAIL混合框架识别生物信息软件/数据库名,优于现有方法,支持大规模文献分析。
面向文本摘要的Transformer模型:BART、BERT与RoBERTa对比研究
综述BERT、RoBERTa、BART等Transformer模型在文本摘要中的应用,分析其架构、预训练策略及对抽取式与生成式任务的适用性。
石油工程师协会实践社区虚拟成员:从原型到部署
ATHENA虚拟助手从原型到部署,支持石油工程师知识管理,提升井规划生产力,已集成SPE门户。
当无关文本起作用:多模态大语言模型中的仿射边际偏移
无关文本会稳定偏置多模态大模型预测,其决策边际呈仿射变换规律,可量化评估模型偏好。
合规性、能力与冲突:系统消息下的多模态大语言模型基准测试
VSysBench基准显示,系统消息侵蚀多模态LLM准确性,开源模型冲突下遵从性崩塌,视觉约束最难。
非对称注意力头:Transformer注意力中的结构化逐头上下文分配
提出AAH,将上下文长度作为逐头分配变量,分层分组分配局部窗口;部分变体优于全注意力,可用于分析诊断。
幻觉是特性而非缺陷:评估一种将推测性语言模型输出转化为可检验科学假设的多智能体架构
多智能体架构将幻觉转为可测试科学假设;直接提示最弱,但并非全面优于自我反思,推测生成需受约束。
NepOOC-M:尼泊尔-英语双语多模态架构OOC检测基准与比较分析
首个尼泊尔语主流OOC多模态基准,含1090对图文,文本模型与多模态性能相当,图像模型接近随机。
被表征却忽视:音频语言模型中韵律使用不足的因果解释
音频大模型韵律信息在内部可解码但最终响应未表达;干预隐藏状态可恢复韵律决策,瓶颈在使用而非感知。
领域偏移下的可靠金融命名实体识别
金融NER领域偏移时,整体输出概率不可靠,实体跨度概率与自一致性更稳健;放弃机制域内有效,极端偏移下失效。
SynFlow:多维历时语义分析工具包
开源工具包,从句法、词法、构式等多维度历时分析词汇语义变化,支持多种距离度量与统计检验。
对话式AI能否松动“我们vs他们”的边界?共同、双重与分离身份框架对支持移民的群体间帮助的影响
对话AI以共同或双重身份框架对话,降低“我们vs他们”分类,提升助移民意愿,但未直接改变行为。
LLMs是否正变得同样有创意?来自三年模型版本的证据
追踪三年模型回答发现,LLM输出多样性显著下降,创意趋于同质化,或削弱人机共创中的人类能动性。
为测试访谈对话系统生成多样化的用户模拟器人格
提出用大语言模型自动生成用户模拟器人格,加入沟通风格特质以提升多样性,实验表明生成话语变化更大。
Hear2Act:基准测试韵律何时应改变助手的行动
韵律在词汇不足时影响决策;音频大模型能提取信息,但需显式文本表征才能改变行动。
语言和乐与统计水印:保义变换的内在几何
核心:幸存信号正比于完好种子窗口数,同保留率下可剩二分之一、四分之一或零;语义相似度是错误统计量。
当机器发声:将机器原生符号融入预训练大语言模型的统一生成框架
UniLang框架将机器符号与自然语言统一为生成单元,跨推荐与法律预测任务优于基线。
利用大语言模型与检索增强生成的金融新闻自动摘要:早期实证研究(2023年秋季)
研究发现猎鹰-7B配合链式摘要效果最佳;RAG在小模型易重复和幻觉,但两类方法均优于Lead-3基线。
用于米佐语自动语音识别的语音语料库:Whisper与SraVaani 1.0微调及形态感知评估
米佐语语音语料微调Whisper与SraVaani,WER18.08%,形态感知7.22%。
SWE-bench Science:编码智能体能解决科学中的工程任务吗?
构建科学软件基准,119任务,最优通过率<50%,揭示四类失败机制,科学知识非总是有益。
仅需训练投影器
仅训练投影器即可让多模态大模型在3D等任务上表现优异,避免语言能力退化,训练吞吐加倍。
一次成功不等于可靠:Thinkingbox——有状态业务工作流中智能体的沙盒与基准
提出Thinkingbox沙盒与基准,含507个有状态业务工作流;最强模型通过率仅65.36%,重复20次仅25.25%,揭示可靠性差距。
快速分叉:高效估计文本生成中的不确定性动态
重采样分析推理链成本高,但不确定性动态趋于稳定,噪声多源于采样。开发统计模型平滑低样本数据,大幅降低采样成本。
PersonalBench:衡量大语言模型个性化中的作者身份差距
该基准检验个性化写作:能区分作者,但相似度低于人类下限,模型指纹主导,无法弥合作者身份差距。
FlashPrefill V2:面向长上下文大语言模型服务的块稀疏预填充注意力
面向长上下文块稀疏预填充注意力,引入均值校正,优化算子支持FP8与分页KV缓存,大幅提速。
利用纵向生命轨迹缓解LLM智能体的身份本质主义
提出人生纵向记忆框架,融合生命事件与参数记忆,缓解身份本质主义,增强多样性与人类对齐。
大语言模型压缩的不对称危害
压缩模型会不成比例地损失头部知识,对错误答案仍高度自信,且掩盖群体间刻板偏见的反向变化,需细粒度评估。
记住、验证还是询问?LLM智能体记忆承诺的跨家族评估
提出基准评估记忆固化边界:模型更擅验证而非询问;少样本提准,策略减误存;须测试标签与工具调用。
ReCache:面向工具增强型LLM智能体的高效键值缓存重用与压缩
该框架独立缓存资源表示,用资源级注意力与剪枝实现键值缓存重用压缩,内存降九成,首词加速近四倍,性能几乎无损。