TS-Reasoner:对齐时间序列基础模型与LLM推理
TS-Reasoner对齐时序基础模型与LLM推理,合成数据两阶段训练,冻结模型,数据高效性能优越。
当上下文推断失败:交互式指令跟随中的可取消性
提出BWIM基准,探究交互式指令跟随中的上下文推断:LLMs虽识别不可靠,行动上仍过度澄清或盲目猜测。
Doc-V*:多页文档VQA的由粗到精交互式视觉推理
提出OCR-free智能体框架Doc-V*,概览粗筛、检索精读、记忆聚合证据;经模仿学习和组相对策略优化,域外性能较RAG提升47.9%。
超越回忆:行为规范作为AI个性化的解释层
定义表征准确性,用行为规范作解释层,压缩数据为上下文,提升预测并消除模棱两可,低基线提升最大,超越原始语料。
缓解生成式AI证据污染以检测脱离语境 misinformation
提出两种策略,缓解GenAI证据污染对脱离语境检测的影响,提升鲁棒性。
重掩码而非替换:扩散语言模型中的词元到掩码精炼
提出T2M:训练无关的推理时修正,基于当前词概率重掩码低置信位置,优于替换,提升扩散语言模型一致性。
询问以求确信:面向自信多轮LLM推荐的信息性交互
提出以推荐熵减为奖励,无需真值,微调LLM以生成信息性交互,提升推荐质量与对话效率。
基于切比雪夫多项式和黎曼度量学习的说话人特征解耦用于深度伪造源验证
提出SDML框架,用切比雪夫多项式稳定解耦优化,黎曼度量距离减少说话人信息,提升深度伪造源验证效果。
从反弹到补救:通过表示工程理解与缓解奖励黑客
发现奖励黑客三阶段反弹,用表示工程提取捷径方向检测,提出优势修正惩罚黑客行为。
Transformer看,Transformer做:复制作为学习类比推理的中间步骤
以元学习组合性训练Transformer学字母串类比,复制任务引导注意力提升泛化,三层模型媲美前沿
NE-BERT:面向九种印度东北部语言的多语言模型
提出NE-BERT模型,覆盖9种印度东北部低资源语言,通过加权采样和专用分词器,困惑度显著优于现有模型。
LongNovel:面向长上下文小说摘要幻觉检测的多尺度基准
提出多尺度中英双语小说摘要幻觉检测基准LongNovel,含8类幻觉,实验验证其挑战性。
九种情感质心:一种无标签的效价轴,可跨四种模态迁移
用九类情感名和每类五十个故事,免标注提取效价轴,跨图像、音频、脑电迁移,达监督性能九三成。
编译器引导的自适应证明搜索与跨模型协同:面向上下文相关定理证明
提出编译器引导的证明搜索框架,平衡探索与利用,在真实Lean4项目中平均通过率提升12.8%,调用减少21.9%。
实体追踪在亚十亿参数语言模型中涌现,并在自然叙事中超越人类表现
研究发现,实体追踪在4.1亿参数模型中已出现,随规模提升,当代模型远超人类水平。
低资源非洲语言的潜在空间拒绝锚定:无需重训练的机制性安全恢复
无需训练,提取英文拒绝方向注入推理,恢复低资源语言安全;稀疏编码变体纠偏,四语有效,阿拉伯语失败,多任务降幅微小。
自我标签与他人标签引发LLM评审的双向偏差
通过叙事约束选择实验,发现盲评时自我偏好消失,但仅贴自我/他人标签即引发分数双向偏差;作者归属是独立偏差源。
SuTRA:词根感知的结构统一分词法
SuTRA保留音节完整、惩罚跨词素合并;边界F1+14.7%,语义恢复+34%,chrF2+8.08。
人格引导的大语言模型智能体用于任务型对话
人格引导的LLM智能体在任务型对话中能保持任务表现;适应用户人格提升满意度但降低真实性,线索式适应最优。
基于拒绝别名的消除拒绝缓解
提出权重编辑法:低秩更新模糊拒绝信号,随机别名替换拒绝激活,校正下游矩阵,提升消除拒绝后的拒答分数。
语言模型和视觉语言模型中的后门学习
探讨NLP和VLM的后门攻击威胁,研究检测与设计,并开发高效多模态表示方法用于临床医学影像。
言语化过度自信的不同面向:一项可解释性研究
大模型常过度自信,尤在输出数值置信度时;不确定性由稀疏专用特征实现,干预可缓解该偏差。
MAVEN:基于紧凑对齐评估器的多模态内容宏观社会价值评估框架
提出宏观社会价值评估框架MAVEN,基于人权与文化理论,对多模态内容多级评分;2B评估器媲美8B并逼近前沿闭源模型。
计算东方主义:用中东文化敏感度评分(MECSS)衡量大语言模型的结构性话语偏见
提出中东文化敏感度评分,衡量大模型结构性东方主义偏见;区域训练模型仍再现,需改变学习来源。
分数衰减KV缓存:面向所有权感知的内存管理以提升对话系统推理相关性
提出FD-KVC缓存算法,双通道评分兼顾历史与近期主题,较H2O平均提升6.7%,适应新话题快3.6倍。
FrenchNews-7:跨出版商的法国新闻编辑部版面分类基准评测
构建FrenchNews-7数据集,微调CamemBERT实现跨出版商法语新闻分类,性能超越零样本LLM。
BERTilda:基于相似度与流动时序图的可解释主题生命周期追踪与分裂/合并检测
BERTilda构建时序主题图,融合语义相似与双向流信号,检测主题分裂、合并、消失等生命周期,标注一致性最高87%。
StocksTalk:面向网络数据结构化查询生成的语音对话代理
语音股票筛选系统,结合检索约束与LLM生成可验证SQL,提升查询准确性与可解释性。
机器生成文本中鲁棒水印检测的稳定性感知特征设计
提出PSS:融合局部统计和稳定性特征,使水印检测在多次改写下AUC提升逾十个百分点,跨域免重训保持高鲁棒。
DeepTCM1.0:基于通用大语言模型解析中药复方机制的多专家智能体
构建多专家智能体DeepTCM1.0,融合中医理论与现代科学解析桂枝汤机制,经双盲五维评分验证有效。
大语言模型何时真正有用?评估其作为数据质量标注器的表现
LLM仅在需背景知识时优于规则基线;强词汇信号下无优势,小样本提示评估易误导。
相同事实,不同更新:推理设置塑造医学分配中的大语言模型行为
研究发现,大语言模型在医疗分配中,对相同新信息的响应因是否包含先前上下文而方向相反。
机构声望作为大型语言模型中的地理偏见:三项因子实验与自举置信区间的证据
大语言模型评估存在机构声望地理偏见:声望与期刊效应主导,国籍无显著影响;顶刊可补偿低声望。
用于Token级幻觉检测的时间多信号融合
将幻觉视为文本片段,融合文本统计、自然语言推理、困惑度等33维特征,用BiGRU序列标注检测,AUC达0.840,适用于闭源及未见模型。
从非侵入性脑记录中准确解码自然语句
脑磁图非侵入式解码自然语句,词错误率39%,数据扩大可提升,AI助力逼近植入式水平。
你即你所提示:农业食品视觉语言模型中的提示词质量、领域偏移与不确定性
ZPE在领域偏移下显著提升农业食品视觉模型性能与校准;PID用提示不一致检测不确定性,改进失败检测。
对齐即一切:通用音频-语言模型的无指令训练
提出仅对齐训练的音频语言模型,冻结编码器和LLM,只学轻量投影器,无需指令,匹配或超越大量后训练基线。
道义缺口:大语言模型与义务的情态语言
AI文本少用正面义务情态词,频率接近正式书面语,人际义务表达弱于当代人类,且存在体裁差异。
葡萄牙语语言模型:系统性映射研究
系统梳理葡萄牙语语言模型,分析46个模型的架构与数据等,并探讨演化关系与未来方向。
叙事熵(Sn)的操作化:两场景注册试点报告与预验证协议
叙事熵首次被操作化:两场景试点,独白得分高于对话,与直觉相悖;拒绝修正公式,预注册区分三种解释。
DART-SD:面向多轮工具调用代理自蒸馏的菱形拓扑感知检索与调优
提出DART-SD,以菱形拓扑感知检索与局部监督自蒸馏,避免全局强制模仿,显著提升多轮工具调用性能。
面向自主科学智能体的制品中心、声明感知可观测性
自主科学智能体需审计,仅日志不够,应输出制品与声明血缘作为最小审计层。
大语言模型中的比喻与文化知识:通过微调探究跨域迁移
在四个模型和阿拉伯语数据上,诗歌微调提升习语理解,文化微调降低谚语准确率,跨域迁移近于噪声。
基于PyTorch原生栈的服务器CPU小型NLP模型高效INT8推理
将平滑量化技术集成至TorchAO,针对英特尔至强优化INT8推理路径,通过图融合和内核选择,实现5.8倍加速且精度几乎无损。
OmniAlign:面向词与句对齐的统一多语言对齐器
OmniAlign是一个轻量统一多语言对齐器,同时支持词级与句级对齐,通过四阶段训练平衡细粒度与长文本性能,在多项基准上达到领先水平。
极端资源稀缺下的西夏文分词:整合传统词典与无标注文本
首次系统研究西夏文分词,融合词典、无标注文本、统计特征和MLM,F1达0.911,超越监督词汇。
大语言模型在文本之外是否安全:表情符号是否暴露安全评估的盲区
表情符号增强提示测试显示,不同LLM鲁棒性差异显著,仅用文本评估可能低估漏洞。
WhiteMatter:通过KV混合实现全对全跨层连接
提出WhiteMatter:将每个词元的所有层表示混合为k个KV通道供各层注意力,控制缓存;性能优于层数多一半的Transformer,KV压缩一半仍保优势。
MissDiag:KGQA与KG-RAG中不完整知识鲁棒性的诊断评估
提出MissDiag诊断框架,将不完整知识鲁棒性按证据类型、系统响应和评估协议分解,而非笼统分数。
心理健康中的教学式AI:用于自动化临床督导与风险分诊的三流微调大语言模型框架
提出三流微调大语言模型自动督导系统,融合治疗联盟、风险预测与督导分诊,准确率95%,延迟从72小时降至实时。