ARC-Encoder:学习大型语言模型的压缩文本表示
ARC-Encoder通过编码器将上下文压缩为连续表示,替代token嵌入,减少推理成本,保持性能并兼容多个解码器。
集成LLM诱导的决策树以实现可解释且鲁棒的错误检测
利用LLM诱导决策树集成进行表格错误检测,可解释且鲁棒,F1提升16.1%。
MemAgent: 使用基于多轮对话强化学习的记忆智能体重塑长上下文大语言模型
MemAgent分段读取并覆盖记忆,扩展DAPO算法训练,超长文本性能损失<5%,512K测试准确率超95%。
自然视频与虚构对话中的统计规律与语言学差异
视频聊天与电影对话中,Heaps定律的词汇缩放因词类而异,反映沟通效率差异。
AgentSnare:学习延迟、转移和化解自主渗透代理
AgentSnare动态构建诱饵环境,吸收工具调用、转移轨迹、诱导完成报告,有效阻止真实目标被攻破。
AMEND++:临床试验中入组标准修订的基准测试
提出入组标准修订预测任务,发布AMEND++基准套件,采用CAMLM预训练策略提升预测,助力临床试验设计。
上下文如何塑造真相:LLMs中句子级真相表示的几何变换
LLMs中真相向量随上下文变化:中层对齐,上下文增强真假分离,大模型通过方向区分相关性,冲突知识引起更大变化。
将省略三段论中的隐含前提显式化
提出LLM与SAT求解器结合的流水线,自动生成并验证省略三段论的逻辑蕴涵。
MICA:面向长程情感支持对话的多粒度跨期信用分配
提出无评论家RL框架MICA,用增量距离奖励结合蒙特卡洛回报实现多轮情感支持对话逐轮优化,显著提升性能。
DialectLLM:超越标准美式英语的方言感知对话生成框架
DialectLLM生成多方言对话数据,揭示LLM不应复制方言语法特征,基准测试显示方言识别准确率低。
即时技能:面向LLM智能体的测试时自适应技能合成
提出SkillTTA方法,通过检索训练轨迹合成临时技能并优化提示,在多个基准上以更低计算成本实现更高性能。
LAMUS:使用大语言模型从美国判例法中提取法律论证的大规模语料库
提出LAMUS语料库,利用LLM自动标注与人工验证构建高质量法律论证数据,链式思维提示显著提升模型性能。
CustomerSim:多模态零售用户模拟器的基准测试与对齐
CustomerSim评估多模态模型模拟零售用户行为,发现模型角色易偏离,提出UserGRPO强化学习将决策对齐提升23.5点。
VideoNorms:评估视频语言模型文化意识的基准
VideoNorms数据集通过中美电视节目文化规范标注,发现模型在中文文化及非语言证据方面表现不佳,视频模态必要且扩大模型无提升。
ASCD:注意力可引导的对比解码方法用于减少多模态大模型幻觉
提出ASCD,通过正负注意力引导,无需训练即可降低多模态大模型幻觉38.2%,并提升VQA准确率。
DP-MGTD:通过自适应差分隐私实体清洗实现隐私保护的机器生成文本检测
提出自适应差分隐私实体清洗方法,利用噪声增强人机文本区分性,实现高精度隐私保护检测。
LLMAR:面向稀疏且文本丰富工业领域的无调优推荐框架
LLMAR通过LLM推理与自校正,无需训练即可提升工业稀疏数据推荐性能54.6%,成本约每千用户1美元。
TANDEM:面向多模态仇恨言论的时间感知神经检测
提出TANDEM框架,将多模态仇恨检测转化为结构化推理,通过串联强化学习实现时间感知,F1达0.73,性能显著提升。
记忆如何影响基于LLM的社会粒子群中的集体与合作行为
研究发现记忆长度显著抑制LLM智能体合作,记忆越长合作越崩溃,性格特质部分影响,情感分析揭示负面解读。
AdaMARP:面向通用沉浸式角色扮演的自适应多智能体交互框架
提出自适应多智能体角色扮演框架AdaMARP,通过场景管理和消息格式提升沉浸感,效果超商用模型。
GroupRAG:认知启发的群体感知检索与推理 — 知识驱动的问题结构化
GroupRAG通过问题结构分组实现多起点检索推理,在医疗和法律问答中优于RAG和CoT方法。
CogArena:大型语言模型认知能力结构的多方法评估
CogArena基准多方法评估显示,LLM认知维度五维结构尚不稳固,多数任务相关性强,针对性干预优势微弱。
DS@GT ARC 在 CheckThat! 2026 中的方案:基于大语言模型的轨迹排序与分组奖励建模实现多语言数值声明验证
使用LLM与奖励模型验证多语言数值声明,LLM整体更优,奖励模型在冲突类较强;子声明分解无效,阿拉伯语专用模型更佳。
人类语言中上下文持续性的标度律
发现序列上下文影响随距离呈1/d衰减(指数≈1),确立人类语言标度律。
通过隐含义识别与取消评估大语言模型中的交际信念更新
发现大语言模型的信念更新理解落后于人类,尤其在自然场景中,尚未达到人类水平。
深度标签感知注意力时间卷积网络改进医学编码
提出深度标签注意力时间卷积网络,多标签分类用于医学编码,F1提高9%,召回率提高28%。
TabRank:面向表格重排序器的思维链蒸馏方法
TabRank框架通过思维链蒸馏训练表格重排序模型,显著提升多数据集性能并泛化多表推理。
通过事实-启发式-情感状态强制测量与提升大语言模型行为一致性
CKM强制区分事实、假设与情感,降低决策翻转82%,提升行为一致性,效果源于结构框架与内容划分。
TimeCapsule:生成性幻觉作为历史意义构建的方法
仅训练维多利亚文本的模型,用生成幻觉为现代概念提供历史合理类比,人类学者误判率达40%。
神经形态扩散语言模型:通过稀疏性与块降噪解决计算与内存瓶颈
脉冲稀疏性结合块扩散,神经形态MDLM在计算受限平台大幅提升能效与吞吐量。
离散多项式傅里叶扩展中噪声整形一位系数的研究报告
研究噪声整形一位系数的Sigma-Delta量化,获得一阶O(N^{-1})近似率与高阶O(N^{-r})衰减,并拓展到多项式相位。
时间距离JEPA:面向潜在世界模型预测控制的规划感知表示学习
TD-JEPA从离线日志中挖掘有向时间代价,缩小JEPA世界模型训练与规划差距,提升多种环境性能。
MyoCardBench:用于临床真实心血管护理场景评估大语言模型的真实世界数据基准
MyoCardBench是最大真实世界多任务基准,覆盖心血管全流程,精准评估LLM临床优势与遗漏。
跨语言比较人类与分类模型在代码转换语音环境中的夹带行为
跨语言分析人类与模型在代码转换对话中的夹带差异,模型特征偏好不同,为多语言模型评估提供框架。
基于LLM符号化决策过程物化的可解释列标注
SymCA框架利用LLM将列标注物化为全局到局部的符号决策过程,显著提升精度与可解释性。
VisualPatchWorld:作为规划的潜在结构化表示的代码世界模型
VPW用代码表示世界动态,实现高效规划,成功率超基线23.5个百分点。
激活引导中的信号溯源:激活源的选择策略
引导信号源于执行边界状态(模型即将输出目标行为),而非源文本;尾减法可优化信号稳定性。
CoSA:通过代理-内核协同设计的稀疏注意力加速长上下文推理
CoSA以代理-内核协同两阶段稀疏注意力,低预算下保持高精度,注意力加速4.93倍,首令牌时延减2.53倍。
迈向识别语言区域的系统性方法
本文提出一种地理聚类法,系统识别任意大小的语言区域,弥补了现有宏观区域划分缺乏系统性的问题。
CAST:游戏求解器作为LLM代理的回合级教师
CAST利用游戏求解器状态价值变化,为LLM提供回合级信用分配,提升长周期游戏决策表现。
雇佣语言学家降低推理成本:论语言规则作为有效的提示压缩器
仅用语言规则(无LM评分)的提示压缩器经进化搜索后性能接近先进方法,轻中度压缩下表现最佳。
对混合语码语音的强制对齐评估:以印地语-英语为例
评估印地-英语混合语音强制对齐,引导策略与混合语码训练将误差降至4.15ms,远优于单语模型。
Inspect India评估:面向印度语言与文化的开放大模型基准框架
针对印度语言文化的开源大模型评估框架,含六项基准,测试显示Sarvam-M和Gemma 2表现最佳。
大型语言模型的记忆机制
提出LLM记忆三维分类框架,统一分析隐式/显式、离线/在线、短期/长期机制。
旋转注意力中的相位结构:语义连续性与执行边界治理的频谱框架
提出有界频谱框架,分析相位对齐与语义漂移,区分表示连续性与执行边界治理。
IRIS:基于冻结大语言模型的可重用身份表示用于实体对齐
IRIS从冻结LLM提取实体身份签名,实现跨知识图谱直接对齐,避免重复推理,性能领先。
基于大语言模型的科学摘要简化中的人机协同语料库
人机协同构建简化语料,GPT基线与专家编辑结合,提升跨学科科学摘要可理解性。
PILA:面向LLM原生广告的即插即用插入方法
PILA将广告插入转化为有条件响应重写,作为侧车模块解耦,提升广告效果且不影响响应质量。
构造驱动的注入:大型语言模型中基于语言学的编辑式代码混合指纹
提出LCF框架,联合优化构造与注入,用低资源语言代码混合降低困惑度,零空间投影保持知识,实现隐蔽所有权验证。
SpeechLLM与联邦学习在端到端语音识别中的结合:英语与意大利语案例研究
首次将联邦学习用于SpeechLLM的端到端ASR,设计通信高效策略,在英意语上实现有竞争力的词错误率并降低通信成本。