CRISP:面向高效深度搜索智能体训练的关键步骤感知
CRISP通过关键步骤感知区分必要与冗余交互,仅奖励必要证据,在保持准确率的同时减少交互轮次15.1%和33.2%。
通过渐进式经验演化实现大语言模型自我改进
提出SPEE框架,通过显式经验演化与隐式策略优化,提升大模型数学推理,优于自进化基线。
ACE-GraphRAG:面向层级图RAG的智能体上下文工程
提出ACE-GraphRAG,将上下文构建视为查询与任务相关的推理策略,用并行差分检索补全证据,优于基线。
基于多路径推理与反馈驱动优化的自动化可视化代码合成
提出VisPath多路径推理与反馈优化框架,自动生成可视化代码,性能超越现有方法。
风格取胜,实质落败:LLM作为评审在想法生成中的诊断
针对LLM评估想法的风格偏见,提出SciStyleBench验证:直接评审重风格轻实质,提取器可缓解偏见,提升实质识别与排序稳健性。
视觉语言模型需要词语:它们偏向语义锚点而忽略视觉细节
VLM依赖语言捷径而非真实视觉细粒度感知,当实体可命名时表现好,不可命名时失败;可通过任意命名或任务微调改善。
低资源场景下的语音大语言模型:数据量需求与高资源语言预训练的影响
研究低资源语音识别,发现高资源语言预训练投影器可缓解数据稀缺,小训练集下效果显著。
任务导向的信息移除在上下文学习中的机制
上下文学习通过低秩过滤选择性移除隐藏状态冗余信息,定向任务输出;去噪头是关键,缺失时准确率大降。
不要越线:过滤生成中的边界引导
提出边界引导强化学习方法,使生成远离分类器边界,兼顾安全与效用,经多尺度模型验证稳健。
MIDI-LLM:通过适配大语言模型改进文本到MIDI音乐生成
提出一种两阶段训练的大语言模型音乐生成方法,改进文本到音乐生成,超越基线,并在人机共创中获得最高接受率。
Token Buncher:保护大语言模型免受有害强化学习微调
提出TokenBuncher,约束熵防有害RL微调,保持性能,对抗比SFT更严重的风险。
评估跨域映射对人类和大语言模型创造力的影响
跨域映射提升人类创造力,对大模型无显著效果,但源域足够远时有益;人类转表面特征,模型转结构功能。
HomeSafeBench:面向自由探索家庭安全巡检的具身视觉语言模型基准
首个自由探索家庭安全巡检基准,最优模型F1远低于人类;所提CueBack方法微调后大幅超越闭源模型。
超越模拟:两万次真实对话揭示的心理健康AI安全
真实对话审计显示专用心理健康模型有害率低于前沿,两万对话安全风险极低,生态审计补充部署前评估。
LogitScope:通过信息度量分析大语言模型不确定性的框架
LogitScope框架基于词元级熵度量LLM不确定性,免标注识别幻觉与高风险决策点,模型无关高效。
先测试,后路由:语言模型如何跨模型和语言执行上下文条件规则
测试模块化:中间层携带谓词真值,修补可翻转结果;路由不可迁移,仅限token/成对,非抽象模块。
低资源语言的大语言模型:塔吉克语电子详解词典概念框架
提出用大语言模型构建塔吉克语电子详解词典的框架,融合词法与语义分析,支持低资源NLP应用。
基于LLM提示的古典拉丁语命名实体识别迁移学习
用LLM提示工程实现古典拉丁语NER跨语言迁移,在EvaLatin 2026两项子任务中均获第一。
右侧重置:前缀移除分块法
通过移除左侧上下文探测边界,用动态规划分块,恢复记录优于基线,证明上下文依赖可作边界信号。
迈向端到端多语言隐喻处理:整合检测、翻译与评估
本博士课题提出端到端多语言隐喻处理框架,整合检测与翻译评估,结合语言学理论和大语言模型。
公平性崩溃现象:合成数据训练语言模型中的偏差放大
研究发现,模型在合成数据上递归训练时,公平性先于标准指标恶化,偏见被放大,称为公平崩溃。
双关有意:基于对比学习与语音语义嵌入的多智能体文字游戏翻译
探索英法双关翻译,多智能体与语音语义引导法在评测中分列前二,优于直接判别器引导生成。
搜索音义碰撞:基于图的可供性检索与多评估器排序用于CLEF 2026 JOKER任务2的双关翻译
将双关翻译视为搜寻音义碰撞新触点,用图检索与多评估器排序生成选择,发现检索仍为瓶颈。
DataRx:面向更安全的大语言模型任务特定微调的缺失感知采样
DataRx通过缺失感知采样,仅用1%安全样本将微调后LLM攻击成功率从59.23%降至13.70%,增强任务微调安全性。
中文标题
首个系统评估OpenAI隐私过滤器,跨22语言42基准,零样本F1达0.855,但叙事文本与非拉丁语系性能骤降。
TabletCraft:以双向阿卡德语神经机器翻译与楔形文字渲染弥合四千年文化鸿沟
首个开源双向阿卡德语-英语翻译及楔形文字渲染系统,支持阅读与创作,BLEU约49。
MemArena:面向大规模端侧智能体个人记忆助手的自我中心基准
MemArena:端侧记忆助手基准,50智能体15天数据,记忆后端比模型缩放更关键,权限感知普遍失效。
BBOWP-Bench:评估大语言模型在黑盒优化文字问题上的能力
提出BBOWP基准,评估LLM从自然语言解决黑盒优化问题;LLM能选算法,但搜索空间设计不足。
JudgeArena:可复现的LLM裁判评估统一框架
统一主流LLM裁判基准,支持可替换裁判与元数据记录,用开源模型替代闭源裁判,并高精度模拟LMArena Elo评分。
被偏好不等于更安全:成对偏好难为临床安全代理
临床医生偏好不能可靠反映LLM安全,高偏好模型仍存安全失败,需单独报告安全指标并做临床调整。
知其形,不知其用:自动审计法律基准中的答案—权威脱钩
法律基准仅按答案计分,但答案正确与法条引用可分离;自动审计显示二者脱钩,建议联合评估答案与法源。
投机修正:扩散语言模型的草拟-精炼解码
提出草拟-精炼解码:先完整草拟再双向精炼,同模型提升准确率与速度,小模型草拟大模型修正可加速生成。
卡在‘A’上:0.6B语言模型注意力到KDA线性化中接口损伤的诊断与修复
注意力转KDA后,模型多选固守‘A’而不看内容;格式定向KL修复接口损伤,C-Eval +12.48。
OncoTriad-QA:面向泛癌推理的患者级影像-病理-基因组学基准
构建泛癌问答基准,融合影像、病理、基因组及临床数据,8.6万问题,微调OncoVLM后性能超现有模型。
语言模型视角下的城市描绘
语言模型对未明确城市常有隐含假设,基于40项指标测度发现其偏好建成区大、增长快、设施全、不稀疏的城市,且典型性与合意性常一致。
学习用于社会文化任务的向量符号模型
提出向量符号自编码器记忆系统,用于ACT-R架构表示多层级语义关联,经HRR编码情景与语义记忆,以IAT测试验证。
Crayotter:通过群组相对偏好反向传播学习长时程视频编辑智能体
提出GRPB,将主观延迟反馈转为同任务排序并分配信用,提升长时程视频编辑智能体,9B模型超越专有系统。
FLARE:基于少样本学习的自适应反思引擎
FLARE结合少样本与反思优化,全面优于GEPA,且数据效率高。
BODHI:大语言模型会分支探索并发现异质推理吗?
通过迷宫实验和数学推理树,发现RLVR虽提升约束遵循与回溯,但压缩语义分支熵,多样性损失换取采样效率。
ARCHead:面向大语言模型输出头的激活度量残差校正
提出ARCHead,用低秩核、分组INT4残差及激活度量校正压缩LM头,存储降3.7-3.9倍,困惑度近乎不变。
形合意不合:低资源孟加拉语辱骂性言论中大语言模型安全的理解-遏制解耦
审计五款大模型:孟加拉语辱骂的安全对齐基于形式非语义,理解与遏制解耦,高资源基准难保低资源安全。
OPTD:少步扩散语言模型的在策略转移蒸馏与一致性引导自适应压缩
提出OPTD,采用在策略轨迹与一致性引导自适应压缩,提升少步扩散语言模型的质量-效率权衡。
字符象似性与任意性:阿拉伯语自然语言处理视角
阿拉伯语字符去点后,随机重映射也可达到相同性能,表明字符形式与功能关系基本任意。
每个错误答案都算数:面向LLM多项选择基准的选项级心理测量学
提出选项级心理测量模型,证明错误答案蕴含有用信息,能更准确估计模型能力并提升基准测试效率。
语言模型编码命题的语境真值
研究发现语言模型以线性方向编码语境真值,受对话中他人断言影响,并可区分两种迎合行为。
PAMT:面向多领域机器翻译的过程对齐强化学习
提出PAMT,用域感知长思维链监督与强化学习,以步骤级过程奖励解决翻译推理漂移,性能超越基线。
PI-Mem:以并行迭代记忆将长上下文推理扩展至360万token
PI-Mem并行迭代精炼共享记忆,突破长上下文瓶颈,在360万token上准确率提升超6点,速度提升达6倍。
论文字破译中统计度量的非特异性
生成式徽章系统测试表明,常用统计度量可检测符号组织性,却缺乏语言特异性,不能单独证明编码言语。
超越准确率:大型语言模型统计推理的多维评估
现有评估重准确率、轻解释方式。综合准确率、行为、主题建模及词汇分析,发现模型准确率差异大,但概念结构趋同,同供应商风格更相似。
模仿还是估计?基础模型与后训练语言模型在意见模拟中的不同优势
基础模型更擅长生成个体响应模拟人群,后训练模型更擅长直接预测总体分布,选模型应依据任务类型。