面向丢包掩盖的自监督测试时调优
提出TTT-PLC,仅用接收数据包自监督调优PLC模型,无需外部数据,提升丢包掩盖性能。
PhysMani: 基于物理原理的动态物体操控3D世界模型
提出结合物理原理的3D高斯世界模型与未来感知策略,在动态操控任务中超越强基线。
Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts
出于错误原因的鲁棒性:LLM对科学怀疑的表征几何
LLM面对科学质疑不谄媚,但鲁棒性源于无法感知质疑信号,且不能跨域迁移。
ESC:面向可靠视觉语言模型的情感自纠正
提出ESC框架,用情感信号触发自纠正,无需训练即提升视觉语言模型推理可靠性。
HERMES:一种用于预训练数据混合的多粒度标签基底
HERMES通过层次化标签系统实现多粒度调节,在预训练中提升性能,将数据混合设计转换为可重用的粒度导航。
贝叶斯稀疏低秩自适应实现大语言模型不确定性估计
DALorRA通过低秩稀疏贝叶斯方法校准大模型不确定性,不损推理精度。
AgenticSTS:长时域LLM智能体的有界记忆测试平台
提出有界记忆契约,测试显示技能层提升胜率(3/10→6/10),但统计不显著,发布可复现平台。
使用大语言模型自动评分Linux/bash考试:一种四级认知分类方法
LLM在四级认知分类上自动评分Linux/bash考试,Gemini3.0表现最佳,评分一致性随复杂度下降。
使用图支撑子的带精度保证的HNSW——技术报告
提出"验证-修正"框架,用统计认证器评估HNSW质量,必要时升级精确恢复,兼顾速度与精度。
SkillFuzz:对开放技能市场中的技能组合进行模糊测试以发现隐含意图
提出无需执行的SkillFuzz模糊测试方法,高效发现技能组合引发的隐含意图,验证80%高风险组合。
TestEvo-Bench:一个可执行的、实时的测试与代码协同演化基准
TestEvo-Bench是可执行、实时更新的基准,含测试生成和更新任务,支持可执行指标并降低数据泄露风险。
Transformers导论:NLP视角
概述Transformer基本概念与关键技术,涵盖标准架构、改进及应用,总结优缺点,助理解变体。
无需训练的概念定位实现对抗字体攻击的鲁棒性
提出无需训练的机械可解释性方法,识别编码词汇的组件并干预,显著提升对字体攻击的鲁棒性。
无人监督时LLM智能体的话语:多智能体辩论中的社会结构与隐性目标涌现
社会结构诱发公共发言与私下回应系统性分歧,揭示需检测代理涌现的隐性目标。
大型语言模型的在线安全监控
简单监控器通过阈值化外部验证信号并风险控制校准,在LLM安全监控中与高级方法竞争力相当。
程序即权重:面向模糊函数的编程范式
提出模糊函数编程范式PAW,用小型模型编译自然语言为可重用程序,实现高效本地执行。
大型语言模型重塑科学语言
LLM使2024年科学写作词汇更密集、句法更简单,拓宽非英语学者参与,但降低公众可及性。
YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型
提出YuFeng-XGuard护栏模型,通过结构化风险预测与可解释推理,平衡效率与深度,支持动态策略调整,性能达最优。
LearNAT:基于抽象语法树引导的任务分解学习NL2SQL(面向大语言模型)
LearNAT通过AST引导分解合成与边缘感知强化学习,使7B小模型NL2SQL性能媲美GPT-4。
更少数据,更多安全:通过资源高效领域自适应持续预训练用最少Token推进网络安全大语言模型专业化
用少至1.188亿token的领域自适应持续预训练,使通用大模型在网络安全基准上超越数十亿token专业模型,计算能耗大幅降低。
大型语言模型中的心理引导:有效性与可信度评估
提出PsySET基准评估LLM情绪人格引导,发现提示法有效但控制有限,向量注入精细但略降质量,且存在副作用。
中文标题:驾驭对齐-校准权衡:通过模型合并实现帕累托最优前沿
中文摘要:模型对齐后精度和校准均下降,通过权重插值可找到帕累托最优模型,既提升精度又恢复校准,缓解对齐代价。
StatEval:大型语言模型在统计学中的全面基准
首个超10万问题的统计推理基准StatEval,覆盖课程至研究级任务。LLM基础尚可,研究级推理薄弱,该基准兼具提升推理功能。
CreativityPrism:一种面向大语言模型创造力的跨领域评估框架
提出CreativityPrism框架,评估LLM创造力三维度,发现前沿模型在写作推理领先但发散思维无优势,各维度相关性弱。
探究Transformer表示空间中思维状态的类谱系组织
通过探针发现Transformer表示中存在与标注思维状态一致的统计显著的类谱系结构。
通过循环语言模型扩展潜在推理
Ouro循环语言模型将推理融入预训练,1.4B参数匹配12B模型性能,优势源于知识操控能力。
中文标题
心理想象网络显示人类跨群体中心性与聚类一致性,大语言模型无法复现。
AgenticRAGTracer:诊断Agentic RAG多步检索推理的跳级感知基准
新基准自动构建含1305数据,最强GPT-5准确率仅22.6%,失败源于推理链扭曲。
MSQA:一个原生来源的多语言多文化简单问答基准
MSQA基准揭示文化对齐错觉:文化能力取决于预训练接触,而非多语言能力,常见推理补救无效。
基于策略的强化学习玩二十问游戏
提出基于策略的强化学习方法玩二十问游戏,用奖励网络估计奖励,抗噪且不依赖知识库,性能优于基线。
AGC-Bench:衡量人工通用创造力
提出AGC-Bench基准,发现单一创造力因子c,提示“创意”比推理更有效,人类仍领先LLM。
Svarna:现代希腊语开放语料库工作台
免费开源现代希腊语语料库工作台,集成5个数据库、5.07亿词,提供KWIC、频率分析等工具,无需登录即可使用。
利用强化学习通过LLM反馈优化RAG重排序器
提出RRPO框架,利用LLM反馈优化重排序,无需人工标注,显著提升生成质量。
MedRepBench:医学报告解读的综合基准
MedRepBench基准含1925张中文医学报告图,评估字段提取与患者解释,提供客观与主观评价,展示对齐基线提升6%召回。
面向智能体作为评判者的多语言提示本地化:需求级别评估中的语言与骨干模型敏感性
评估语言改变会反转骨干模型排名,语言与骨干交互显著,提示语言应作为显式评估变量。
MedCase-Structured:面向临床真实电子健康记录环境下诊断推理基准测试的文本到FHIR数据集
提出文本到FHIR数据集生成管道,合成1,732例,发现LLM在结构化输入上诊断准确性低于纯文本。
大型视觉语言模型中的跨文化价值归因
研究揭示LVLM在文化背景下存在三种偏见模式,包括社会经济地位与权威关系的反转等。
谁得奖励,谁担责任?面向多LLM智能体的评估对齐训练信号
提出基于合作博弈归因与过程奖励建模的统一框架,将系统评估转化为智能体级信号,支持强化与偏好训练。
ThreadWeaver:面向语言模型高效并行推理的自适应线程化
自适应并行推理框架,精度与顺序模型相当,延迟降低达1.53倍。
HAL:通过对齐诱导大语言模型的人类相似性
HAL框架用可解释奖励对齐语言模型,提升对话人类相似性,且不影响整体性能。
AlienLM:面向黑盒大语言模型API边界隐私的语言外星化方法
AlienLM通过词汇双射将文本外星化,减少API明文暴露,保持81%以上性能,对抗重建率低于0.22%。
PreScience:面向科学预测的数据集与基准
基于98K篇AI论文构建科学预测数据集,提出7项任务及LACER评估指标,发现模型生成论文多样性和新颖性低于人类。
BRIDGE: 从模型性能预测人类任务完成时间
提出BRIDGE框架,利用项目反应理论从模型性能估计任务难度,发现与人类完成时间对数线性相关,可预测新任务人类耗时,复现能力指数增长趋势。
长程推理的递归模型
提出递归模型突破长程推理的上下文限制,证明可指数级压缩活动上下文,实验验证有效性。
基于梯度范数的各向同性高效不确定性量化方法
提出基于梯度范数的各向同性不确定性量化方法,单次传播高效计算,并在QA任务中揭示不同类型不确定性的信号差异。
OmniGAIA:迈向原生全模态AI智能体
提出OmniGAIA基准与OmniAtlas智能体,实现跨视频、音频、图像的深度推理与工具集成。
超循环Transformer
循环Transformer加超连接,用约一半参数达到同等性能,实现内存高效语言建模。
Evergreen:高效验证语义聚合中的声明
Evergreen将声明验证转化为语义查询任务,通过早停、相关性排序等优化及置信序列估计,降低成本并保持高F1值(0.94),实现3.1倍至7.0倍的成本降低。
ContraFix: 技能增强的对比运行时分析用于漏洞修复
ContraFix通过对比运行时分析和技能库复用,实现92%修复率,语义正确性58.2%,超越基线。