DiPS:面向高风险说服场景的对话策略选择
提出DiPS框架,用Q-learning动态选择说服策略,在火灾逃生场景中比零样本LLM和RAG方法更有效。
ProWAFT: 一种面向FPGA CNN加速器的工作负载感知动态容错ROMA-LPD实例
通过部分重构选择性应用三模冗余,优化延迟、能耗与可靠性,实现低成本动态容错。
生成更多数据何时有用?合成数据扩展中固定源合成与源扩展的区分
分离固定源合成与源扩展,发现后者在大预算下更优,前者有界。
关于偏好对齐生成中引导向量的局限性
研究揭示引导向量在偏好对齐中的局限:特征表达不均、任务迁移降级、多向量组合性能下降且需调参。
TUDUM: 面向Qwen3.5-27B的土耳其语思维推理流水线
TUDUM使Qwen3.5-27B土耳其语推理,SFT提升语言一致性但精度降,RL部分恢复,未超基线
PARTREP:学习仅解码器大模型该重复什么
PartRep选择性重复高信息量token,保留全重复增益,减少KV缓存和预填充计算开销。
PairCoder++: 结对编程作为可验证代码驱动的多模态与结构化工件生成的通用范式
PairCoder通过双智能体结对编程与工具链验证,显著提升代码生成的工件质量,成本增加约7倍。
语法起作用:通用依存关系中功能性与词汇性依存长度最小化的对比
研究发现122种语言中依存长度最小化分两层:功能依存短且不变(语法驱动),词汇依存长且变化(加工驱动)。
EduArt:评估大型语言模型艺术史知识的教育层次基准
EduArt多格式测试显示,大模型多选接近满分,但开放完成和错误识别准确率极低,揭示知识与应用能力分离。
对象对齐器:一种可配置的图结构JSON模式相似度评分,应用于大语言模型提示优化
Object Aligner通过参考对齐和Weisfeiler-Leman近似,实现对图结构JSON的确定性评分,作为提示优化器的奖励有效。
HaloGuard 1.0:一个用于多语言AI安全的开放权重宪法分类器
HaloGuard 1.0开源权重宪法分类器,0.8B参数在多语言安全基准达SOTA(F1 90.9,FPR 4.3),支持46种语言。
中文标题
上下文嵌入可预测普通话单音节词时长与音高,预测精度优于随机基线。
中文标题:OpenSafeIntent:跨双重用途提示集评估意图校准的安全完成
中文摘要:提出OpenSafeIntent基准,通过控制任务意图变体评估安全完成,发现模型在意图校准上存在不足。
SPLIT:英语和乌克兰语大语言模型回应中的跨语言共情与文化根基
提出SPLIT基准,评估LLM在英、乌语中共情与文化根基,发现模型在乌语中表现下降,人类与AI评测存在分歧。
NAVER LABS Europe 对指令跟踪2026短赛道的参赛方案
用SpeechMapper改进语音投影,合成fakACL数据集,以更紧凑模型和弱LLM骨干取得并列第一。
中文标题
提出分类器框架评估TTS音系保真度,发现Meta MMS TTS中ATR元音和谐偏差。
超越监督式澄清:利用大语言模型进行输入重写实现对话语篇解析
无监督澄清不可靠,输入重写易致解析回归,可重写性预测是优化关键。
AIriskEval-edu:面向AI辅助K-12教学解释的风险评估新数据集
提出AIriskEval-edu-db2数据集,用于K-12教育解释的风险评估与可解释性审计,含多维度风险标注和验证实验。
多语言环境与低资源语言中LLM作评判的挑战与建议
LLM在多语言低资源场景下评判存在评估不一致、过度信任及单一模型依赖问题,并给出改进建议。
BamiBERT:一种新的基于BERT的越南语语言模型
BamiBERT是越南语新BERT模型,支持2048令牌长上下文,无需分词,多项基准达最优。
World Wide Models: Literary Tools for Cultural AI
CheckRLM:检索增强推理中知识与思维连贯性的有效检查
CheckRLM通过RAG检查纠正推理中的事实错误,保障知识连贯,低成本减少误差累积。
论方向性在结构泛化中的作用
通过CCG有向类型重设计符号层,方向性将瓶颈转向神经层,与编码器升级互补提升结构泛化。
了解你的信息源:面向媒体背景核查的公共知识库
提出MEDIAREF公共知识库,解决RAG事实核查中证据不可靠及背景核查生成成本高问题,支持可复现、低成本评估,生成质量更高。
The Future of NLP may not be at NLP Conferences: Scholarly Migration Patterns in Natural Language Processing
Language Models as Measurement Apparatus for Culture
HULAT2在MER-TRANS 2026:面向西班牙语易读文本生成的受控多智能体简化方法
HULAT2采用信号引导多智能体路由,在西班牙语易读文本生成任务中最佳SARI达44.05,优于线性再生基线。
Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning
推理大语言模型提升长篇电视剧中的说话人识别
提出DramaSR-LRM推理模型,整合视听语言线索,显著提升长篇电视剧中短语句的说话人识别性能。
基于音频的有声书叙述吸引力研究
提取声学特征发现与消费数据强相关,验证了叙述吸引力对听书效果的独立影响,助力个性化推荐与配音选角。
扩展规模能否提升LLM社会仿真?
规模扩展可改善多数社会仿真任务,但纵向预测和弱势意见改善缓慢,且无法提升认知偏差校准。
超越像素差异:为Web UI视觉回归测试基准测试图像变化描述
提出Web UI图像变化描述任务及基准,评估现有方法发现其能抑制噪声但需领域优化。
LACUNA:评估大语言模型遗忘中定位精度的测试平台
LACUNA是首个参数级定位遗忘测试平台,发现现有方法不精确且易受攻击,精准定位是关键。
ExPerT:通过查询级语义和击键行为线索个性化LLM对用户领域专业知识的响应
ExPerT框架结合语义与击键行为推断用户领域专业知识,自适应调整LLM响应,使推断误差降低65.7%,响应满意度提升17.52%。
构建社会技术对齐的空间
引入人本框架解决社会技术对齐的规范性缺失,指出概念模糊阻碍进展,建议联系社会科学提升精确性。
ADVENT:基于大语言模型的ILP自动谓词发明
ADVENT结合LLM与Prolog验证迭代发明谓词,成功率升至80%,知识库提升31%,生成可解释规则。
通过强化学习实现视觉语言模型的视觉化自我反思
提出VRRL框架,用随机掩码和缓冲回滚强化视觉自我反思,显著提升分布外准确率。
AgenticDataBench:面向数据代理的全面基准
提出AgenticDataBench,涵盖15领域真实任务与细粒度标签,通过技能覆盖评估数据代理性能。
1990-2019年全球图书情报学研究方法使用的非同步性
研究81国三千余篇论文发现:各国研究方法存在差异且随时间缩小,揭示了学科发展特色。
图书馆与信息科学中研究主题与方法选择的性别差异:三大顶级期刊视角
女性倾向访谈,男性偏重理论,性别影响研究方法选择。
面向丢包掩盖的自监督测试时调优
提出TTT-PLC,仅用接收数据包自监督调优PLC模型,无需外部数据,提升丢包掩盖性能。
PhysMani: 基于物理原理的动态物体操控3D世界模型
提出结合物理原理的3D高斯世界模型与未来感知策略,在动态操控任务中超越强基线。
Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts
出于错误原因的鲁棒性:LLM对科学怀疑的表征几何
LLM面对科学质疑不谄媚,但鲁棒性源于无法感知质疑信号,且不能跨域迁移。
ESC:面向可靠视觉语言模型的情感自纠正
提出ESC框架,用情感信号触发自纠正,无需训练即提升视觉语言模型推理可靠性。
HERMES:一种用于预训练数据混合的多粒度标签基底
HERMES通过层次化标签系统实现多粒度调节,在预训练中提升性能,将数据混合设计转换为可重用的粒度导航。
贝叶斯稀疏低秩自适应实现大语言模型不确定性估计
DALorRA通过低秩稀疏贝叶斯方法校准大模型不确定性,不损推理精度。
AgenticSTS:长时域LLM智能体的有界记忆测试平台
提出有界记忆契约,测试显示技能层提升胜率(3/10→6/10),但统计不显著,发布可复现平台。
使用大语言模型自动评分Linux/bash考试:一种四级认知分类方法
LLM在四级认知分类上自动评分Linux/bash考试,Gemini3.0表现最佳,评分一致性随复杂度下降。
使用图支撑子的带精度保证的HNSW——技术报告
提出"验证-修正"框架,用统计认证器评估HNSW质量,必要时升级精确恢复,兼顾速度与精度。