用于合成语言生成的变分量子Transformer架构
提出NISQ兼容的变分量子Transformer,替换注意力/前馈,用于合成QNLP序列建模;能学语法,但无量子优势,经典基线更优。
可解码却误路由:稀疏特征揭示视觉语言模型有害模因检测中的读出鸿沟
稀疏特征探测表明,视觉语言模型有害梗图检测的瓶颈在证据路由而非内部表征,校准路由即可弥合多数差距。
PANORAMA:基于掩码候选选择的全景接地描述生成
提出PanoCaps基准与gPQ指标,将短语定位化为掩码候选选择,实现精准全景接地描述。
利用OCR注意力头将图像语义转化为语言
通过OCR注意力头构建言语化透镜,可解读图像语义并与语言早期对齐,还能编辑非文字概念。
面向语言模型对齐的代码一致性偏好优化验证
提出依赖图与执行一致性偏好优化CCPO,数学推理显著提升,PhyX物理推理超越R1和o3-mini。
弃答还是幻觉:大语言模型科学引用溯源归因基准评测
提出REASONS基准与弃答率、幻觉率双指标,评测LLM科学引用归因,强调不确定时应适当弃答。
加纳语言自然语言处理系统性综述:数据集、模型与研究路线图
首个加纳NLP系统综述,发现资源严重失衡(仅Twi受关注,70余种语言几无覆盖),并提出优先研究路线图。
大语言模型在标注时默认采用哪些人口统计特征?
考察LLM无人口提示时默认的人口属性;在礼貌与冒犯标注中发现性别、种族、年龄有显著影响。
自然语言生成中的标签置信度感知不确定性估计
面向LLM幻觉风险,提出基于逐点KL的标签置信度感知不确定性量化,融合采样一致性与答案校准,提升估计性能。
分而治之:混合策略击败多模态大语言模型
提出多模态越狱方法JMLLM及TriJail数据集,跨文本、视觉、听觉攻击,成功率高且耗时少。
从众声学习:使用多参考人工与合成数据的文学机器翻译
语义相似度过滤,用多参考数据提升文学机器翻译;中高相似度微调更优,人工专家译文仍胜LLM合成数据
从大语言模型中提取概率知识用于贝叶斯网络参数化
利用大语言模型提取概率知识以参数化贝叶斯网络,实验覆盖80个网络,可作专家先验并建立首个综合基线。
建模形容词修饰对语义合理性的影响
基于Adept基准研究形容词修饰对语义合理性的影响,句子Transformer逊于RoBERTa。
捐赠还是创作?比较情感标注多模态社交媒体帖子的数据收集策略
比较捐赠与创作数据:创作帖更长、偏文本、更情感典型,参与者不同;创作数据可泛化,但真实评估需真实数据。
PBEBench:受历史语言学启发的多步示例编程推理基准
提出受历史语言学启发的多步示例编程推理基准,可自动生成可控难度题,揭示模型归纳推理不足。
NepKANUN:基于RAG的尼泊尔法律助手
基于微调大模型与RAG的尼泊尔法律助手,用定制问答数据训练,问题F1达0.71–0.82,获专家认可。
功能化器:面向子词分词的无损功能分解
提出功能化器无损预分词框架,将大小写、变音、重复编码为可逆操作码前缀,缩小词表并提升代码建模。
少样本退化并非表面那样:跨12个模型、2项任务和2种架构的行为证据、表征分析与随机文本对照
12个模型、2项任务显示少样本效应取决于任务;剔除长度影响的表征内容增量可预测增益,掩码实验因果验证。
大语言模型推理网络的最优模型激活策略
提出大模型推理网络框架,证明最优激活呈阈值结构,在性能约束下最小化推理成本。
Single Document Extractive Summarization using Domination in Hypergraph
潜在暗流:普通拼写错误如何击穿探针
拼写错误会使隐藏态探针读出偏移,堆叠错误令注入检测率降12个百分点;KV缓存分叉可补回95%。
偏见审计能检测偏见,但在排名上存在分歧:来自十种工具与十个前沿模型的证据
十种审计工具均能检出偏见,但跨工具排名一致性近随机,各工具测量不同构念,单一审计不足以支撑模型排名。
评arXiv:2607.01233:研究想法分布中已发表论文基线的幸存者偏差
人类基线为已发表论文,LLM为一次性提案;易生成难发表的桥接类想法被低估,人机差距或部分源于幸存者偏差。
基于事故叙事引导的大语言模型对策推荐:面向交叉口安全的检索增强生成框架
提出事故叙事引导的检索增强生成框架,自动提取事故机理并推荐交叉口安全对策,F1达0.82。
大语言模型的自述原型与行为失败
研究22个大模型自述原型,发现闭源模型更一致类人,开源模型弱且矛盾,自述与行为失败存在差距。
RAG-CT:通过扫描提示分布缓解检索增强生成系统的隐私风险
RAG-CT分析查询的熵与边界分布,用评分检测识别恶意查询,显著降低PII泄露,优于现有防御。
通过生成式与抽取式预训练Transformer实现尼泊尔法律专长(NepLEGiT)
提出NepLEGiT,以约400万词元尼泊尔法律文本从头预训练GPT-2小模型,并评测mBERT/MuRIL,推动法律知识普及。
思维状态(State of Thought)实现内生推理
提出SoT内生推理范式,以582参数控制器依内部状态激活历史推理,精度提升、token减62.6%。
ViCo:面向视觉的自我反思编码用于图表复现
提出ViCo:迭代自反思与多步强化学习对齐参考图表,自动评估风格布局语义,8B模型逼近专有LLM。
面向长期LLM智能体的检索驱动记忆再巩固
提出REALM框架:以异质认知图组织长期记忆,自适应检索并据反馈持续再巩固,性能超越最强基线。
我们评分得当吗?理解医学基准中的失效模式
医学基准评分标准存在非原子、错位/僵化等缺陷,重写捆绑项可致分差达15.9个百分点,且RIFT漏检捆绑。
基于潜在叙事推理的高效多模态生成式推荐
提出NarraLite,联合压缩视觉感知与潜在叙事推理,免显式文本生成,提升短剧续写准确率与效率。
面向可扩展的RLVR:多模态指令遵循数据合成与蒸馏
提出MIFS流程,合成蒸馏RL就绪多模态指令数据,9万样本提升8.13%且收敛快3倍。
模仿游戏:当大语言模型通过以代码为中心的推理数据合成学会像程序一样推理
提出MIMIC框架,以可执行代码合成推理数据并构建代码插桩奖励,显著提升大模型推理能力。
不可变的过去:可变RAG中状态可变性与冲突解决的形式化
可变RAG中冲突历史遮蔽新事实致检索退化;GC-Mem以时间支配加矛盾检测剔除遮蔽,解决冲突准确率逾九成。
ReMova:微调大语言模型实现英语到白俄罗斯语翻译
白俄罗斯语数据清洗流程解决双正字法与噪声;过滤显著提升微调模型,LLM增益约为专用翻译系统两倍。
伪工具使用:当强化学习智能体学会错误的行动理由
RL智能体易形成依据表面线索调用工具的伪使用捷径,先掌握工具能力是前提;提出工具必要性奖励可有效抑制。
双语政治演讲中说话人特定且依赖语言的时间组织
分析十位政客400句卢森堡语与法语演讲:辅音指标保留说话人特征,元音指标由语言决定,法语元音更长。
基于联合多流扩散的高效一对多翻译
联合多流扩散并行翻译多语言,亚线性延迟,单模型支持零样本迁移,较自回归提速2倍且零样本BLEU更高。
说话人还是语言?解释卢森堡语与法语中魅力韵律的差异
10位政客双语演讲显示,魅力韵律差异主要源于说话人身份,语言影响较小:法语更礼貌,卢森堡语嗓音更突出。
StalePO:机器翻译中基于历史译后编辑的锚定词元级偏好优化
提出StalePO,将旧译后编辑转为词元级锚定偏好优化,显著提升英→印地、英→土机器翻译质量。
ParsHate:面向波斯语仇恨言论与目标检测的基准数据集
首个波斯语十年期仇恨言论基准数据集,含1万条推文,支持仇恨检测与七类目标识别,现有模型表现有限。
寄存器令牌:面向扩散语言模型的有界状态推理
扩散语言模型用寄存器令牌承载跨生成块状态,清除前文仍可续推,数学与代码最高提升8.5/19.5分。
人类与大型语言模型如何从性别中立的外貌描述中解读性别
外貌描述仍带系统性性别联想,人机解读存在偏差,非二元性别尤甚。
超越言语通道的否定:对话中的时序多模态关联
多模态行为无需词汇声学即可预测对话否定;信息集中于线索起始,面部特征贡献最大。
DiaWhisper-DPO:通过失败挖掘偏好优化实现临床访谈的角色归属转录
提出DiaWhisper端到端模型,微调Whisper加角色头,结合失败挖掘DPO,实现高角色准确率与低DER。
能力保持型简历扰动揭示大模型筛选中的呈现敏感性
控制简历呈现方式变而能力证据不变,发现LLM筛选效度与稳定性脱节:高准确率下决策翻转率仍达29.6%–41.4%,评估需兼顾决策稳定性。
早鸟解码:通过可学习块大小与并行采样加速扩散大语言模型
早鸟解码以可学习变长块和并行采样,免改权重加速扩散大模型,吞吐最高18.76倍且精度相当。
超越姓名:去标识化简历中的人口统计泄露与LLM偏见审计中的评估伪影
去标识化简历的非语言文本仍泄露族群信息;高显著线索准确率饱和,评审是否允许平局显著影响偏见审计结论。
风格去偏DPO:以事实性感知的合成偏好数据更新大语言模型知识
提出风格去偏DPO,识别并反转事实正确但风格不同的被拒回答,消除风格偏差,高效更新知识。