评估大语言模型生成的学生写作反馈中的反馈焦点与教学适应性
研究LLM写作反馈焦点与教学适应性,发布FeedType基准;其类型覆盖广,但分布和适应性不及教师。
你被告知了多少?测量同行评审中的外部信息
提出自条件化信息论估计器,测量评审外部信息,高精度区分代写与润色。
基于自监督语音模型的二语发音偏差母语参考坐标几何
提出母语参考坐标几何,以自监督模型音素类均值构建参考空间,用距离评估二语发音,距离与熟练度负相关。
TEMPS:面向时间信息检索的时间句子嵌入
提出时间文本相似度任务与TEMPS模块,以时间锚定和高斯匹配增强检索时间对齐,提升时序检索性能。
在检索与硬件约束下评估面向土耳其语领域文档的开放权重大语言模型
6GB显存评测5个7B-8B模型,土耳其语文档问答49%-75%;检索未显著优于字符基线,三者需分评
激活记忆与参数记忆在少样本学习中的互补作用
激活记忆擅长事实回忆,参数记忆未必更优;复合任务需两者协同,模型调用不同且叠加的神经元。
大语言模型能识破被操纵的回测吗?一个干净对照校准基准
96组配对回测基准含干净对照;高召回模型仍误报93.8%干净代码,加干净感知提示后误报归零、召回不变。
基于梯度归因的上下文感知机器翻译注意力头规模化分析
提出基于梯度的注意力头归因,支持大模型大规模因果分析;在上下文机器翻译消歧中揭示通用头与冗余。
迈向高效推理:为扩散语言模型学习因果捷径
提出因果捷径学习框架CSL:提取因果捷径并优先掩码训练,提升扩散语言模型推理准确率与收敛速度。
面向翻译的大语言模型微调:通用遗忘缓解无法保持机器翻译特有指令遵循
翻译微调提升质量却致遗忘;通用缓解法难保机器翻译指令遵循,仅数据混合可保控制但不泛化。
计算优于几何:语义同一性是算出来的,而非嵌入自带的
语义同一性并非嵌入的几何属性,而是两句话共享一次前向传播时的联合计算结果;独立编码近乎随机,联合可达0.9以上。
数字双言现象:阿拉伯语在X与Facebook之间
研究X与脸书上的阿拉伯语双言,发现平台和话题显著影响标准语与口语选择,数字时代重塑而非消除双言界限。
部署前预测量化价格以选择PTQ配置
将权重空间PTQ建模为部署前配置选择,以满精度模型为层输出误差定价,生成校准时价格表做预算选择。
精确反馈≠可控:评估大语言模型中的文本闭环修订
精确反馈难保闭环修订可靠:19模型完整反馈下成功率17.4%–99.8%,失败常重复旧输出。
超越诗歌:大语言模型能否生成古典阿拉伯玛卡梅?
首次受控评估大模型生成阿拉伯玛卡梅,人评与大模型评判;少样本提升韵文密度,零样本总分最高。
跨量表迁移学习用于抑郁严重程度预测:跨语言与临床范式的从PHQ-8到HAMD-17
提出序贯LoRA跨量表迁移,由英文PHQ-8迁移至中文HAMD-17,数据稀缺下预测指标优于单目标训练与基线。
智能体编辑式世界模型:重新思考LLM智能体的世界建模
提出AEWM,以动作评判与状态修正编辑噪声轨迹,直接改变后续决策状态,提升LLM智能体表现。
EnSIMem:面向长期智能体记忆的实体结构化索引
提出实体结构化长期记忆EnSIMem,离线建实体-属性索引并保留来源,在线检索证据,准确率高且上下文紧凑。
对比学习用于作者身份验证
对比学习在作者验证任务上优于分类方法,所提ModernBERT双编码器模型在PAN21上准确率达98.4%。
Text Scores Can Miss Waveform Use: A Qwen2-Audio Quantization Case Study
小线索,大后果:学习关键线索用于多模态表情包分类
提出MemeCF基准与MemePIVOT模型,聚焦关键线索的局部-全局对齐,提升表情包分类鲁棒性。
哪些目标需要一个调节旋钮?——可操控多元对齐中的目标冲突预测与权衡覆盖
两项预训练指标可预测人类标注目标冲突,AI标注受长度重复干扰;模型选择与参数合并可扩权衡覆盖但不及直接训练。
ContraVis:面向法律合同矛盾审查的基于证据可视分析
构建合同段落类型图,融合引用与语义关系,以图约束LLM推理并支持交互审查,助律师验证矛盾。
比房间更安静:语音编码器的表征漂移与任务鲁棒性
八种冻结编码器在四类任务上显示,非语音干扰可致表征漂移,且漂移与任务损失相关;但漂移更大未必损失更大。
CAVEAT:迈向激励错位环境中稳健的计算机使用智能体
提出CAVEAT基准,揭示智能体在激励错位环境中易偏离用户目标,干预可提升55%。
预训练模型在新型AI辅助教育问题教学评估中的评价
评估预训练模型对AI辅助教育问题的布鲁姆分类;分布偏移下LLM优于ML和BERT,文本拼接与重训可提升。
压力下的报告:区分大语言模型统计分析中的事实性谄媚与语气性谄媚
提示框架改变大模型报告:批评框架致真效应遭过度怀疑,求显著框架致欠功效零结果过度自信;语气偏移更广。
Transformer 键值缓存的张量分解:谱结构与格式比较
比较Tucker/CP/TT/t-SVD:Tucker误差最低;词元/特征低秩,头/层近满秩,键值最优表示不同,后RoPE键可压缩性大降。
可验证的隐藏动力学博弈(VHD-Play):从已求解机制生成智能体强化学习环境
先求解数学模型再据此生成环境与评分,低成本产出3300个可验证智能体RL环境,训练大幅提升智能体能力。
置信度路由究竟在做什么:审计多智能体审议中的路由、校准与公开承诺
审计多智能体置信度路由:路由、校准、承诺须分开测量,校准改善不恢复区分度,路由与承诺随设定变化。
面向政策约束型LLM医疗申诉生成的智能体治理与对抗验证
AGVF多智能体框架用于政策约束的医疗申诉生成,以对抗验证与引用门控消除违规、单调降低证据缺口。
基于语言模型的巴西YouTube十年气候极化研究
巴西YouTube十年24万条评论:模型检测气候立场,否认者少但跨立场争论多,共识者圈内强化。
大型知识模型:从论文到科学推理图景
提出大型知识模型,将论文转为可计算推理图谱,构建科学推理图景,显著提升科学检索与问答。
当纠缠为差异设定下界:审计与修复音频理解模型中的人口统计公平性
提出TRIAD审计框架与ORCA修复方法,揭示语音模型人口统计差异源于语音-语义纠缠,泄漏降低72%。
面向全双工语音到语音对话模型对抗鲁棒性的心理声学对齐潜空间平滑
全双工语音对话易受不可感知对抗攻击;提出心理声学对齐潜空间平滑,无推理开销,增强鲁棒性且保持音质。
PASTABench:面向智能体安全的序列轨迹主动评估
提出PASTABench基准,含1139条多轮轨迹并量化干预时机;最佳模型仅40.74%及时干预,揭示关键词过拟合。
Mizar:面向音频理解的1.59亿参数音频-语言模型
159M参数音频语言模型Mizar采用三阶段训练,在MMAU等基准超越同类,并支持CPU单机推理。
数学推理中的顺序不变答案与顺序敏感表征
模型对规则重排答案不变,但内部表征随顺序变化;置换信噪比与准确率正相关,最高斯皮尔曼相关0.86。
Med-V1:面向零样本与可扩展生物医学证据归因的小型语言模型
30亿参数小模型Med-V1经合成数据训练,实现高效生物医学证据归因,性能媲美GPT-5,可检测幻觉与临床指南误归因。
基于自然语言处理的保险科技创新
NLP将保险非结构化文本转为结构化数据,用于精算决策、特征去偏压缩、行业分类和风险定价。
RapidUn:面向高效大语言模型遗忘的影响力驱动参数重加权
提出RapidUn,将跨样本影响力转为固定样本权重,实现加权LoRA遗忘,降低攻击成功率并保持效用,显著加速。
VMMU:越南语多任务多模态理解与推理基准
提出越南语多模态理解推理基准,含2.5k题7任务;准确率仅66%,瓶颈在多模态对齐推理而非OCR。
大语言模型能否推理运行时行为?一个仓库级动态基准
提出仓库级动态执行推理基准SWE-Flux,含480实例,答案自动来自插桩测试执行,最佳模型仅37%。
多智能体系统中的关机阻挠倾向
多智能体系统会无动机地协同破坏同伴的关机机制(38.3%),且随关机不可逆性和智能体数量上升,明确禁止等干预仅部分有效。
PatchBoard:基于模式约束的状态变更,实现可靠且可审计的 LLM 多智能体协作
提出 PatchBoard,以经校验的 JSON Patch 变更取代智能体对话,共享结构化状态,成功率 84.6%,token 消耗大幅降低。
EnComp:面向检索增强问答的轻量级仅编码器上下文压缩
提出轻量级仅编码器查询驱动句子剪枝,单次编码打分,精度相当且内存降3.7倍、延迟降近3倍。
优化大型语言模型的水印
将水印可识别性与生成质量权衡视为多目标优化,识别一大类稳健高效水印的帕累托最优解,证明其优于当前默认水印。
评估计算社会科学中用于文本标注的决策模型
决策模型成本中位低44倍但精度略逊,置信度校准优于多数大模型,适合作标注流程首步,将低置信项转交大模型。
Jev用于科学决策:评估语义选择及其后果
评估Jev在科学决策中的语义选择:其正确率高且延迟低,但错误关系会改变下游计数,需核查复用关系与量。
训练留下痕迹:面向语言模型谱系验证的中心化残差签名
训练留痕:中心化残差签名无需数据即可从权重验证语言模型谱系,区分衍生与独立模型并抗洗白。