CRAFT: 一个统一的用于表格问答和事实验证的反事实推理框架
CRAFT提出统一反事实推理框架,将表格问答和事实验证转为双向验证,显著提升复杂问答性能。
先刻画后蒸馏:大输出空间中的机制推理
模型先筛选候选再精细推理,基于此机制蒸馏优于标准方法。
用语言模型的稀疏特征解释大脑对语言的反应
用稀疏特征与惊讶度解释大脑语言反应,发现大脑与语言模型特征存在非平凡对应。
扩展多轮短信诈骗检测合成对话数据集
COVA-X数据集上Longformer超越XGBoost,准确率79.71%,证实Transformer需更大语料实现上下文优势。
大型语言模型是否适合图计算?进展与展望
综述LLM在图计算中的执行与规划角色,指出其适合简单任务但不可靠于大规模精确任务,总结数据集与未来方向。
Progress-SQL:通过渐进式奖励改进文本到SQL的强化学习
提出Progress-SQL框架,利用渐进式奖励和多轮强化学习,显著提升Text-to-SQL生成性能。
量化25年涉警死亡新闻报道中的媒体呈现动态
分析4000篇涉警死亡新闻,官僚视角频率是平民近三倍,平民话语情感更强,近年代表增加。
TRACE:通过自适应跨步证据聚合进行轨迹推理的LLM智能体
TRACE框架通过自适应跨步证据聚合,实现长序列LLM智能体轨迹的监控,F1达0.713。
OpenHalDet:面向多样生成场景的幻觉检测统一基准
OpenHalDet统一基准,标准化幻觉检测评估流程,支持黑箱灰箱白箱方法,促进可重复比较。
领域自适应大语言模型中的训练数据审计:LoRA-MINT
提出LoRA-MINT审计LoRA微调LLM训练数据成员关系,精确度达0.77-0.92,优于基线。
ThinkBooster:一个用于无缝扩展LLM推理测试时计算的统一框架
ThinkBooster统一了碎片化的测试时计算策略与评分器,提供模块化库、基准和可部署服务,实证取得实用增益。
经验树:低重复与隐式奖励环境下自演化智能体的结构化经验管理方案
经验树(ToE)通过结构化组织、检索、验证和更新经验,在隐式奖励环境中显著提升自演化智能体性能。
MADE:多语言智能诊断引擎,超越评分,获取细粒度评估洞察
MADE引擎分解后评估分析,诊断报告质量提升47%,87.9%被专家偏好,发现部署迭代等四类跨文化洞见。
使用大语言模型生成接近错误的对比训练提升语码转换语音识别鲁棒性
提出POI感知对比训练框架,用大语言模型生成近错假设,降低语码转换语音识别错误率超2%。
句子编码器中概念表示的原则
揭示句子编码器概念表示的四原则:微调仅校准几何、信号集中于最终层、硬负样本提升区分而非排名、监督效果依赖组合类型。
Didact:一种面向国防的跨领域能力发现系统
Didact整合国防报告与知识图谱,通过RAG管道和可视化工具支持政策对话,实现跨领域能力发现。
超越评分标准:面向奖励建模的探索引导评估技能
Eval-Skill:探索引导合成可复用评估技能,避免在线生成准则,显著提升奖励模型评判效果。
通过结构化内联引用生成实现显式证据基础
FullCite框架生成结构化内联引用,发现大型语言模型难以精确定位支持证据跨度。
对抗性生成与检测AI社交机器人内容
对抗法构建人机配对数据集训练检测模型,真实场景下显著优于现有模型。
通过人口统计条件融合嵌入学习视角主义社会意义
提出融合文本与人口统计的嵌入模型,在28k标注数据上建模社会意义的视角差异,性能比纯文本基线提升5.9%-6.5% PR-AUC。
UrduMMLU:乌尔都语理解的大规模多任务基准
26,431道乌尔都语多选题,测试30个LLM,最佳准确率90%,多数模型对区域内容表现差,少样本提升有限。
语义空间的几何:离散与连续模型的比较研究
比较CamemBERT与词汇共现图,发现图结构更清晰,局部相似但整体不同,可引导神经网络更稳定可解释。
从正确性到实用性:基于增益的LLM推理前缀评估
提出前缀增益概念,训练前缀效用模型以提升推理成功率,超越传统正确性评估。
使用语言模型嵌入建模自定步速阅读中的语义关联
研究用语言模型嵌入计算语义关联,发现句子嵌入能可靠捕捉超出词可预测性的神经与行为效应。
SigmaScale:基于SVD低秩分解与学习缩放矩阵的大语言模型压缩
提出SigmaScale方法,通过学习缩放矩阵优化SVD压缩,降低有效秩,性能与最新方法相当。
mmPISA-bench:大语言模型在43种语言上的推理表现是否一致?
测试LLM在43种语言上的推理能力,表现接近人类但有差异;机器翻译不影响准确性,但某些语言成本高且准确率低。
风格还是内容?通过控制内容重叠评估风格分类器
通过控制内容重叠参数α,发现高重叠模型更鲁棒,为区分风格学习与内容捷径提供诊断。
你的解嵌入矩阵实际上是文本嵌入的特征透镜
发现文本嵌入偏向高频无信息词,提出EmbedFilter过滤该子空间,提升语义表示并自动降维。
中文标题:当大型语言模型在医疗领域失效:评估对提示变化的敏感性
中文摘要:研究显示医疗LLM对提示扰动的敏感性会导致危险输出,需警惕临床不可靠性。
大语言模型引导的医学决策流程进化
LLM引导进化优化医疗决策,在分诊、咨询和图像分类中显著提升准确性与召回率,产生可解释策略。
KIT在IWSLT 2026跨语言语音克隆任务中的方案
提出语言标签提示、强化学习微调及词汇匹配法,提升跨语言语音克隆可理解性与术语发音,语言提示增益最大。
Phun-Bench:评估大语言模型的中文语音理解能力
Phun-Bench是评估大语言模型中文语音理解能力的基准,涵盖同音、押韵、语音相似度,发现模型难以像人类一样灵活运用语音知识。
SV-Detect:使用导向向量的AI生成文本检测
提出基于导向向量的检测方法,从语言模型隐藏层提取方向特征,轻量分类器实现跨域、跨模型及编辑攻击下的高性能机器文本检测。
谄媚式赞美:评估语言模型中的过度赞扬
提出参数化框架衡量赞美是否过度,发现社交领域更常见,构成独立对齐挑战。
M³Exam:面向真实用户-智能体交互的多模态记忆基准测试
提出M³Exam基准评估多模态记忆,揭示跨模态推理差距;M³Proctor方法提升准确率13%,索引和令牌开销降低70%以上。
被掩盖的优势:揭示大语言模型中本地语言获取文化知识的潜力
本地语言在LLMs中获取文化知识有隐藏优势,原始准确率因语言能力差异而掩盖此优势。
监督与基于演示的上下文学习在多词表达分类中的对比
土耳其习语轻动词结构分类中,监督模型稳健,而LLM在精心设计的演示下可超越或匹敌它,但提示敏感性高。
LLM在掷骰子时有多可靠?
标准问题准确率达0.96,但反直觉问题仅0.59,令牌偏差和误导提示削弱性能,当前LLM并非真正概率推理器。
DEFINED:一种用于辩论场景中细粒度创造力评估的数据高效计算框架
提出DEFINED框架,用八维指标和层次化语言模型实现辩论创造力细粒度评估,性能优于现有方法。
Agentopia:智能体社会中的长期生命模拟与学习
提出Agentopia框架,模拟百个智能体十年社会生活,用生命奖励训练LLM,角色扮演提升15.6%。
Phonetic Error Analysis of Raw Waveform Acoustic Models
MADRAG:结合检索增强生成的多智能体辩论框架用于免训练分析性作文评分
MADRAG通过多智能体辩论与检索增强,无需训练即可实现高质量分析性作文评分,性能接近监督系统。
Transformer注意力场的多尺度本征正交分解:基于Morlet小波图谱的尺度选择性分析
利用Morlet小波与POD对注意力场进行尺度选择性分析,提取各尺度主导模式,揭示层依赖的尺度组织,无需修改架构或语言标注。
Meaning in Order, Order in Meaning: Semantic R-precision for Keyphrase Evaluation
文本监督提升视觉-语言模型的地理空间表征能力
文本监督增强视觉-语言模型的地理空间表征,多模态学习是地理空间AI的关键方向。
HKVM-RAG: 面向多跳RAG的键值分离超图证据组织
HKVM-RAG通过键值分离超图组织证据,以超边为检索键,提升多跳问答F1,作为可复用的证据控制机制。
Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests
教会奖励模型自我纠正:基于奖励引导的对抗性失败发现实现鲁棒奖励建模
提出REFORM框架,通过奖励模型自生成对抗样本进行自纠正,提升鲁棒性且不牺牲奖励质量。
MMAE:大规模多任务音频编辑基准
首个通用音频编辑基准,覆盖7种模态、6级复杂度,2000样本+17,741评估标准,揭示模型精确匹配率低于5%。
TEVI:基于文本条件的视觉表征编辑——利用稀疏自编码器改进视觉-语言对齐
提出TEVI框架,利用稀疏自编码器解耦图像嵌入,基于文本选择性保留信息,提升检索性能与鲁棒性。