付费知情:智能代理电商中已验证产品信息的微交易市场
代理电商中,自主代理微交易付费逐步解锁已验证信息,奖励真实质量,促进公平竞争。
SHERLOC:面向代码修复代理的结构化诊断定位
SHERLOC无训练框架实现SWE-Bench SOTA定位,提升修复率5.95pp,减少定位和总令牌36.7%和23.1%。
少即是多:面向科学摘要的质量感知训练数据选择
构建大型生物医学摘要数据集,发现作者摘要质量不一,按质量选择训练数据可提升效率,优于随机采样。
L3Cube-MahaPOS:一个马拉地语词性标注数据集和BERT模型
发布含3.2万手工标注句子的马拉地语词性数据集,MahaBERT-v2模型达88.67%准确率。
任务分解以提高标注效率
提出任务分解法降低标注推理负担,通过识别中心优化子任务分配,提升预算内质量。
EvidenceLens:用于审计金融问答的声明-证据矩阵
EvidenceLens用多模态矩阵分解金融问答为原子声明,可视化对齐证据,识别虚假或过度自信的合成回答。
CANDLE:使用轻量级编码器的字符级阿拉伯语噪声去重
CANDLE创新应用CTC进行阿拉伯语字符去重,无需规则,错误率低至5.37%,蒸馏后深度减3倍,分词器生育率降12.8%。
后验精炼:基于任意顺序流映射的快速语言生成
提出FMLM+框架,通过后验精炼实现单步生成与自适应纠正,以32倍更少NFE达到基线质量。
面向对齐器-编码器ASR的渐进式对齐目标
提出InterAligner,通过中间对齐与CTC损失渐进优化对齐,在LibriSpeech上将WER从5.0/7.8降至3.1/5.6。
少样本思维链驱动推理以促进大语言模型进行开放式医学问答
提出开放式医学问答数据集MEDQA-OPEN及CLINICR推理提示,优于现有方法,并探索多鉴别诊断与奖励模型验证。
ESBMC-PLC+:作为PLCverif后继的统一IEC 61131-3形式化验证框架
提出统一框架,支持三种IEC 61131-3输入格式,实现无界安全证明,性能优于PLCverif和nuXmv。
VieSpeaker:超越视觉依赖的大规模越南语说话人识别数据集
提出不依赖人脸的大规模越南语说话人识别数据集VieSpeaker,含902小时语音,提升模型鲁棒性与泛化能力。
对话引领发现:面向属性的偏好引导用于对话式产品搜索助手
D2D框架动态利用产品属性引导对话,准确率提升22-30%,放弃率降低7-16%,对话长度缩短27.5%,显著提升用户满意度与效率。
Agon:基于提示经济的大规模全学科自主研究系统
Agon系统通过提示经济实现大规模研究自主,机器处理可验证部分,人类负责关键判断,推动“机器扩展,人类引导”新范式。
ComputeFHE:一个保护隐私的通用计算库
基于TFHE的开源C++库,提供加密整数与定点数运算及高效ALU,性能提升达3.9倍。
CORE-BREW: 基于LLR软解码的鲁棒多比特LLM水印
CORE-BREW通过固定命中率校准信道,利用每token对数似然比软解码,实现低虚警鲁棒多比特水印检测。
ParaPairAudioBench:面向LALM评判的副语言成对音频基准
提出含5175对音频的五维副语言基准,发现LALM评判低于人类32%且校准失败,用于评估可靠性。
PETRA:用于石油工程领域自适应的网络文本转化
PETRA通过转化网络文本构建大规模合成监督数据集,显著提升石油工程检索与重排序的领域适应性能。
MERGE:面向自然语言推理的最小表达式替换泛化测试
提出MERGE测试,用MERE自动生成变体,评估NLI模型,发现其泛化能力差。
CORE-Bench:通过计算可重复性智能体基准提升已发表研究的可信度
基于90篇论文270个任务评估AI智能体计算可重复性,最佳准确率21%,旨在提升科学可信度与自动化研究。
用未见随机变量问题评测大语言模型数学推理
RV-Bench通过随机变量问题测试LLM真实推理,揭示已见与未见数据间能力失衡,泛化有限但测试时缩放可提升。
稀疏前沿:Transformer大语言模型中稀疏注意力的权衡
稀疏注意力可提升长上下文效率,大稀疏模型优于小密集模型;预填充阶段细粒度估计不实用;长序列容忍更高稀疏性。
面向文本与代码生成的大语言模型集成学习:综述
综述大语言模型文本与代码生成的七种集成方法,指出其提升多样性、质量和灵活性,为多模态扩展奠基。
规则即业务:基于大语言模型的业务规则流建模基准与框架
提出BREX基准(409文档/2855规则)与ExIde框架,无需微调建模含分支并行的业务规则,可执行引导显著提升提取效果。
中文标题
视觉-语言模型因果推理能力弱,源于训练数据缺乏因果表达,硬负样本微调可改善。
Balalaika:面向数据、韵律感知的俄语语音标注流水线
开源Balalaika流水线结合语义VAD与多ASR集成,构建5.1k小时俄语语料库,显著提升语音去噪与TTS性能。
Rule2Text:知识图谱规则的自然语言解释生成与评估框架
提出Rule2Text框架,用LLM生成规则解释,通过评估微调模型,显著提升解释质量。
打破镜像:基于激活的LLM评估者自偏好缓解策略
转向向量可减少97%不合理自偏好,但稳定性不足,需更强干预。
探索函数向量中的语言无关性:以机器翻译为例
研究表明翻译函数向量可跨语言迁移,编码语言无关信号,提升多种未见语言的效果。
选择性旋转位置编码
提出输入依赖的旋转嵌入机制Selective RoPE,提升语言建模及序列任务性能。
说话时思考:推理时知识迁移实现响应式智能对话语音代理
提出对话填充方法,说话时边回应边集成大模型知识,实现毫秒级响应且准确率接近前沿模型。
PEARL:基于强化学习的自进化时间管理助手
提出PEARL框架,通过强化学习与外部偏好记忆解决日历冲突,错误率降低76%。
AfriqueLLM:数据混合与模型架构如何影响非洲语言的持续预训练
针对20种非洲语言,研究发现数据组成是关键,加入数学、代码和合成翻译数据可提升推理能力,架构选择比模型规模更重要。
LLM评估者真的是自恋狂吗?对自我偏好评估的合理性检查
纠偏实验表明,LLM自评偏好仅51%有统计显著性,主要源于评估质量而非自恋。
ErrorLLM:为文本到SQL优化建立SQL错误模型
ErrorLLM通过显式建模SQL错误并引入专用错误标记,实现高质量检测与引导优化,显著提升生成性能。
SciZoom:LLM时代层次化科学摘要的大规模基准
包含4.5万篇ML顶会论文,提供三级摘要(压缩比达600:1),揭示LLM前/后时代写作风格变化(短语模式变10倍,模糊措辞降23%)。
现行允许使用LLM润色同行评审的政策无法执行
检测器误将LLM润色判为AI生成,致政策不可执行,AI使用率或夸大。
WAND:窗口注意力与知识蒸馏的高效自回归文本到语音模型
WAND框架分离注意力为全局和局部窗口,结合课程学习与知识蒸馏,在三个模型上保持质量并减少66.2% KV缓存,实现恒定延迟。
社会对齐框架可提升大语言模型对齐
借鉴社会、经济、契约对齐框架,将目标不明确视为机会,参与式界面设计可提升LLM对齐。
Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages
无需窥探的调优:可证明的泛化边界与鲁棒的大语言模型后训练
提出BBoxER黑盒方法,通过信息瓶颈提供泛化界与鲁棒性保证,实验显示能学习并抗成员推断攻击。
倒排索引遍历的P完全性:论布尔查询有向无环图评估的复杂性
证明倒排索引上布尔DAG查询评估的P完全性,并设计ComputePN算法实现O(|Q|·|U_active|)时间,避免指数爆炸与全局扫描。
FALCON:通过自我反思将网络威胁情报转化为可部署的入侵检测系统规则
FALCON框架通过自省机制实现CTI到IDS规则的实时生成与验证,达到高相关性和分析师一致性。
TruncProof:基于令牌长度约束的LLM生成JSON的护栏方法
提出TruncProof方法,利用LL(1)解析器在令牌限制下生成语法有效的JSON,确保输出正确且语义准确。
去除噪音,而非寻找金矿:大规模预训练中的质量过滤
CQF提升下游任务但未改进高质量数据语言建模,与合成数据趋势不同,质疑其质量衡量能力。
中文标题:现实中的AI小说
中文摘要:基于50万对话分析,超三分之一涉及AI生成小说,用户偏爱同人与情色,并反复请求修改叙事,出现“无限故事需求者”。
中文标题:面向大语言模型微调的双层数据策管:离线选择与在线自优化生成
中文摘要:提出双层数据策管框架,结合离线选择与在线自优化生成,提升微调数据质量与模型性能。
LangMAP:一种语言自适应的分词方法
LangMAP扩展UnigramLM到多语言,从共享词汇生成语言特定分词,提升语法和代码边界对齐,推理时不需语言标签。
块级码字嵌入实现可靠多比特文本水印
提出BREW框架,通过块级投票和滑窗验证,在10%同义词替换下达到0.965真阳性率、0.02假阳性率,解决高假阳性结构缺陷。
一种用于钓鱼与威胁分类的混合多层检测管道:独立验证的URL与NLP引擎及校准多通道融合阶段
提出混合多模态钓鱼检测管道,融合URL/NLP/威胁情报引擎,基准测试F1达0.914,假阳性率3.6%。