可扩展、可迁移的数据选择元网络需要一种不同的损失函数(以及为什么那个显而易见的选择存在问题)
提出TESS框架,以逐点价值匹配目标替代逐样本权重,解决优化不稳定与泛化差问题,实现跨数据集、跨模型规模的可迁移数据选择。
旧观念,新问题:基于大语言模型的新颖性评估的不稳定性
提示词微调即可翻转大模型新颖性判断,准确率波动超50点;检索与长推理帮助有限,专用评估器不如简单基线,创意增益存疑。
基于自适应Tversky策略优化的可控多标签视频安全检测
提出ATPO框架,用自适应Tversky奖励调节误报漏报惩罚,实现可控多标签视频安全检测。
LLM2Jev:大模型本身已是Jev式决策模型——何时以及如何微调它们
通用LLM无需训练即可输出校准的类别决策,微调仅对弱模型和特定任务有益。
层次化连续扩散语言模型
提出层次化连续扩散语言模型HC-DLM,耦合离散词元与连续隐轨迹去噪,在推理、语言建模上优于扩散基线
从知识访问到源学习:构建面向特定信息源的能力
提出SourceLearn,以自主与任务引导学习构建可持久化的源模型,13/15项设置最优,最高提升22.6分。
关键词评测框架会误放行:面向小语言模型工具使用主张的低成本诊断阶梯
关键词评测会误判小模型工具使用;逐字复现和首词元探针定位失败,定向微调廉价修复,但仍过度触发。
基于栈的语言模型在轻度上下文敏感人工语言上的类型学对齐
研究基于栈语言模型在交叉序列依存上的泛化,工作记忆受限者泛化更佳,或解释语序类型共性。
AutoCompact:学习长时程编码智能体中的上下文压缩时机
AutoCompact 训练编码智能体自主压缩上下文,在 SWE-bench 与 PolyBench 通过率提升 9.2%/5.0%。
Argo-Bench:评估企业级工作流中的数据智能体
提出Argo-Bench企业数据智能体评测,模拟仓库,任务需跨表推理并行动,顶尖模型均分59.5。
神经音频编解码器对非洲语音的鲁棒性如何?多任务基准与感知质量的局限
七种神经编解码器的非洲语音基准:感知指标与下游任务脱节,对话域退化最重,LoRA微调可部分恢复。
高价值合成监督用于紧凑日语语音模型的参数高效适配
合成日语护理语音上,LoRA以约0.85%参数接近全量微调,但临床与真实迁移未验证。
从网络(日志)到网络(AI):ICWSM二十届年会中的问题、平台与方法
分析ICWSM 2139篇文献:平台焦点从博客转向Twitter、Reddit,治理与危害议题上升,方法持续演进。
大语言模型品牌推荐中的系统归因:单条回答可识别系统,聚合品牌画像无法迁移
单条回答可高精度识别LLM系统,聚合品牌画像跨域不迁移。
将 CPU 语音合成推向极限:无服务器架构与计费下的极致推理调优
面向按实例计费的无服务器CPU,用请求级并发与可回收实例生命周期优化TTS,降本4.1倍并减少闲置内存。
KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准,兼具免运行时可验证奖励
KaliBench:Kali 安全命令基准;开源模型准确率不足42%,其奖励训练使8B媲美685B。
向语言模型索要彩票号码:重复六选49输出中的集中现象
六款语言模型生成1—49随机数时输出高度集中:多样性远低于均匀抽样,众数票占比达22.5%—68%。
令牌化密钥门控适配器路由:一种防止大语言模型私有数据泄露的安全访问控制机制
提出Locket:以密钥令牌门控LoRA适配器路由,实现LLM细粒度访问控制;有效令牌解锁私有知识,无效则脱敏,兼顾效用与隐私。
体积、延迟与隐私约束下的端侧商业意图检索:带类型化出站边界的 3 MiB 检索系统
端侧商业意图检索:3MiB、20ms、数据不出端;6020类4位嵌入,韩语商品Top-5达75%。
逃逸攻击:对抗噪声如何绕过机器学习分类器
对抗噪声使MNIST分类准确率大幅下降,位深防御仅部分恢复;文本扰动未致标签翻转。脆弱性随模态而异,鲁棒性须实测。
开发用于从韩语发票中提取信息的OCR模型
提出深度学习与图像预处理结合的高效OCR模型,自动提取韩语发票信息,F1达87%,处理耗时极低。
对齐预测:从训练数据中预测失准
提出训练前预测对齐失败的任务与五千题基准;其预测脚手架优于基线,能筛出有害样本,但实践指导仍需改进。
TRACE:面向肿瘤学大语言模型的可部署树-关系结构增强
TRACE以可更新树关系结构增强肿瘤学大模型,离线学习、在线检索证据,提升分类问答且可解释。
FD-VAD:面向流式全双工语音的语义端点检测
FD-VAD以因果音频语言推理实现无ASR流式语义端点检测,直接判定继续/停止,提升话轮结束召回。
评估提示扰动对大型语言模型偏见与幻觉的影响
评估提示扰动对LLM偏见与幻觉的影响:扰动可缓解部分模型问题,Claude 3优于GPT3.5。
筛与智:面向可靠RALM弃答的高效干扰过滤
检索失败分为无答与干扰,轻量Sieve先滤除干扰证据,再由Sage生成或弃答,准确率与效率大幅提升。
从词汇基线到智能体式检索增强生成:基于SFIA框架的结构化技能与责任级别抽取
首个SFIA结构化技能与级别抽取基线:检索召回最多,生成更准,仅显式判级可靠,多智能体增益有限。
环境引导:利用数据流控制提升智能体效用与安全性
将智能体与环境状态建模为数据库表,运行时按策略校验数据流,违规即引导安全轨迹,攻击成功率为0%。
多模态大语言模型能否生成并检测多模态社交媒体假新闻?
多智能体框架生成9000余条跨领域假新闻图文,测评16个MLLM:多数检测远逊人类,难辨图像真伪。
当成功的记忆误导具身智能体:面向任务条件执行的记忆适配
MATE将检索轨迹适配为执行记忆:去冗余、提取条件-动作-效果、归一化动作,成功率93.3%。
如何对LLM评判者做统计并信任其结果:面向小样本AI评估的校准推断与evalstats工具
小样本AI评估中,原始LLM评判分数易致假阳性;提出PPI等校准方法,开源evalstats工具。
Lookahead-R:基于执行中心规划的预算感知工具检索
Lookahead-R把工具检索变为预算约束序贯决策,用轻量世界模型预测成功率与延迟,借蒙特卡洛树搜索实现更优精度效率权衡。
车载对话助手多轮对话的自动化评估
提出闭环仿真框架,以策略引导用户模拟器和双层LLM评判自动评估车载助手多轮对话,识别更多失败类型。
可靠但设计敏感:大语言模型标注中的工具不确定性
大语言模型标注可重复,但换任务设计或模型即变,称为工具不确定性;置信度不能替代多设计比较。
通过受控环境干预构建具有挑战性的浏览器使用任务
用受控环境干预把难度变为可编程属性,构建BreakingWeb基准:519对任务使智能体通过率降22.9%,失败多为虚假成功。
τ-多语言:跨语言语音智能体基准测试
推出τ-多语言基准,覆盖五种语言全双工通话评测:韩语、普通话完成率明显落后,失败模式各异。
PrimeSeeker:面向能力的深度搜索智能体监督
提出潜在锚点推理与PrimeSeeker框架,以锚点结构生成问题及证据骨架,监督并强化训练,减少检索冗余。
追踪语言模型中谄媚性认同的机制
因果中介分析揭示,早期少数注意力头把用户观点注入残差流并偏置答案;消融可显著减谄媚而不损准确性。
更少均匀的离散扩散更强大且可扩展
提出LUDI:非均匀损失加逐词元时间嵌入,提升少步生成;7B模型可复杂推理,比自回归解码快3词元/步。
我们还能信任灾害社会感知吗?检测人工智能生成社交媒体帖子的实证证据
实证表明,文本AI检测难辨人类与AI生成灾害帖,不宜作信任门槛;需多模态、可问责来源等证据。
解决金融数据缺失危机:面向SEC 10-K提取的生成式AI流水线
评估多款LLM从SEC 10-K提取四类财务数据,规模匹配复杂度可提高零样本准确率,消除数据缺失偏差。
超越上下文窗口:面向混合检索与长上下文语言模型的自适应熵驱动路由框架
提出EDAR,以预测熵推理时路由RAG与长上下文,保留97.4%精度,token开销降70.7%。
大语言模型组合任务中的因果与可解释结构
LLM组合任务中,关系信息随层从两词联合表示渐进组合为三词表示;因果相关表示可提升下一词预测。
CruxBench:信息发现基准
CruxBench以信息价值评估LLM发现关键子问题的能力,前沿模型仍表现有限。
PACT:面向单 token 类型化决策的成对锚定校准调优
PACT将对比对的四项结构约束转为训练目标,提升单token类型化决策的稳健性与排序精度,精度持平而偏差更低。
除了关键时刻几乎与人无异:VoxParity 与声音本应改变的决定
VoxParity测试语音智能体:14行业183场景中仅11/23通过,错误偏向文字,规则提示仅部分弥补。
超球语义轨迹分析:映射学术预印本、专利信号与算力扩展中的技术扩散
提出超球语义轨迹分析,追踪预印本与专利技术扩散,发现大语言模型等子主题语义演化最快。
面向高效视觉推理的问题特定知识图谱
提出VisKG:用强化学习把视觉内容转为问题特定知识图谱,滤噪保留推理结构,token更少且更准。
大语言模型何时应信任自己的修改?一项关于内在自校正的风险感知研究
研究29个开源大模型发现,内在自校正既纠错也致错,应视为需权衡风险的修正策略。
可检测性差距:跨语言模型幻觉检测中的隐藏异质性
幻觉检测存在可检测性差距:模型对高/低一致性错误的检测能力持续异质,总体指标掩盖差异,需机制条件评估。