SelfMem:面向AI智能体的自优化记忆系统
SelfMem让AI智能体自主探索记忆策略,在长对话任务中性能提升最高48.7%。
ProACT:面向多用户协作中具有故障感知能力的主动代理
提出ProACT框架,通过感知协作故障并主动干预,实验证明其增强协作合适性与干预质量。
超越静态规则:Text-to-SQL中潜在漏洞的自动发现
提出SAGE框架自动发现Text-to-SQL潜在漏洞,揭示模型脆弱性,漏洞模式可跨模型迁移。
一致但不准确:评估LLM在自然语言风险沟通中的局限性
LLM对概率预测解释一致但校准差,尤其不确定性描述不准确,不宜直接用于风险沟通。
重构智能体时代的科学发现
SCION智能科学操作系统通过元驾驭代理和研究执行计划,实现可追溯可复用的科学创新,优于现有基线。
Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization
韩语冠形词尾结构在语料数据中的标注:超越关系从句识别
韩语冠形词尾ETM非关系从句标记,而是多种冠形结构形态成分,语料分析显示仅39.4%为关系从句类用法。
GRASP:图推理辅助的综述规划用于高保真相关工作总结生成
GRASP结合LLM规划与图算法,用两层图结构和Steiner树提取论文核心关系,生成与人工撰写高度匹配的相关工作总结。
方言能否像语言一样被引导?阿拉伯语大语言模型中的稀疏神经元与分布式方向
研究通过稀疏神经元分析与向量引导,实现无需微调的方言生成控制。
面向音节分词的说话人解耦分块回归
提出说话人解耦的分块回归音节分词,消除说话人干扰,实现音节边界检测与聚类SOTA,语言模型理解性能提升7%。
BanglaMemeEvidence:孟加拉语模因解释性证据检测的多模态基准数据集
首个孟加拉语模因证据检测研究,构建2917模因数据集,提出多模态框架,F1达0.74,填补低资源语言空白。
TRACER:面向任务型对话的早期故障检测
TRACER通过信念状态变化与文本表示,从部分对话中提前预测任务型对话的最终失败,实现有效预警。
NormWorlds-CF:基于求解器验证的反事实规范推理与变质关系GRPO
提出求解器验证的反事实规范推理环境NormWorlds-CF,采用变质关系GRPO奖励,在结构化变化任务中优于答案监督。
为AI智能体提供自然语言工具的显著有效性:一项跨14个模型验证NLT性能的复制研究
NLT提升工具调用准确率14.9%,减少关键错误93%,且对非原生工具调用模型增益显著。
将表示与重建分离实现可扩展文本编码器
CrossBERT分离表示与重建,支持高掩码比和梯度收集,吞吐量与样本效率翻倍,性能领先。
面向LongEval-RAG的候选集约束检索增强生成:系统设计与实证分析
最优变体为规则分块加MiniLM句子重排序,增益来自稳定证据单元与神经选择结合。
CrossHallu:大型语言模型内部幻觉信号是否跨语言和领域泛化?
研究六种LLM内部表示,发现幻觉信号在大多数模型中跨语言和领域可转移,性能取决于特征空间中类可分性和语言对齐。
Telescope:通过测量令牌重复概率改进对LLM生成内容的零样本检测
利用LLM对令牌重复的先天厌恶,提出Telescope Perplexity指标,实现高效零样本检测,性能领先。
AI Wizards在EXIST 2026:用于模因中多模态性别歧视识别的分层软标签学习
提出分层条件软标签预测,采用轻量Gated MLP和KL散度训练,在EXIST 2026中获Task 2.3第一。
面向开放网络检索增强型大语言模型的风险约束时效感知语义缓存
FreshCache三级语义缓存通过风险约束时间推断,在24小时窗口以0.1%过期错误实现97%搜索API节省。
超越多语言平均:MTEB-PT——葡萄牙语句子编码器基准
MTEB-PT基准揭示葡萄牙语嵌入性能任务依赖,长上下文模型及语言微调可显著提升效果。
通过扰动实现基于感知的敏感性检测检索增强生成中的幻觉(GASP)
GASP通过测量答案对检索证据的敏感性检测幻觉,在RAGTruth上达AUC 0.73/0.67,无需训练即可超越基线。
可解释性设计:注意力机制与端到端Transformer
通过sigmoid使注意力值通道成为可读检测器,构建端到端可解释语言模型,前馈单元为命名集合操作。
CausalGame:在游戏中评估LLM智能体的因果推理能力基准
提出CausalGame基准,通过游戏测试LLM智能体因果思考,模型表现较差,最佳准确率仅68%。
变废为宝:事后重标记LLM智能体轨迹生成成功示范
HSL事后标记意外成功目标,优化LLM智能体,提升长程任务性能且样本高效。
WPG-MoE: 弱先验引导的密集混合专家模型用于用户级社交媒体抑郁检测
提出弱先验引导的MoE模型,利用用户语义先验路由专家,提升抑郁检测准确率。
记忆编排语义系统(MOSS):一种可审计的智能体记忆架构
MOSS是一种可审计的智能体记忆架构,基于关系数据库实现符号化检索,确保透明、模型无关并支持长期知识积累。
语义整合与词汇预期塑造自然阅读中的N400和P600动态
上下文语义相关性在N400和P600窗口解释脑电反应,超出词汇预期,表明自然阅读依赖语义整合和词汇预期。
UI-MOPD:面向持续GUI智能体学习的多平台在线策略蒸馏
提出UI-MOPD方法,利用多教师在线策略蒸馏实现跨平台GUI智能体持续学习,平衡旧平台能力保留与新平台适应,成功率分别达38.2%和12.0%。
大语言模型在Lean验证代数结构上的机制级路由失败
大模型在代数验证中机制级路由失败,暴露线索后准确率提升超10%,且真值推理与机制分类可分离。
勿单独承诺:扩散大语言模型中的联合令牌承诺
提出CoCommit方法,通过标记门控协调传递实现联合令牌承诺,减少因子化误差,提升推理和精确答案任务准确率。
dOPSD:扩散语言模型中的同策略自蒸馏
dOPSD通过模型自身去噪轨迹进行同策略自蒸馏,提升数学推理和代码生成能力。
evalci:用于语言模型评估统计严谨比较的Python库
evalci库对逐项结果表进行统计检验,输出置信区间和p值,揭示模型排名差异显著性。
埃菲克语的数字保存:面向低资源非洲语言的TTS
首次为尼日利亚埃菲克语构建TTS,比较四种模型,MMS-TTS最优但声调错误,需更大语料和声调建模。
具备可证明对齐保证的大语言模型不确定性感知弃权机制
CIC框架将不确定性分数转化为风险可控的选择性回答,在有限样本下保证错误率≤α并最大化回答率。
中文标题:移植、反转与预防错位人格:Qwen2.5中方法条件性的突现错位
中文摘要:Qwen2.5模型存在可移植的错位潜人格,低秩微调比全量微调更易诱发,正交微调可选择性预防。
从语言统计中学习核心概念区分的失败与成功
语言模型对统计频率敏感,但仅GPT-4能区分原则性与统计性属性,表明核心概念区分可从语言中学习。
语言模型以共享几何表示和变换概念
语言模型共享概念变换几何,位移方差具语义组织,结构可跨模型预测。
标题:时间维度的文章级可信度信号能否提升域名级可信度预测?
提出基于专家评级的时序框架,研究从文章内容自动评估新域名可信度的可行性。
EEG-SpikeAgent:用于自动化EEG尖峰检测的智能体闭环程序合成
基于LLM智能体迭代生成信号特征,实现EEG尖峰自动检测,AUC达0.935,兼具高准确度与可解释性。
ToolFailBench:诊断LLM代理工具使用故障的基准
提出诊断工具使用失败的基准,发现不同模型虽总分相近但失败模式迥异。
中文标题
通过分析Reddit青少年药物使用讨论,发现周末深夜高峰、负面情绪主导及具体语义主题,为预防干预提供依据。
文本保真度与多样性度量
基于最优传输散度提出文本保真度与多样性度量,可区分数据质量缺陷,并检测合成数据多样性不足对下游模型准确率的影响。
渐进式披露用于LLM维护的维基知识库:预注册消融研究
渐进式披露未节省索引加载,但通过精准访问降低成本,质量不降反升。
MTEB-PT: A Text Embedding Benchmark for Brazilian Portuguese
先错后对:对齐语言模型中的后期补救与接口失败
对齐模型存在内部先错后对机制:中间层暂时偏好错误,靠后期层纠正,该现象可预测压缩失败且可通过训练缓解。
回溯式思维链(RetroCoT):以法医重建提示作为跨代模型的安全诊断
RetroCoT攻击揭示模型对齐依赖语用框架而非语义,GPT-5虽能拒绝但易受对抗反馈绕过。
FormalRx:自动形式化中语义失败的修正与检查
提出FormalRx诊断框架,基于28类错误分类法,实现自动形式化错误判定、分类、定位与修正,性能优于基线。
所见即所得:面向图表到代码生成的观测对齐监督
提出观测对齐监督框架,替换图表代码生成中不可观测原始变量为视觉可约束量,提升可观测值恢复。
将离策略令牌转化为在策略令牌:一种提升大语言模型对齐的插件方法
提出选择性重要性采样,将离策略令牌转为在策略令牌,插件化减少方差,显著提升对齐鲁棒性。