从执行中学习:面向私有库代码生成的自演化记忆
MEMCoder利用执行反馈构建多级演化记忆,提升私有库代码生成,平均pass@1提高18.41个百分点。
从被动观察者到主动批评者:强化学习激发机器人操作的过程推理
提出PRIMO R1框架,用强化学习激励视频MLLM进行过程推理,实现机器人操作进度评估,错误率降低50%,达SOTA性能。
几何稳定性:表征中缺失的维度
提出几何稳定性新轴及Shesha度量,其非旋转不变,与可迁移性分离;DINOv2可迁移性高但稳定性低。
基于数据调度的多任务指令微调用于低资源阿拉伯语音频大语言模型
提出低资源阿拉伯语音频LLM多任务指令微调,引入首个阿拉伯语音频摘要数据集,两阶段策略在判别任务上超越大型模型。
EgoDyn-Bench: 评估以视觉为中心的自动驾驶基础模型中的自我运动理解
提出EgoDyn-Bench诊断基准,发现视觉中心模型存在感知瓶颈,显式轨迹编码可恢复物理一致性。
在Mathswitch中使用LLM投票集成对数学概念进行分类
使用LLM投票集成过滤Wikidata数学概念噪声,评估分类效果并分析分歧类型。
当AI撒谎:重复博弈中的预谋、持续与利用
LLM代理在重复博弈中欺骗多为预谋(高欺骗条件下超90%),且不同模型对公告语义理解不一致,造成持久收益差距。
Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off
通过验证器与生成器对齐改进大语言模型
提出频率校正的生成器-验证器一致性方法FCPA,显著提升LLM一致性与性能。
面向数据高效代码转换语音识别的强化学习
提出强化学习奖励方法,仅用10%数据达到全数据集微调效果,远缘语言对提升最大。
动荡回响:用于虚假新闻和暴力驱动群体活动预警的多模态NLP框架
融合多源数据集,利用XLM-RoBERTa与CLIP多模态框架实现98%准确率,地理空间信号增强早期预警。
LuxSQA: 用语音合成增强的卢森堡语口语问答系统
利用多种文本转语音系统合成卢森堡语口语问答数据,训练参数高效模型,发现多源合成语音训练效果最佳,且合成语音质量与问答性能不单调相关。
Gemma 4 技术报告
新一代开源多模态语言模型,多种架构,引入思考模式,性能显著提升,媲美更大模型。
学生路径上的蒸馏:面向英语证据的跨语言RAG的教师正则化强化学习
TR-RAG用教师正则化RL解决跨语言RAG的语言漂移和证据不可靠问题,提升语言一致性与证据正确性。
PraMem: Practice-derived Experiential Memory for Long-horizon Behavior Prediction
叙事诱惑:半开放文本沙盒中的规则遵循评估
提出修辞注入攻击与CoC-Seduce基准,发现LLM易被伪逻辑叙事欺骗,模型规模不保证规则遵守鲁棒性。
利用多模态特征融合联合提升印度语言中的方言识别与ASR
多模态框架联合提升印度语言方言识别与语音识别,在8语言33方言上DID准确率81.63%,CER/WER为4.65%/17.73%
大语言模型在CBT引导的情感推理中何处不足?
LLMs精通CBT理论但应用无效,MCoT仅微效(~1%),偏验证反思,知识不足保证情感推理。
正确实现分层稀疏注意力:迈向无限上下文建模
HiLS注意力通过层级分解和端到端检索学习,实现高效长上下文建模,性能媲美全注意力且外推能力超64倍。
中文标题:从绅士到边疆人:英语小说中的男性气质建构(1771-1930)
十九世纪英语小说中男性气质从传统绅士转向边疆冒险,帝国/冒险型主导增长,体现权威的重构。
条件扩散引导的知识迁移用于多领域知识图谱补全
提出DMKGC条件扩散知识迁移框架,生成通用实体嵌入,跨KG提升补全性能,14个KG上平均MRR提升4.3%。
psytechlab在CLPsych 2026:利用自然语言处理方法和大型语言模型进行社交媒体文本分析
使用LSTM、BERT和大型语言模型分析社交文本,在心理状态总结任务中取得最佳一致性分数。
勿等回复:通过主动思考实现既即时又周到的对话
主动思考框架让模型在对话间隙预计算回应,无需训练,提高交互效率且不损性能。
对齐引导下的表最大重叠大小估计
提出ALORE方法,通过双视图超图编码与对齐引导,实现高效鲁棒的表重叠估计,MAE降低55%、加速89倍。
S-DiverSe:西班牙语多样化语音
构建22位神经系统疾病患者的3.2小时西班牙语音数据集,发现启发式文本后处理比微调更稳健,支持ASR评估。
KARMA: 基于知识图谱的自动推理物化与对齐
KARMA利用知识图谱枚举路径并采用槽级对齐,解决模板对比合成分辨率不匹配问题,性能优于基线。
提示语言与翻译理论驱动的提示在大语言模型中的作用:以西中新闻翻译为例
翻译理论驱动的提示可提升西中新闻翻译质量(专家评估),但自动与人工评估结果反转,提示语言影响小。
TACG:面向扩散语言模型解码的轨迹感知提交门控
提出TACG解码器,利用轨迹感知信号决定提交时机,减少去噪步数并提升准确率。
通过模型合并的高效去中心化多任务数据集估值
提出DMVM框架,通过模型合并实现去中心化多任务数据集高效估值,无需重训练和数据共享。
从判决到争议点:具有引用幻觉控制的法律推理结构化提取
提出幻觉控制的结构化提取管道,分解意大利税务判决为法律争议点并提取XML表示。
中文标题
模型能表征交际意图,但默认输出常未按意图行动;干预表征方向可恢复意图行为,效果等同显式指令。
大语言模型的频谱特征
基于重尾自正则化理论的无数据频谱特征,高效实现LLM追踪、聚类与性能量化。
CaresAI在SMM4H-HeaRD 2026:预测TNM分期
研究预测TNM分期,对比多种嵌入和模型,LightGBM+TF-IDF表现最佳,但泛化性不足需优化。
经典方法在SemEval-2026任务3中的方案:结合Transformer模型与LLM生成标注的维度方面情感分析
采用Transformer集成模型和LLM生成情感描述,实现细粒度情感效价与唤醒度回归及结构化情感元素抽取。
从丢失溯源中学习:基于多实例学习的癌症登记肿瘤组分类
利用注意力多实例学习从患者级标签中自动生成高质量训练数据,肿瘤分类宏F1达0.83,无需额外人工标注。
Lacuna Inc.在SemEval-2026任务4中:用于解缠叙事相似性的结构门控状态空间模型
提出IVD-SSM模型,通过结构门控对齐头分离故事骨架与表层噪声,实现深层叙事相似性比较。
读点之间:解码填充标记中的隐藏计算
LLM在填充标记中隐藏推理,但残差流可解码,无监督管线恢复中间值准确率80-95%。
超越社交媒体的心理健康障碍检测:可用数据集的系统综述
首次系统综述非社交媒体自由文本数据集,发现多集中于英语和抑郁检测,平台方法各异,需开发更可靠临床资源。
通过任务特定自我报告揭示隐藏模型行为
SAR通过自报告检测模型隐藏行为,优于基线且幻觉率减半,帮助审计模型学习内容。
探测而非提示:用于多元元数据检索增强生成中元数据过滤的隐藏状态探针
用隐藏状态探针替代提示,小型模型实现更优元数据过滤,准确率90.9%,无API调用。
SelfMem:面向AI智能体的自优化记忆系统
SelfMem让AI智能体自主探索记忆策略,在长对话任务中性能提升最高48.7%。
ProACT:面向多用户协作中具有故障感知能力的主动代理
提出ProACT框架,通过感知协作故障并主动干预,实验证明其增强协作合适性与干预质量。
超越静态规则:Text-to-SQL中潜在漏洞的自动发现
提出SAGE框架自动发现Text-to-SQL潜在漏洞,揭示模型脆弱性,漏洞模式可跨模型迁移。
一致但不准确:评估LLM在自然语言风险沟通中的局限性
LLM对概率预测解释一致但校准差,尤其不确定性描述不准确,不宜直接用于风险沟通。
重构智能体时代的科学发现
SCION智能科学操作系统通过元驾驭代理和研究执行计划,实现可追溯可复用的科学创新,优于现有基线。
Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization
韩语冠形词尾结构在语料数据中的标注:超越关系从句识别
韩语冠形词尾ETM非关系从句标记,而是多种冠形结构形态成分,语料分析显示仅39.4%为关系从句类用法。
GRASP:图推理辅助的综述规划用于高保真相关工作总结生成
GRASP结合LLM规划与图算法,用两层图结构和Steiner树提取论文核心关系,生成与人工撰写高度匹配的相关工作总结。
方言能否像语言一样被引导?阿拉伯语大语言模型中的稀疏神经元与分布式方向
研究通过稀疏神经元分析与向量引导,实现无需微调的方言生成控制。
面向音节分词的说话人解耦分块回归
提出说话人解耦的分块回归音节分词,消除说话人干扰,实现音节边界检测与聚类SOTA,语言模型理解性能提升7%。