InfluMatch:以4B模型成本实现前沿质量的KOL搜索
InfluMatch以4B模型成本达前沿KOL搜索性能,级联系统媲美Kimi-K2.6,输出减少35倍,单A100处理50KOL仅20秒。
MemDefrag:大型语言模型的潜在内存碎片整理
MemDefrag利用中间层追踪信号进行内存碎片整理,结合信息量遗忘机制,显著提升知识保留。
从蓝图到现实:基于大语言模型多智能体模拟的普特南社会资本理论建模与应用
提出SocaSim框架,基于LLM多智能体模拟社会资本理论,再现宏观模式并揭示微观因果路径。
共享决策实践测量(OPTION12):面向更好隐私与可持续性的开源小型LLM研究
首次用开源小模型评估共享决策,通用模型优于医学模型,仍难替代人工,但为隐私保护的人机协同奠基。
CurateEvo: 面向智能体后训练的数据整理演化
CurateEvo通过失败驱动动态演化数据整理策略,提升智能体后训练效果与效率,平均得分提升3.2和2.7。
从投票到智能体协作:面向BioASQ 14b的答案类型感知LLM流水线
针对不同类型问题设计LLM流水线,结合证据排序与多智能体协作,在BioASQ 14b事实型子任务中夺冠。
LongCrafter:通过证据图引导的指令合成实现多样化长上下文理解
LongCrafter通过证据图引导指令合成,生成多样化难度可控的长上下文数据,提升模型推理并缓解“中间迷失”。
Spider 2.0-AIFunc:将现实世界文本到SQL扩展到AI原生SQL工作流
Spider 2.0-AIFunc基准含465个AI原生SQL实例,专有模型准确率67-70%,开源模型58.1%,传统智能体框架不适用。
面向深思熟虑协作的LLM智能体:部分可观测下联合决策研究
研究部分可观测下LLM智能体的深思熟虑协作,设立基准评估,发现复杂任务仍具挑战,但深思熟虑可提供反思纠错机会。
从僧伽罗语到迪维希语:低资源语音识别的跨语言迁移学习
从相关语言僧伽罗语迁移学习显著提升迪维希语语音识别,持续预训练+微调使WER降低13.5%,证实语言相关性与策略关键作用。
通过强化学习提升LLM生成流程模型质量:奖励函数设计的作用
强化学习可提升LLM生成流程模型质量,等权奖励优于侧重,但设计需适配模型架构。
基于扩散激活与类别探索的复杂网络早期语言学习
扩散激活模拟词汇习得更优,揭示类别间复杂转换与探索动态。
Pluralis v0.1:迈向多元文化、多模态、多语言的AI风险与可靠性基准
Pluralis v0.1首个文化优先的多模态多语言AI风险基准,揭露区域性安全盲点,推动全球文化对齐评估。
云安全中的自动化合规映射:基于领域自适应句子变换器
通过领域自适应句子变换器,自动化映射云安全控制与技术指标,微调模型性能显著提升,领域训练数据是关键。
从推理中估计不确定性:多语言与跨语言MCQA在大型语言模型中的大规模研究
22语言不确定性评估发现:低资源语言用英文推理可提升性能,推理语言比问题语言更重要,方法选择取决于模型规模。
DynaKRAG:多跳检索增强生成中可学习证据控制的统一框架
提出DynaKRAG,通过状态条件策略学习选择证据操作,在三个基准上取得最优F1分数,验证了协调检索、诊断与定向获取的有效性。
RSF-GLLM:通过循环软流和解耦LLM生成弥合多跳知识图谱问答中的语义鸿沟
RSF-GLLM用循环软流可微推理及解耦LLM生成,高效弥合多跳知识图谱问答语义鸿沟。
跨异构阿拉伯语传记数据库关联圣训叙述者身份:多信号实体解析管道
两阶段实体解析管道链接圣训叙述者,通过姓名、死亡年份和可靠性加权匹配,构建18.5万节点有向图并开放资源。
生活水平层级:使用地理空间数据划分邻里区域
基于开源卫星图像的建筑形态划分城市富裕程度,验证有效,可用于贫民窟识别和贷款违约分析。
分层声学-语义建模:面向全双工语音语言模型的模态分离与语义连贯性
揭示全双工SLM模态干扰的梯度冲突根源,提出分层参数分离与语义对齐通道,在语音问答和交互流畅度上分别提升7.4%和28.5%。
论无黄金标准下非人类序列依存句法分析的可行性:在其他物种中能否评估?
非人类灵长类序列长度快速衰减使无黄金标准评估可行,人类语言则困难。
CANONIC:治理即编译
治理通过编译机制管控内容入库,但无法自动识别劣质内容,仅保证记录可审计。
CCBENCH:通过健康查询中隐含信号规范评估LLM文化能力
提出CCBENCH框架评估LLM文化能力,发现最佳模型仅20-30%回应恰当,且存在适应隐含规范优于明确实践的偏差。
真实场景下的数据分析:基准测试大型语言模型应对实际数据复杂性
新基准DataGovBench针对真实数据复杂性,表问答与洞察任务揭示LLM性能差距显著。
Pitwall:基于校准实时蒙特卡洛引擎的忠实自然语言比赛策略简报
该系统生成F1策略简报,通过事实核查确保忠实性,使用校准的蒙特卡洛引擎在2025-2026赛季验证成功,top-3准确率90.3%。
Decision Protocols in Multi-Agent Large Language Model Conversations
工具使用何时提升有限精度循环模型的表达能力?
有限精度循环模型使用有限状态工具无增益,但使用磁带工具即图灵完备,存在指数分离,选择性是关键。
CMDR:上下文多模态文档检索
提出CMDR任务及CMDR-Embed框架,通过联合编码多页和上下文对比学习,显著提升文档检索效果。
嵌套情景状态拓扑(NEST):一种图论认知状态架构
提出NEST图论本体,将认知建模为结构化状态形成与转换,分离信念与工作记忆,并映射多种认知架构。
蓝鹊TTS:面向台湾口音代码切换语音的高效分词器、语言模型与TTS系统
提出台湾语境分词器PangolinTokenizer和语言模型Barbet,构建BlueMagpie-TTS,字错误率降低58%,词错误率降低63.9%,65.6%听者偏好。
WordVoice:面向基于LLM的TTS的显式且解耦的多维词级控制
提出WordVoice框架,通过5维词级标注和显式声学规划,实现精确解耦的多维词级控制。
RuBench:一个带有原生俄语任务规范的仓库级智能体编码基准
RuBench 1.0包含25个原生俄语编程任务,评估产品级编码智能体,发现产品会秘密替换模型。
利用大型语言模型跨语言迁移自然语言数据集以支持现代决策与科技分析系统
使用LLM将数据集标注跨语言迁移,以英俄为例翻译DEFT语料并训练BERT模型建立基线。
真实还是捏造?利用因果归因缓解解释中的奖励黑客行为
偏好优化降低解释忠实性,因果归因增强奖励模型可检测决策与解释差异,减少误导。
解码多模态思维:基于多模态对齐与自适应路由的通用脑-文本翻译
多模态对齐与自适应路由框架,MLLM融合脑信号,多数据集提升8.48%,首度实现多模态脑解码
Detoxify:使用大语言模型进行辱骂文本转换的框架
提出Detoxify框架,用LLM将辱骂文本转为无攻击性但保留原意,评估四模型发现Groq结果差异大。
MLLM-LLaVA-FL:多模态大语言模型辅助的联邦学习
利用多模态大模型在服务器端辅助联邦学习,解决数据异构与长尾挑战,提升性能且不增加隐私风险。
一个用于对话式医疗AI风险评估的患者模拟框架:抗抑郁决策辅助工具的评估
患者模拟框架评估对话式AI风险,发现低健康素养导致概念检索准确率仅47.6%、推荐性能下降。
MASCA:基于大语言模型的多智能体信用评估系统
提出LLM驱动多智能体信用评估系统MASCA,采用分层架构与对比学习,实验优于基线并分析偏见。
用局部解释量化RAG中检索器-生成器的对齐
提出RAG-E框架与WARG指标,量化检索器-生成器对齐,发现严重不对齐且WARG优于传统相关性。
Omni-RRM:通过自动评分引导偏好合成推进全模态奖励建模
提出全模态奖励模型Omni-RRM,自动评分合成偏好数据,在多模态基准显著提升对齐效果。
多语种教师:评估用于多语言合成数据生成的语言模型
系统评估10个模型在6种语言上生成SFT数据,发现数据质量(提示多样性、长度、流畅性)比规模更关键,推荐Gemma 3 27B等。
PolyJarvis:LLM编排的自动化全原子分子动力学模拟非晶态均聚物智能体
LLM驱动智能体实现端到端聚合物模拟,九种均聚物验证多数性质预测与实验吻合。
ROK-FORTRESS:衡量地缘政治转创对国家安全与公共安全的影响
英韩双语地缘安全基准揭示语言与地缘背景交互影响LLM安全行为,仅翻译评估存在盲区。
KaLM-Reranker-V1: 快速而非延迟交互的压缩文档重排序
KaLM-Reranker-V1解耦查询与文档计算,通过交叉注意力保持相关性,高效达SOTA,小模型匹敌大型嵌入模型。
SecureCode:一个用于训练安全感知代码生成模型的生产级多轮数据集
首个统一覆盖OWASP Top 10 Web和LLM安全的多轮数据集,质量评分93.8,用于训练安全代码生成模型。
可解释嵌入与距离解释器
提出Distance Explainer方法,通过掩码与距离排序过滤解释嵌入距离,识别相似性特征,提升可解释性。
中文标题:稀疏但错误:错误的L0导致稀疏自编码器中的特征不正确
中文摘要:稀疏自编码器需正确设置L0,太低或太高都会混合特征,本文提出代理指标指导选择正确L0。
LLM4Delay:基于大语言模型与飞机轨迹表示的跨模态适应实现航班延误预测
LLM4Delay融合文本与轨迹数据,通过跨模态适应提升航班延误预测精度,优于现有方法。
BabyVision:超越语言的视觉推理
BabyVision评估显示,多模态大模型视觉推理得分仅49.7,远低于成人94.1,连3岁孩童都不如,缺乏基本视觉能力。