Idea2Plan:探索AI驱动的研究规划
研究LLM从研究想法到研究规划的转化能力,构建Idea2Plan基准,GPT-5表现最佳但仍需改进。
MedFailBench:临床医生构建的开源医学AI安全边界检查基准
MedFailBench通过严重性分级与安全门分类,标注医学AI错误以检测安全边界失败。
WavePhaseNet:基于DFT的语义概念层次结构构建方法
用DFT分解语义,降维至3000维并引入上同调正则,抑制幻觉保持语义一致。
通过变点检测分割人类与LLM合著文本
通过变点检测算法分割人类与LLM合著文本,实现段落级定位并证明最优性。
L-MARS: 具有智能搜索和引文忠实性审计的法律多智能体系统
提出L-MARS系统,通过多轮法官审计将法律问答引文F1从0.13提至0.25,无引文率从34%降至13%。
中文标题:工具幻觉:重新思考网络代理中的工具使用
中文摘要:通过大规模对照实验重新审视网络代理中工具使用的效果与设计原则,修正并补充了先前结论。
用于AI安全评估的对抗性语用学:指令冲突、嵌入命令和策略模糊性的基准
提出对抗性语用学基准,评估模型在模糊指令、嵌入命令等场景下的行为,发现评估器易漏判安全相关类别。
The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues
大型语言模型对人类口语交流影响的经验证据
实证表明,ChatGPT偏好词汇涌入人类自发口语,AI正反哺并重塑语言文化进化。
超越趣味性:面向可视化数据分析的语义与上下文感知自然语言查询推荐
融合语义、趣味性与上下文,推荐更相关连贯的查询序列,提升洞察生成与决策支持。
当机器遗忘遇见检索增强生成(RAG):保密还是遗忘知识?
提出基于RAG的轻量级遗忘框架,修改外部知识库模拟遗忘,无需直接干预模型,满足五项遗忘标准。
FlowBot: Inducing LLM Workflows with Bilevel Optimization and Textual Gradients
基于前缀重放的多轮在线策略蒸馏
提出ReOPD方法,利用教师轨迹前缀重放替代环境交互,实现高效多轮在线策略蒸馏,速度提升4倍且精度不变。
SAMark:一种具有段落级改写鲁棒性的自锚定文本水印方法
SAMark提出自锚定水印框架,通过语义空间步独立绿色区域与多通道双曲评分,实现段落级改写鲁棒性,检测率90.2%TP@FP1%,生成质量不受损。
EvalSafetyGap:LLM评估与安全失败的混合综述与概念框架
揭示LLM评估与安全测不准假说,提出不稳定性分解与对齐三难困境,建议动态评估与透明审计。
语言作为波现象:神经网络中的语义相位锁定与干扰
提出PRISM复数架构,利用相位干扰进行神经序列建模,相位携带关键信息。
面向大型语言持续学习的子专家混合方法
提出MoSEs稀疏模块化框架,通过子专家混合与组合路由平衡稳定性与可塑性,实现高效持续学习。
FixItFlow:从云事件自动生成故障排除指南
FixItFlow利用大语言模型从云事件自动生成故障排除指南,评估显示清晰度61.5%,缓解时间减少2.3倍。
LLM是否需要为同声传译进行架构变更?一种前缀到前缀的数据驱动方法
提出CSSEL-P2P方法,采用固定长度块与前缀到前缀监督,无需架构变更即提升同声传译质量。
先问再诊断:Safe-Psych——精神科中大语言模型的顺序评估基准
Safe-Psych基准测试发现,大语言模型在精神科诊断中常因信息不完整而过度诊断,很少主动澄清,存在识别信息不足的能力缺陷。
困惑陷阱:当专利法让人写的内容看起来像AI
消费级硬件下,AI文本检测器在专利中假阳性率超60%,新方法用七特征逻辑回归将准确率提至74%。
Text2Sign: 单GPU文本到手语视频生成的扩散基线
提出单GPU运行的Text2Sign扩散模型,利用冻结文本编码器与分解注意力,在How2Sign上实现验证损失0.00999,生成32帧耗时12.6秒,但限于低分辨率短片段。
模型表达、抑制与抗拒什么:使用人格向量审计开放权重大语言模型
用53个人格向量审计开放权重模型,发现模型默认任务导向,可引导放大默认排除特征,微调转移可恢复抵抗特征,揭示了行为组织。
RAGthoven在SemEval-2026任务1中:多阶段管道勉强通过基准测试
RAGthoven系统用多阶段LLM管道生成幽默,结合RAG增强,在英西中三语并列第一,但智能体变体未提升性能。
KV缓存的适应性滤波:诊断与纠正LLM推理中的结构角色偏差
通过抑制结构KEY令牌消除KV缓存噪声偏差,在低预算下缩小H2O差距63-98%,提升准确率。
GSM-Plus-BN: 面向大语言模型孟加拉语数学推理的基于扰动的基准测试
提出GSM-Plus-BN孟加拉语扰动数学数据集,评估6个开源LLM,揭示模型在孟加拉语数学推理上的性能差距。
基于论证的话语感知政策分析:面向灾害治理的混合LLM-符号框架
提出混合LLM-符号框架Apaf,将政策话语批判分析量化为双极论证图,揭示隐含框架关系,准确可解释。
多语言大语言模型对齐的元学习偏好
提出元学习框架,利用跨语言偏好数据,在仅100样本的极低资源下实现28%胜率提升。
DevicesWorld:异构环境中跨设备智能体的基准测试
DevicesWorld含6140个跨设备任务,评估手机/桌面/IoT协作,最佳成功率仅12.5%,可诊断代理失败原因。
中文标题:评估能力不等于优化效用:闭环表格识别中的LLM评判信号
中文摘要:LLM评判信号在闭环表格识别中效果弱,评估能力不代表优化效用,结构保持可减少严重损失但无改进。
找到正确的表和列:SQL模式检索的基准与语料自适应嵌入
将模式检索立为标准任务,提出语料自适应微调,召回率提升15%,小模型超越8B级,实现轻量级企业部署。
GFlowRL:面向大型语言模型的分布匹配强化学习扩展
GFlowRL移除辅助分区网络,用批内估计实现分布匹配,在数学、代码和对抗基准上超越SOTA,稳定扩展到235B参数。
揭秘在线策略蒸馏:角色、病理与调节
揭示在线策略蒸馏中师生不匹配与长度利用病理,通过优势裁剪、对数压缩等信号调节实现有效蒸馏。
探索小语言模型在生物医学数据到文本生成中的后训练对齐:以药品说明书为例
本研究比较小语言模型后训练方法,ORPO优于SFT,GRPO跨数据集鲁棒性最佳,超越GPT-5。
词性标注层是低资源语言文献自动标注的关键:南琉球语伊良部岛的神经行间标注
词性标注层是关键:黄金词性可提升自动标注准确率4.4分,数据越少增益越大,自动词性需达92%以上才能实现。
当评分标准改变时:批判性思维作文评分的跨评分标准泛化
特质中间表示的LLM微调提升跨评分标准泛化F1 5%,性能优于GPT-5-mini。
实时古鲁巴尼追踪:锡克教基尔坦字幕标注的基准与参考系统
提出锡克教基尔坦实时字幕标注基准与参考系统,任务为预测经文ID与行号,参考系统在盲测下帧准确率57.9%。
SPyCE:面向多模态代理的技能-策略协同进化
提出技能-策略协同进化框架,从轨迹提炼层次化技能库,与策略共同优化,显著提升多模态代理性能。
类比深度研究:检索与整合历史类比以进行前瞻分析
提出类比深度研究任务,发现LLM难以基于机制匹配历史类比,提出因果类比研究框架(CANA)提升效果达10%。
MyAG:基于图的可组合LLM智能体系统设计与分析框架
MyAG框架通过三种图抽象分离构建可组合LLM智能体系统,支持递归层次组合及可视化监控,分析性能效率权衡。
基于自监督语音比较的第二语言音素、韵律和语调评分
用自监督WavLM加DTW无文本评估L2语音,音素与韵律达人类水平,语调尚弱。
基于门控语义质量多样性的自我进化代理框架
提出自进化代理框架,分离变更提议与归因,利用门控语义质量多样性档案抑制过拟合,实现性能提升与泛化。
合成LLM作为裁判语料库中的测试预言问题:消失、扭曲与验证协议
合成裁判语料中,LLM生成负例静默失败致虚假效应,仅手动读取可暴露;确定性扰动语料自带验证预言。
语言模型中的分级实体熟悉度读取:波兰语适应、跨语言鲁棒性与拒绝导向
通过激活探针分级读取实体熟悉度,支持预生成拒绝,跨语言鲁棒性高。
后训练改变置信度:SFT、RL和OPD如何塑造思维链前、中、后校准的三阶段分析
OPD、SFT、RL分别优化推理前、中、后置信度;位置感知策略提升答案聚合和早停。
记忆即受控过程:面向LLM智能体的自适应记忆管理学习
将记忆操作建模为马尔可夫决策过程,在线学习何时检索、注入、遗忘,自适应提升成功率并降低开销。
面向BioASQ A+和B阶段的成本务实质量门控与选择融合多模型组合器
提出成本务实质量门控与多模型选择融合,在BioASQ 14B三项榜单夺冠,降低检索成本12%,提升列表F1与召回。
通过音频感知大语言模型的细粒度反馈改进文本到音频的指令跟随
利用音频感知大语言模型生成细粒度反馈,优化文本到音频的多事件时序指令跟随,提升准确性与完整性。
High-Order Question Generation in a Multilingual Educational Context
老狗还能学新把戏吗?——让LLMs超越句子级翻译
探索LLMs能否通过整文档和语料库信息翻译超越逐句范式,发现有限改写但需改进有效性。