低资源阿尔及利亚方言谣言检测的端到端混合框架
提出端到端混合框架检测阿尔及利亚方言谣言,自建数据集,混合模型F1达0.84,领域预训练优于大模型。
RogueAI:一种用于检测对话中许可型AI欺骗的反向图灵测试
RogueAI通过双AI对话游戏检测许可型欺骗,人类识别准确率56.6%,低于简单启发式的75.6%,表明人类易忽视关键信号。
神经机器翻译与抽象式摘要中幻觉检测的层解析最优传输
OT检测NMT幻觉集中于L1-L4层,L5反预测;摘要忠实性检测仅略高于随机,因不忠实摘要可正确关注源却扭曲内容,OT无法识别。
SkillCAT: 对比评估与拓扑感知的LLM智能体技能自进化方法
SkillCAT提出无训练三阶段框架,通过对比因果提取、评估进化与拓扑感知执行,实现技能自进化,基准测试平均分提升达40.40%。
基于LLM并行文本生成的低延迟实时音频游戏解说系统
并行生成文本与播放同步,缓冲候选语句,句间静默从9.6秒降至0.3秒,节奏改善超40%,显著提升解说流畅度。
IVIE:交互式叙事世界中增量式与验证式生成的神经符号方法
IVIE系统通过神经符号方法增量生成并验证交互式小说世界,平衡创造性与连贯性,但仍面临LLM不一致等挑战。
从被动生成到主动探究:一种主动式科学同行评审智能体
提出ProReviewer智能体,通过MDP框架和结构化日志主动审查论文,性能优于现有方法,提升高达39%。
PolyAlign: Conditional Human-Distribution Alignment
形似意异:评估LLM对阿拉伯语-希伯来语同源词的理解
阿拉伯-希伯来语同源词基准测试显示,LLM依赖形似,对假朋友和借词识别差,上下文改善有限。
通过潜在视角评估大语言模型中的多元主义
提出领域无关的框架提取潜在视角,发现LLM生成文本中稀有视角代表性不足。
用于LLM组合推理的操作代数框架
提出操作代数框架建模问题分解,操作一致性度量与LLM推理准确率强相关。
S-GBT:面向自然语言处理中词替换攻击的可认证鲁棒性的平滑增长界张量
提出S-GBT二阶方法,约束Hessian矩阵得紧鲁棒界,结合一、二阶正则化使认证准确率提升达23.4%。
利用音频大语言模型过滤语音到语音训练数据
用音频LLM过滤S2ST噪声数据,两阶段Rank-to-Distill策略直接判断质量,提升翻译性能。
面向长文本语音交错对话的本体记忆增强型ASR纠错
提出本体记忆增强ASR纠错框架,动态存储上下文节点,提升长对话纠错性能。
ArogyaSutra:面向印度语言的多模态医疗推理的多智能体框架
提出ArogyaBodha数据集与ArogyaSutra多智能体框架,提升印度语言多模态医疗推理准确性。
中文标题
搜索增强LLM推荐易被污染网页误导,单污染页致27%误荐,前三替换达73.8%,推理不缓解。
混合何时有益?多语言稠密检索中的查询嵌入插值分析
混合查询收益受英语主导:非英语索引混合有益,英语索引纯英语最佳,收益与语言距离负相关。
LabVLA:在科学实验室中落地视觉-语言-动作模型
提出RoboGenesis数据引擎与LabVLA模型,两阶段训练实现实验室操作,在LabUtopia基准上成功率最高。
超越统一令牌:时间序列语言模型的自适应压缩
发现令牌非对称性,提出自适应压缩,实现7.68倍加速和78%性能提升。
从标记到面部:探究用于3D面部动画的离散语音表征
研究发现编码音素类别的语音表征可提升3D面部动画预测精度,并据此提出视听文本转语音管道。
SkMTEB:斯洛伐克大规模文本嵌入基准与模型适配
首个斯洛伐克语综合文本嵌入基准SkMTEB,开发高效模型,为低资源语言提供可复制方案。
递归智能体框架
RAH将递归从模型调用扩展到完整代理(含工具),在长上下文推理中提升准确率,GPT-5下从71.75%到81.36%。
操作一致性:LLM中组合推理失败的无标签信号
操作一致性(OC)无标签信号与LLM组合推理准确率高度相关(r≥0.86),优于自洽性和语义熵,提升选择性预测。
Influcoder: 将解码器的梯度影响力排名蒸馏到编码器中用于数据归因
提出Influcoder,通过蒸馏解码器梯度影响力排名到编码器,实现快速大规模数据归因。
HyperTool:超越逐步工具调用的工具增强型智能体
HyperTool通过统一代码块接口,将多步工具任务合并为单次调用,减少推理痕迹,将Qwen3-32B准确率从15.69%提升至35.29%。
通过检索增强的强化微调学习类比推理
提出RA-RFT,通过检索推理示例并强化微调,让模型学会类比推理,显著提升数学推理性能。
EvoArena:在动态环境中追踪记忆演化以构建鲁棒的大语言模型智能体
提出动态环境基准EvoArena与补丁式记忆范式EvoMem,智能体准确率提升1.5%,关键在改善演化状态记忆捕获。
边缘对齐不保证联合分布保真度:基于官方参考的Nemotron-Personas-Korea审计及跨地区复制
提出IAF审计方法,揭示NPK数据集边缘对齐但三个联合分布失败,需联合审计。
AI SciBrief:研究入门之门——引导学生进入新研究领域的框架
AI SciBrief基于大模型自动生成科学趋势摘要,帮助学生克服信息过载,加速从搜素到知识创造的过渡。
两错无对:计算社会科学中LLM标注者社会期望偏差的审计
LLM标注者存在宽松、过度纠正和中性偏差,提示干预无效,聚合校准的模型仍可扭曲实证结论。
职业提示揭示大型语言模型中的文化偏见
职业提示显示模型价值回应偏向西方,但不同职业角色引发文化偏移,非中性。
无需高斯性的可辨识性:符号世界模型与近无限时间一致性
PGSA架构突破高斯限制,实现精确线性可辨识性与近无限时间一致性,统计模型无法达到。
幻觉起始的最快检测:延迟界与学习型CUSUM统计量
将幻觉起始检测建模为最快变化检测,得出延迟下界约1.3 token,学习型CUSUM实现11-13 tokens检测,优于线性基线,差距源于特征信息利用不足。
有序并非控制
秩序不等于控制:控制依赖接收器门控响应定律,在生物与模型实验中验证了局部控制与可预测响应,但排除了全局可控性。
检测代码语言模型中的功能记忆
反事实实验证明代码模型存在功能记忆,审计需超越文本重叠。
ProPlay:面向自进化LLM智能体的程序化世界模型
ProPlay通过程序图预演路径并利用可靠性记录,让智能体在交互中自我进化,提升环境理解与适应能力。
智能体MPC用于语义控制系统再合成
结合LLM代理的智能体MPC框架实现语义自适应控制,在自动驾驶中响应个人偏好与社会情境。
保持策略梯度主导:面向长周期工具使用智能体的兄弟引导信用蒸馏
SGCD通过对比兄弟卷展和LLM信用参考重新分配优势,改进GRPO,提升长周期工具使用任务性能。
使用加法码本的大语言模型多比特宽度量化
提出Drop-by-Drop多比特宽度量化框架,基于加法码本实现单模型多精度推理,降低存储开销且保持性能。
特质而非状态:社交高亮中阅读身份的持久性
追踪读者高亮选择超两年,确认阅读身份为稳定特质,预测力持久且不受重复领域影响。
意识之声:TikTok心理健康月期间的主题、情感与毒性图谱
分析TikTok心理健康月视频与评论,发现视频情感偏负面,评论极性混合,毒性低但特定主题有长尾异常。
与你更好地协作:将用户修正编译为编码代理的运行时强制执行
TRACE将用户修正编译为运行时规则,使编码代理的偏好违规率从100%降至37.6%,有效减少重复纠正。
Understanding helpfulness and harmless tension in reward models
Examining the Cognitive Gap Between Authors and Peer Reviewers on Academic Paper Novelty
SupraBench: A Benchmark for Supramolecular Chemistry
MiniPIC:少于100行代码的灵活位置无关缓存
MiniPIC用<100行代码实现PIC,吞吐量+49%,首令牌延迟降低两个数量级,开销5.7%。
实时多方语音代理的自适应话轮交替
提出角色条件化话轮交替代理ModeratorLM,精度提升40%,召回提升70%,显著减少误中断。
揭秘隐状态循环:基于在线策略强化学习的可切换潜推理
提出SWITCH框架,用显式边界令牌使隐状态循环推理兼容在线策略强化学习并实现因果分析,性能优于先前方法。
MaxProof:基于生成-验证强化学习与群体级测试时扩展的数学证明框架
MaxProof通过生成-验证RL和群体级搜索,使模型在IMO和USAMO上超越人类金牌水平。
WildIFEval:野外指令遵循
提出含7K真实多约束指令的WildIFEval数据集,分类8类,基准测试显示模型在复杂条件下仍有较大提升空间。