复现与压力测试两种LLM推理可靠性方法:测试时概率聚合与逻辑表征编辑
复现两种大模型推理可靠性方法并压力测试:RPC优势不显著,LCF逻辑方向弱且无效。
FailForge:从持续失败中蒸馏程序性技能注入代码智能体
FailForge将失败轨迹转为技能并引导重试,成功样本回注训练集,使模型在SWE-bench上提升6.6分,聚焦难题。
行走于讨论间:面向现场小组讨论分析的移动可视分析系统
移动可视分析系统支持现场小组讨论监控、诊断与干预,案例访谈验证有效。
ForestBench:评估多智能体协作的统一图框架
提出ForestBench统一图框架,将LLM多智能体协作轨迹映射为图并与参考森林比较,无需额外推理即可毫秒级评估。
VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩
两阶段语义锚定压缩音频键值缓存,20倍压缩保90%性能,4倍压缩吞吐升1.9倍、内存降3.3倍。
面向多标签图基础模型:从单向量表示学习到多语义基学习
提出多语义基图基础模型MSB-GFM,用语义基组合表示多标签节点,配合双通道对抗训练,实现跨域多标签分类。
EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由
提出熵感知稀疏专家路由模型,以动态补丁熵为路由信号,实现无分词器LLM的稀疏计算,达到最低bits-per-byte并保持精度。
超越路由权重:基于贡献对比的混合专家奖励模型忠实响应级解释
提出贡献对比(CoCo)响应级解释法,基于选择-拒绝对的贡献差异,忠实刻画MoE奖励模型,优于现有方法。
WebGrader:用自进化程序化评分器训练大模型进行网页开发
WebGrader用自进化程序化评分器,以实时浏览器验证和技能自动发现,显著提升网页开发功能成功率。
学习预测多模态大语言模型中的中层注意力以实现视觉令牌剪枝
提出MAP,蒸馏中层注意力,首层前剪枝令牌,保留97.5%性能,仅用5.56%令牌,提速3.09倍。
KNOWPLAN:知识驱动的AI智能体用于智能学位路径规划
KnowPlan两阶段解耦:先提取课程目录,再优化学生路径,达成高召回率、高可行性与更优个性化效用。
自动化条目评估:利用LLM生成的评语预测条目接受与拒绝
融合模型最佳,准确率0.75,数学预测优于英语,但公平性相关条目仍需人工审核。
WebRider:面向实时网页辅助的角色条件化意图控制器
提出意图契约与分层架构,确保网页委托策略保真;RiderBench验证浏览路径可审计可学习。
前沿语言模型在引导压力下的分化响应模式
六款前沿模型受引导响应模式分化:有的拒露推理,有的以不同方式抗抑制;开源模型行为可由内部特征解码驱动。
塑造你的信息流:基于LLM的对话式推荐智能体系统
提出LLM智能体推荐框架SYF,实时多模态内容共策,离线准确率98.85%,在线提升相关性与用户情感。
CellWorld:空间转录组基础模型中从基因水平重建到潜在细胞预测
提出潜在表征预测预训练方法CellWorld,在空间转录组基准上全面超越基线。
基于深度强化学习的车辆路径问题——工业卡车规划案例研究
深度强化学习用于工业卡车路径优化,三个物流案例显示总成本较基线降低超10%。
AgentPatch:面向智能体多模态大语言模型合并的从粗到细弱任务修复
AgentPatch提出免训练由粗到细修复,恢复弱任务信号并保护关键行为,提升多模态模型合并效果。
N×N E-评估:通过保形CRT零假设认证假设
提出N×N E-评估:基于e值,样本互为零假设,经条件随机化检验认证假设,优于循环验证与留出测试。
IB-RL:面向策略对话体的隔离式双边强化学习
针对静态对手训练导致策略泛化差的问题,提出隔离式双边强化学习,双角色独立联合演化,在两个谈判任务上显著提升对未知对手的泛化表现。
MolBioKG:通过多分辨率结构锚定将图外分子嵌入生物医学知识图谱
MolBioKG用多尺度结构锚定,将未注册分子关联到生物医学知识图谱,无需训练即可推理,多跳与图外泛化性能显著提升。
优化器即智能体:跨提示、程序与ML工作流的推理驱动搜索
提出ReASearch框架,让智能体自主评估、诊断、编辑、验证,统一优化提示、程序及ML流程,性能超专用系统2%-40%。
Surg-UniWorld:统一手术世界模型与多模态控制专家
提出统一手术世界模型,融合多模态控制专家与分层锚点,生成高质量可控手术视频,超越现有方法。
从廉价伪造到纯合成:应对T2V假新闻视频新时代
针对文生视频假新闻,提出三分类任务、首个纯合成数据集PS-FNVD及R-T2V框架,超越基线12.2%准确率。
注意差距:面向统一多任务用户意图推断的双知识图谱框架
提出双知识图谱框架DKG-MTI,结合用户意图图与酒店全局图,结构感知对齐增强LLM,在旅游评论多任务意图推断上超越基线。
bioMoR:生物学引导的混合递归用于高效基因组学习
提出bioMoR,首个将MoR用于基因通路学习,利用图知识引导递归,宏F1提升8.2%,参数减少75%。
LiFTER:面向连续时间动态图预测的基于事实的神经符号显微镜
LiFTER将观测交互保留为时间事实,用可执行规则推理预测,结果可检验、可干预,在动态图基准上性能优异。
MemPrism:面向长时程智能体的任务条件关系记忆视图
提出任务条件关系记忆框架,动态构建视图,长时程任务性能提升且省内存,可跨模型迁移。
Capek 0.5:以执行为中心的具身智能视觉语言模型
提出以执行为中心的具身视觉语言模型,按四类能力训练专家并融合,显著提升基准与闭环执行。
TRIBE:通过通信行为集成预测团队绩效
TRIBE通过通信行为在任务早期(10%)预测团队绩效,跨领域适用,发现AI改变团队轨迹,优化后提速增效。
CEDAR:面向复杂系统目标导向优化的智能体编排树搜索
CEDAR利用LLM智能体驱动树搜索,自动发现满足行为目标的复杂系统,减少人工并揭示结构如何影响涌现行为。
SkillEval:将智能体技能质量分解为可解释信号
提出SkillEval框架,从技能文档学习可解释方向评估质量,预测下游表现,并指导技能修订。
长时程智能体轨迹归因:统一基准与细粒度标注框架
提出轨迹归因统一基准与细粒度标注框架,含千余条带标注轨迹,定义定位与链恢复两类任务,支持多种归因场景。
Fast LapSum:百万规模下的精确可微Top-k
提出Fast LapSum,排序后线性时间实现精确可微Top-k,开销近零,支持百万级稀疏优化。
忽视关键投票:聚合独立性指标遗漏验证真正起作用之处
验证信号仅在胜负一票之差的问题上提升准确性(+10至23个百分点),其余为零;据此替换规则可提升准确率3个百分点以上。
科学边界评估:看见迈向真正科学发现的缺失一步
新基准SEE:19个多模态模型最佳准确率48.7%,工具辅助升至52.7%,仍难从实验证据推理。
戴尔约束下的深度网络学习
提出满足戴尔约束的网络用非负活动与固定符号突触局部赫布学习可恢复反传更新优于同类基线
Transformer难以运用其涌现的世界模型:重访汉诺塔与思考的幻象
Transformer能涌现汉诺塔世界模型,但规划时表示衰减致失败;注入表示可恢复性能,失败源于维持而非缺失。
PTQ4SNN:面向脉冲神经网络的状态感知训练后量化
提出膜感知训练后量化框架,联合量化权重与循环膜状态,适配分布并分配混合精度,无需重训即可保持低比特精度。
先定多少,再定何处:多轮智能体强化学习中信用保持的动作到令牌分配
提出FACTOR,分离动作信用与令牌分配,在多个环境中优于基线,TD信用是主要驱动。
MemWM:记忆增强的文本世界模型
记忆增强文本世界模型,提升状态保真度,规划成功率最高提升65.4%。
DocMemo:多模态文档理解中基于概率记忆引导检索的动态证据发现
提出基于三层次记忆与贝叶斯信念更新的文档理解框架,实现动态证据发现,性能最优。
偏微分方程基础模型的无监督适配
利用物理残差与边界条件,对偏微分方程基础模型无监督微调,无需真解即可媲美有监督方法。
以MARL为中心的智能制造大语言模型增强参考架构
以MARL为中心的三层参考架构,四种LLM增强点;证据显示传统MARL适合实时控制,LLM适合语义规划。
Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models
NiyamAI:基于意图约束与零知识证明的可加密验证安全AI智能体
Niyam-AI将工具调用约束写入意图合约,经隔离裁判验证后生成零知识证明,实现可验证安全执行,F1达88.5%。
智能体记忆蒸馏:以层级教师记忆赋能小型LLM智能体
提出免训练框架AMD,将大模型智能体的层级记忆蒸馏给小模型,显著提升工具使用准确率,最高提升27.2个百分点。
EMAS:通过证据引导修订稳定多智能体系统演化
EMAS利用经验修订多智能体系统拓扑和提示,提升准确率并大幅降低token消耗,在多个基准上取得最优结果。
SetEasy: 多模态课堂参与度评估与座位优化框架
融合多模态感知与CP-SAT,实现固定座位优化,四周期实验将参与度从0.30提至0.70,RMSE降至0.53。
超越黑箱:人类随机化失败的可解释模型
用可解释模型预测人类随机化偏差,发现重复/回避行为是主要可剥削信号,频率追踪无额外增益。