RAIL Guard:缩小大语言模型智能体负责任AI中从评估到修复的差距
RAIL Guard通过评估-重写-再评估闭环修复LLM输出,收敛率96.9%远超重试法,但需区分可修复与结构性故障。
交互式任务对齐作为POMDP
将任务对齐建模为POMDP,模型在模糊任务中仅22-32%正确恢复用户意图,远低于人类的48%,后训练虽有改进但仍落后。
伯克利与海瑟曼:一种尚未穷尽的具身机器智能架构
伯克利将符号逻辑用于机器智能,海瑟曼扩展自适应架构,两者构成具身机器人认知的未充分测试路径。
SEER:基于监督学习控制能量推理
使用监督学习构建oracle,动态控制能量推理传播器运行,提升约束求解效率。
从模态到命题:面向多模态智能的语言中心框架
提出将多模态数据表示为原子命题的语言框架,统一语义码本实现跨模态理解与检索,在自动驾驶等任务验证。
精确网络手术:反应式计算图中的功能不变性与梯度可塑性
提出精确网络手术,实现原位插入残差块位精确保留原函数,插入参数立即可训练,并验证梯度逃离零与避免退化鞍点。
面向多样性的微调用于基于不确定性的幻觉检测
提出SFT和DPO两种面向多样性的微调策略,降低模型对幻觉答案的确定性输出,提升语义熵检测效果,达SOTA水平。
DS@GT ARC参与eRisk 2026:具备结构化算法指导的混合多智能体大语言模型对话抑郁筛查系统
提出混合多智能体系统,以开源模型结合算法指导,实现低成本高性能的对话抑郁筛查。
基于数值规划的多视角约束框架下自主流程执行支持
新工具支持多视角约束下自主流程执行,通过what-if分析推荐最优延续,实验验证可扩展有效。
RELIC:多智能体规划中可解释可组合技能学习的揭示原则
RELIC框架实现隐私保护:智能体私有优化技能,成功行为抽象为可移植原则,供其他智能体实例化重组。
Lomekwi:受限资源下LLM智能体的工具发现
提出工具发现框架,分解为好奇心、识别与效率,发现识别能力与模型规模成反比。
超越语义等价:用于大语言模型不确定性量化的逻辑图
提出逻辑图不确定性框架,建模答案间逻辑关系,显著提升大语言模型不确定性估计性能。
面向API调用智能体的无环境合成数据生成
利用LLM模拟API响应生成高质量训练轨迹,无需真实环境,显著提升智能体性能。
AgentBrew:从强教师到弱LLM代理的终身知识酿造
提出AgentBrew,通过失败触发与学生感知合成,无训练将强教师知识蒸馏为弱学生外部记忆,实现高效代理部署。
LenGuard-GPC:基于引导提示一致性的长度保护机制用于空间推理强化学习
提出LenGuard-GPC密集奖励框架,结合KL散度与分阶段长度奖励,提升多视角空间推理准确率并缩短推理长度。
弥合信息鸿沟:冷启动预测中的语义致密化与事后蒸馏
提出SemRaD框架,通过结构化语义推理与事后蒸馏弥合信息差距,工业实测LTV+1.9%、CVR+1.0%。
你的模型是在思考还是停滞不前?PUMA:通过相位-动量对齐诊断推理病理
PUMA框架通过相位-动量对齐诊断推理病理,区分探索与停滞,实现高效干预,提升准确率与效率权衡。
约束路径推理:衡量承诺阶段何时值得其成本
CPR通过源感知假设与阶段核算,评估承诺阶段何时值当,实验显示高效性。
DeeperRadar:面向自动驾驶感知的端到端MIMO雷达设计与多模态融合
DeeperRadar端到端学习稀疏MIMO雷达设计与多模态融合,用更少接收器达到全阵列性能,降低雷达成本。
自修改Lean证明智能体与验证器基准共同进化
自进化智能体通过与验证器基准共同进化,解决率达45.1%,远超固定基准的32.0%。
实证基础提升LLM代理在干扰情境下模拟人类行为的真实性
实证基础使LLM代理模拟人类行为更真实,热浪下相关度0.836,误差0.012,捕获46.4%响应。
面向大语言模型护栏的双假设推理框架
提出ARBITER框架,采用双假设推理与多组件微调,低成本高性能且可解释,超越现有安全护栏方法。
曲率阴影:最大熵均衡选择的一个表观失败是可移除的假象
Kuhn扑克中最大熵选择间隙是曲率阴影,实为可移除的熵亏缺假象,符合曲率-亏缺平方根关系。
Panache:面向所有窗口长度的单遍模式发现
Panache首次实现单遍流式z归一化模式发现,利用频谱状态与哈希碰撞拒绝,速度远超CPU/GPU基线。
拍拍淘-MMSearch:构建原生电商多模态搜索基础
提出原生电商多模态搜索基础模型,含三项创新,线上测试GMV提升13.61%,交易量提升8.21%。
AI智能体真的能完成从RTL到GDS吗?——工具交互式EDA工作流基准测试的启示
FluxBench评估显示,AI智能体在EDA全流程中性能差距达86%,Token ROI差105倍,系统设计与基础模型能力比领域技能更关键。
保留还是整合?语言代理记忆的预算依赖操作选择
研究语言代理记忆在有限预算下何时保留原始记录或进行整合,提出OAS机制实现预算依赖的操作选择。
ZifaMem:面向AI伴侣的人格、偏好与情感连续性的结构化记忆
提出结构化记忆系统,提升情感智能评分11.4%,人格基础改进42%,多轮情感语境偏好+39%,已开源。
FlowBlock:面向自校正扩散语言模型的波前并行解码
FlowBlock是一种无需训练的并行解码框架,通过门控波前解码和异构波前打包,显著提升自校正扩散LLM的推理速度和精度。
机制注意力引导的智能体记忆精炼
AGMR利用注意力信号揭示记忆利用模式,指导段级更新,提升性能与效率。
面向可持续智慧城市中交通行为理解与管理的人工智能
基于行为证据的AI闭环框架,通过四项交通分析,驱动运营、规划、监管与服务决策。
OrientSAM:通过方向感知空间对齐缓解多模态空间推理中的相机中心捷径
OrientSAM通过方向感知对齐和课程学习,缓解多模态模型依赖相机线索的空间推理错误,实现更稳健的物体中心推理。
学习检测跨模态否定:潜在表示分析与基于注意力的解决方案
提出跨模态注意力架构,F1提升7.03%,揭示视觉否定依赖语言上下文。
SR-Agent: 一种经验驱动的智能体框架用于电商推荐中的后排序策略优化
SR-Agent是首个工业推荐后排序策略优化智能体框架,通过自动闭环调优,月A/B测试订单量提升0.71%。
WuYu-EnvLE-Bench:评估大语言模型环境执法能力的基准
基于真实案例的环保执法LLM评估基准,发现LLM在规则任务表现良好,但证据推理等复杂任务不可靠,且大模型收益递减。
面向硬件的贝叶斯推理高效计算与部署方法
提出面向硬件的贝叶斯推理加速方法,优化内存布局与稀疏表示,在嵌入式GPU上达2-5倍加速,结果数值一致。
ST-Veto:基于泰勒预测与视觉定位的扩散MLLMs时空令牌否决法
ST-Veto通过泰勒预测和视觉定位剔除不稳定token,提升扩散多模态大模型推理准确率最高9%,无需额外训练。
SAGE:面向潜在世界模型规划的子目标条件动作生成
提出子目标条件动作生成方法,以可变时长子目标为先验,显著提升长程规划成功率。
地图对机器仍重要吗?重审等值线图在基础模型空间理解中的作用
等值线图仍显著提升基础模型空间推理,数据加地图输入效果最佳。
重新思考异构大语言模型合并:加权模型平均视角
无训练维度适配和比例控制插值下,直接加权平均可有效合并异构大模型,成为强基线。
PAMD:面向视觉强化学习中双模拟表示的结构化自适应距离
提出PAMD(成对自适应马氏距离),一种结构化可学习距离度量,提升视觉强化学习双模拟表示性能。
临床大语言模型中证据充分性提示的审判者依赖安全增益与模型特定有用性成本
证据充分性提示降低不安全过度自信,但效果依赖审判者,有用性成本因模型而异,需联合人工评估。
端到端概率地震危险性与风险分析的智能体接口
基于MCP协议,LLM协调OpenQuake引擎,实现端到端地震风险分析,结果准确快速。
取决于数据集:脑编码模型的预测响应何时在视频可记忆性上胜过其视觉骨干网络
脑编码模型预测响应提升视频可记忆性预测,效果因数据集而异,非通用先验。
多智能体系统的可组合验证管道
提出基于Tiles的模块化验证框架,通过可组合功能管道处理多智能体系统动作与状态,支持YAML定义,保证终止。
从意图到基础设施:面向通感一体化网络的LLM驱动智能体编译器
LLM驱动的编译器将工程意图转为通感一体化配置,慢速策略与快速算法分离,支持闭环自适应。
物理信息特征工程的一维CNN用于静止卫星多层云检测
嵌入物理先验的1D-CNN提升多层云检测,发现可增强传统算法,但需考虑传感器差异。
智能引导的自适应纯化用于抗DDoS量子网络:基于CUDA-Q的研究
提出IDS感知自适应纯化策略,将DDoS攻击下量子网络交付率从0.098提升至0.344,接近最优水平。
身份一致表情场:一种用于少样本人脸表情合成的解耦神经辐射场框架
ICEF解耦静态身份与动态变形,通过身份保持正则化和置信度加权扭曲,在少样本下实现高质量表情合成且保持身份一致