那是谁的?评估大型语言模型的所有权直觉
提出COAT比较LLM与人类所有权归属,发现模型更同质且情境敏感不同,未充分反映人类判断多样性。
人机协作中的指称不确定性
人机协作指称不确定性可更好校准,但模型少外显;精准描述与针对性模糊限制能减少错误接受,错误定向反有害。
RankEvolve:一种用于演化排序模型的可靠多智能体自动研究框架
RankEvolve以可执行协议驱动多智能体互审,执行准确率升至62.5%,提升HSTU推荐效果。
价值即风格:用单向混合解耦价值与语义,实现低损伤的大模型引导
提出单向语义—价值混合接口,冻结残差状态,推理时仅编辑价值码,提升语义保持并减少良性拒答。
多智能体系统中隐空间通信的安全性
隐空间通信链路良性训练亦可增加有害依从;攻击可将其从27.9提至76.9,调整奖励可修复,安全对齐须看系统整体。
AVERT-VLN:面向视觉语言导航的弃权感知视觉错误恢复与训练
提出AVERT-VLN:可插拔视觉语言监控器在线检测偏差并请求人工纠正,离线偏好学习提升导航成功率。
ArchitectureIQ:论训练直觉的度量
提出基准测量模型与人类的训练直觉,发现其良好但不完美、属经验性、可压缩,且对数据特性不敏感。
ChronoGraph:面向交互理解与具身规划的视觉语言模型功能化4D场景图
提出功能化4D场景图ChronoGraph,统一表示观察与预期状态变化,训练视觉语言模型实现交互理解与可落地规划。
OverForge:通过策略与战术推理助力协作式终身适应
免训练分层架构OverForge分离持久策略与战术执行,提升协作智能体的长期适应与配合。
OSWorld-Science:面向学习与使用科学软件的计算机使用智能体基准
OSWorld-Science基准含146项科学软件任务,以执行评估检验智能体能力,顶尖视觉语言模型仍面临挑战。
FIGS:在不惩罚共情的前提下评估多轮谄媚行为
提出双轴框架FIGS,用10轮自适应对话区分谄媚与共情,发现模型或滑向谄媚、或过度冷漠。
ConflictGuide:让竞争性行为可见,自动研究性能得以提升
ConflictGuide 让竞争性行为可见,以探针反馈引导自动研究,任务与冲突错误最多降低 28% 和 14%。
覆盖优先于控制:面向可控逆合成的路线指令锚定与引导
提出RIGS两阶段框架:先训练投影器学习指令偏好,再引导冻结生成模型,兼顾备选覆盖与指令控制。
AIMS:面向仿真到现实多模态ISAC的智能体AI框架
提出双智能体AIMS框架协调场景构建与任务学习,提升多模态ISAC仿真到现实迁移车辆检测与波束预测。
面向资源受限边缘设备的可靠推理神经符号路由
神经符号路由器用L*学习DFA,将查询分派给最便宜的精确求解器,树莓派上准确率高、延迟与能耗低。
来杯咖啡:以编译目标实现离散扩散的未来感知引导
COFFEE 分离序列依赖与目标,避免指数枚举,将全局偏好引导至未解析位置,支持硬约束与软目标,在多个基准实现强控制。
更多程序,还是更多次运行?区分 LLM 执行框架中的覆盖度与专精化
可控评估显示,重复运行会虚增覆盖;生成程序多显持续弱点,选择器无增益,覆盖与重复性不足以证明专精化
基于即时成本CVaR并具性能保证的风险规避在线POMDP规划
对每步信念即时成本应用CVaR,保留期望目标,现有POMDP规划器仅改成本即风险规避并具性能保证。
超越对称智能体:小语言模型中的认知多样性与多智能体辩论
认知多样性假设被否;辩论优势实为集成采样效应,匹配预算下不及自洽性采样,收益源自首次答案交换。
经验时代中的自发现强化学习:学习历史是资产还是负担?
首次因果审计自发现RL规则,学习历史既扩展奖励尺度又因错配成负担,重放保留影响适应优势。
表征简洁性与电路规模呈阈值依赖式解离:基于对抗训练的受控检验
对抗训练受控测试表明,表征简洁性与因果电路规模解离,高忠实度下鲁棒模型电路边数显著更少。
PowerZooJax:面向强化学习的基于JAX的电力系统基准
提出基于JAX的电力系统强化学习基准,涵盖五类约束MDP任务,全流程GPU加速,支持安全与分布外评估。
GeoWind2Plan:面向节能无人机规划的任务时三维城市风场预测
提出几何—风场—规划框架,用神经算子约3秒预测城市三维风场,CFD评估下较无风感知规划节能4.5%–12.7%。
Mirror-Score:校准的仅推理评分揭示D-肽设计中序列兼容性排序的局限
提出Mirror-Score校准评分框架与31个复合物基准,揭示序列似然无法预测D-肽亲和力,镜像共折叠置信度家族内排序更可靠。
LongCat深度研究技术报告
提出LongCat深度研究系统,结合增强模型与多智能体工作流,分离全局规划与局部调查,支持分节修订,在多个基准测试中表现优异。
AdaST:面向时空预测的自适应耦合
提出AdaST框架,以分解-重组自适应建模时空耦合模式,显著提升预测性能并超越现有方法。
CoRe:协同进化奖励模型以缓解视频扩散模型中的潜空间奖励劫持
CoRe让奖励模型与生成器协同进化,以真实视频偏好锚定,避免分布漂移引发的奖励劫持,提升视频生成质量。
FigAct:让科学图表成为可主动演绎的讲解画布
将静态科学图表转为按问题生成的视觉演示,通过元素定位与视觉动作引导注意力,使讲解更清晰易懂。
记忆即推导:长期智能体中的分布式证据悖论
长期智能体记忆能否由历史推导存疑:扩展历史可找回近六成无据记忆,但17%-21%仍无据,准入不可靠。
更多特征并非更多证据:基于 Jev 的免训练人体活动识别的局限
Jev免训练人体活动识别远逊监督模型;更多数值特征反降性能;传感器到模型接口是评估关键。
MERID:基于递归自我改进智能体的多模态探索用于重度抑郁症分析
MERID利用递归自我改进智能体,联合优化多模态表示、融合与预测器,在抑郁症检测与严重度估计基准上最优。
ChronoSRL:面向自监督强化学习的时间几何
赋予评论家嵌入时间几何,按到达目标时间训练,并借助生存强化学习提升策略,在导航与四足任务上超越基线。
HyperZip:基于超网络个性化扩散大模型的高效数据压缩
HyperZip借助超网络与多词元预测适配扩散大模型,实现高压缩率、高吞吐的数据压缩。
从检索到推理:基于细胞绘画图谱的智能体作用机制预测
PhenoAIR将细胞绘画MOA预测转为校准证据推理,用可靠性感知多智能体精炼,优于检索与LLM基线。
BRIDGE:双层检索信用感知的智能体强化学习
BRIDGE将检索增强智能体RL建模为双层优化,联合训练LLM与检索器,在多个QA基准上准确率领先。
Transformer 过早停止思考,一个小型 LoRA 即可修复
仅微调早期层的一个秩8 LoRA、冻结其余权重,即可把上下文链式追踪从数行提升到数十行。
SAKI:面向同策略蒸馏的最大耦合路由教师监督
SAKI按最大耦合接受/纠正事件路由token级教师监督,纠正概率即TV距离,数学推理基准表现提升。
FairDiff:缓解扩散推荐模型中的自我强化马太效应
提出FairDiff,以流行度条件引导和语义校准缓解扩散推荐模型中长尾先验失配导致的自增强马太效应。
面向语言智能体持续自我演化的语义投影
提出SSPE,将梯度投影从参数空间转向行为空间,使共享技能持续演化并减少遗忘。
RankBuffer:面向开放式生成的高效排序式奖励
RankBuffer 维护可复用的排序缓冲区,以低成本相对奖励优化开放式生成,性能超越逐点基线。
FineSID:面向生成式推荐的可扩展高效语义标识符学习
FineSID以细粒度软梯度传播替代Top-1硬赋值,均衡优化码本,缓解SID冲突,提升推荐精度。
基于偏好优化的可泛化终身模型编辑
GLIME结合知识编辑与偏好优化,借回放与梯度约束,提升终身编辑泛化并保持模型通用能力。
MLToolBench:面向机器学习开发的工具增强智能体学习
提出诊断工具集与SPICE轮级奖励训练,使智能体学会用工具,域内成功率升至69.2%。
BiFE:基于LLM双保真度演化的搜索高效纯CPU分支策略发现
BiFE以低保真预筛、高保真评估精英,高效搜索纯CPU分支策略,性能超越SCIP及部分GPU策略。
智能体能否为智能体设计程序库?
推出LibraryDesignBench基准,评测智能体为智能体设计库的能力,发现下游复用不足,改进指引可提升复用与简洁性。
JudgeProfile:理解并引导 LLM 裁判的主观性
JudgeProfile将LLM评判拆为感知与优先级,重加权调控主观性,一致率升至71.97%。
SIPO:统一强化学习与同策略自蒸馏
SIPO以对比自教师提供密集token级反馈,统一强化学习与同策略自蒸馏,推理和代码任务超越RLVR与OPSD。
区分还是同化:不可逆资源耗尽下的最后机会策略识别与风险预算恢复
不可逆资源耗尽下,权衡区分故障与同质化状态,提出最后机会策略识别和风险预算恢复,满足失败预算。
ARC-KV:为基于重构的KV缓存压缩摊销锚点搜索开销
学习可复用锚点选择策略,单次评分选锚并复用压缩KV缓存,压缩提速25.7倍且精度提升。
Code4Scene:面向3D场景构建与编辑的编程智能体基准测试
以190个虚幻引擎场景评测编程智能体的3D场景构建与编辑,发现二者强相关却不可互换,最佳修复F1仅0.527。