WEFT:面向通用智能体的工具使用后训练规模化
WEFT提出全系统演化框架,协同扩展交互系统、执行驱动自演化与稳定后训练,多基准超越同规模基线。
VesselBench-800K:面向多模态船舶检测、计数与密度估计的大规模感知基准
迄今最大全球多模态船舶感知基准,含80万张512×512光学/SAR图像,支持检测、计数与密度估计。
Back2Struct:让结构化图像重新可编辑
从图像恢复可编辑 SVG/XML 代码,让图表等结构化图像可编辑并保持视觉保真。
Salt++:面向少步流式多模态生成的上下文对齐后训练
Salt++以因果自流与上下文对齐自回归DMD两阶段后训练,实现4步流式音视频生成,视觉与运动质量大幅领先。
当上游消息覆盖正确答案:多智能体LLM协作的受控研究
错误上游消息可使下游在32%情况下覆盖正确答案,94%为答案替换;通信应依据上游可靠性有选择地进行。
UltraMatch:面向超快与内存高效图像匹配的传输路径路由
UltraMatch以路由少量候选路径替代稠密token匹配,大幅提速省内存,单卡支持6K分辨率推理。
大语言模型预训练的相对泛化不变性
提出相对泛化不变性(RGI):优化器与架构变化下近似成立,数据流变化则显著改变相对泛化。
多轮大模型污染中的认知策略分歧:一项协议梯度研究
多轮对话中虚假前提可被LLM当作事实采纳;五种污染协议沿权威梯度揭示模型采纳率与恢复能力的显著分化。
大语言模型能在多大程度上模拟真实学习者对教育反馈的评价?
LLM模拟真实学习者评价能力仍有限;提供画像与示例可改善分数校准和个体模拟,但难提升群体一致性。
从输入到输出:面向稀疏自编码器特征双端解读的灵活智能体
提出DAFI智能体,从输入端与输出端双向采集证据并迭代解读稀疏自编码器特征,兼顾准确率与效率。
超越次高斯检测器得分:面向人机文本分割的鲁棒加权轮廓损失变点检测
提出RWCP,以截断权重、Huber增益和可靠度坐标搜索稳健定位人机文本作者切换点,WindowDiff降17.6%。
HorizonFlow:面向离线目标条件强化学习的可变长度规划
HorizonFlow将规划长度作为生成输出,以插入式生成加流匹配联合生成内容与长度,无需价值模型,多基准平均性能最优。
驾驭框架演化即学习:自我改进型个人智能体的近似、泛化与优化极限
将驾驭框架演化视为学习问题,从近似、泛化与优化误差解释个人智能体自改进的局限。
面向星上数据缩减的嵌入式双时相建筑损毁评估
基于YOLOX孪生检测器,压缩上行参考并在星上比对,仅下行目标级损毁结果,抗配准误差,嵌入平台验证。
STAR-GRPO:面向表示依赖型奖励黑客的规范锚定与可靠性优先优势估计
提出STAR-GRPO,以可靠性优先优势估计分离质量与学习影响,锚定规范信号,有效抑制奖励黑客并提升真实质量。
基于采样内原始-对偶引导的可行流匹配图重建
提出约束原始-对偶PIFM,以采样中演化的拉格朗日乘子引导图重建,可行性提升11–26个百分点且无需重训。
神经科学中的深度学习方法:从分子机制建模到意识状态分类
综述深度学习在意识状态分类、麻醉脑建模与意识标志物识别中的应用,指出现有模型可解释性与标准化不足。
强化学习中的自确认叠加陷阱
RL训练可陷入自确认叠加陷阱,拟合全局最优仍维持低回报;保留被忽视状态可减少干扰并提升控制。
决策而非生成:基于Jev类型化决策的竞争性维度ABSA
冻结Jev以类型化决策完成维度ABSA三任务,无需生成微调;回归RMSE最低,抽取F1超微调大模型。
表格数据噪声标签的自适应集成选择
集成模块依数据属性为多类检测器赋权,诊断并清洗噪声标签;受控噪声下媲美置信学习,效果随数据属性变化。
面向高效视频生成的参数化条纹注意力
提出参数化条纹注意力PSA,统一刻画视频DiT的周期对角条纹,单内核生成稀疏掩码,提速1.57倍。
MemoReason:评估参数记忆对大语言模型上下文推理的影响。
提出配对真实与虚构推理的基准,发现大模型存在记忆偏差,性能降达15.7%,但非直接参数捷径。
面向业务化哨兵-2小麦面积估算中地面真值标签噪声消解的双轨数据整理与分类框架
用13期哨兵-2 NDVI与849样本,XGBoost最优;预测面积较官方仅高2.99%,优于空间掩膜25.11%,提出双轨整理分类框架。
衡量同质面板LLM辩论中的崩溃与纠正
提出可审计协议,追踪同质辩论的崩溃与纠正,揭示防崩溃可能以损失纠正为代价。
超越令牌节省:LLM智能体上下文压缩的系统性研究
系统研究LLM智能体上下文压缩,发现令牌减少未必更快更省,策略效果因模型和任务而异。
SCBO:面向基于大语言模型的社会调查的语义连贯批处理与排序
SCBO为免训练框架,用语义批处理、共享参考库与难易排序,降低token消耗与推理时间并提升准确率。
数据应当教会什么?在电路、存储与使用间迁移瓶颈
电路视角揭示形成计算、内容可用与路径选择三瓶颈,按缺失操作设计监督;实验证明早期电路训练助益后续学习。
RBF-GNN:面向伪坐标图卷积的有理基函数
提出RBF-GNN,用有理Padé基函数替代随维度指数增长的B样条,提升关键点匹配等任务性能。
评分标准感知的同策略自蒸馏:面向大语言模型个性化
提出GRASP框架,用评分标准感知的同策略自蒸馏将用户偏好转为token级监督,并验证教师质量,在LaMP-QA上达最优。
基于通用函数逼近的抗饱和对决老虎机
研究BTL偏好模型下通用函数逼近的上下文对决老虎机,提出SI-CDB,消除饱和导致的1/σ'因子。
当文字比图像更响亮:理解视觉语言模型中的语言偏见
VLM易受语言偏见,本文基于词补全分四阶段追踪传播,揭示语言先验与跨模态覆盖交互。
约束流策略更新:广义薛定谔桥视角
提出RAFALE,沿流策略生成路径直接优化增广拉格朗日,免估计得分,在七个安全任务中兼顾奖励与约束。
裁剪还是不裁剪?重尾噪声下平均 SGD 的有限样本权衡
重尾噪声下,裁剪未必提升平均SGD主导精度,但可让重尾修正对置信度的依赖由多项式降为对数。
偏微分方程先验的高效消息传递
基于因子图消息传递与矩匹配推断PDE参数后验,无需采样或全局优化,精度媲美基线且具结构化不确定性。
从差距中学习:面向GRPO的差分感知优势剪枝与自适应展开采样
提出FastRL框架,用优势感知剪枝和自适应采样提升GRPO等方法的训练效率与精度。
CADOC:面向长时程智能体的缓存感知动态对象上下文
CADOC批量替换上下文对象为卡片,保留按需检索,输入成本降约40%,性能接近全上下文。
神经符号计算机使用:学习可复用策略以实现可靠高效的执行
提出神经符号计算机使用,将重复工作流固化为可复用策略,神经模型处理依赖观测的决策,大幅降本增效。
MotionInsight:诊断生成视频中的物体运动缺陷
提出VidMotion数据集与MotionInsight评估器,实现物体运动缺陷的三维诊断。
首个面向交通信号控制的视觉-语言-动作模型
首个基于视觉-语言-动作模型的端到端交通信号控制方法,直接从多视角路侧视频映射为协调信号动作。
NHO:一种用于基于锚点的区域定位与稠密对应的神经哈密顿算子
NHO用稀疏锚点和内蕴几何学习神经哈密顿算子,以局域特征空间互惠细化,实现区域定位与稠密对应,抗缩放旋转。
双通道鲁棒群相对策略优化:基于优势与序列权重估计
提出双通道鲁棒优化器RoVR-GSPO,以有界残差信用与SoftRoVR聚合稳健估计优势和序列权重,抗奖励污染与比率异常,优于GSPO。
CoEM:以证据确认记忆赋能长上下文推理
CoEM暂存原文证据,随新上下文决定提升、保留或丢弃,经验证器校验,强化学习训练,提升长上下文推理。
OmniRoute:将时序语义证据映射至音视频令牌预算,实现高效全模态大语言模型
提出免训练两阶段压缩框架OmniRoute,按时序语义证据分配音视频令牌预算,兼顾效率与性能。
SCA:面向GUI智能体强化学习的空间信用分配
提出SCA,用点击坐标细化组相对信用,提升GUI智能体定位与动作预测,部署策略不变。
Real2Gym:从视频构建仿真训练场,让机器人获得技能
提出Real2Gym,将视频演示转为交互仿真训练场,习得技能迁移至真机,真机成功率超GPT-6 Astra 33.3%。
无承诺的上下文:非刚性变形下的鲁棒稠密对应
CoCo-Reg以区域块丰富稠密点特征却不限制最终点级搜索,非刚性配准对应误差降低72.6%。
Spatial-OPSD:通过无标签自蒸馏实现自我改进的空间推理
无标签自蒸馏,用深度与三维先验由教师对学生轨迹做词元级监督,逐轮递归训练实现多轮自提升并达开源前沿。
CF-LoRA:解耦因子聚合与适应感知客户端聚类用于联邦LoRA微调
CF-LoRA通过解耦因子聚合与适应感知聚类,解决联邦LoRA微调的聚合与协作不匹配,提升异构数据下的精度。
REALHOP:以行为审计重新审视多跳推理评估
提出行为必要性率(BNR):答案正确≠多跳推理;REALHOP将BNR从27.4%升至94.4%。
GleanVID:面向高效视频大语言模型的互补Token选择
GleanVID是免训练的视频大模型推理加速框架,按时间新颖度分配预算并联合代表性与互补性选Token,25%Token保留98.6%性能。