场景理论:打破多智能体大语言模型协同中的对称性陷阱
同质LLM智能体无通信并发易陷对称陷阱;提出免训练ToS,靠公共角色与场景分工,在多个基准超越基线。
语言模型内省的机制研究
固定输入下注入概念向量,发现中层门控头决定是否报告,后层路由头定位扰动,准确率依赖概念向量对齐。
从规范框架到对齐数据:构建与评估SFT与偏好数据
七位专家依伊斯兰伦理构建2.8K SFT与5.4K偏好数据;SFT显著提升对齐,偏好数据增益不显著。
逻辑的几何:分层诱导语义结构与稳健推理
STRAT将残差流分为数据/类型子空间,提升逻辑推理泛化;算术OOD误差降35倍,分布偏移下更稳健。
理解同策略蒸馏:基于稀疏交叉编码器的机制可解释性视角
借助稀疏交叉编码器与交换读出法发现:同策略蒸馏不创造新特征,只是重新加权学生已有的共享特征。
陈旧度在哪里累积?面向大语言模型后训练中异步RL的池感知有效陈旧度控制
将轨迹陈旧度分为生成与等待陈旧,提出池感知PACE控制,提升异步RL精度并省47% GPU时间。
TwinS-GCN:用于谱图卷积网络的谱共轭
提出谱共轭分解移位算子,构建TwinS-GCN双滤波器,实现长程无衰减传播,节点分类具竞争力。
面向PDE贝叶斯反演的自然语言条件生成先验
自然语言条件生成先验,融合文本、数据与少量噪声传感,用于PDE贝叶斯反演与不确定性量化。
当置信度过早上升:通过过早答案承诺检测捷径推理
提出ConfLens追踪答案置信度演化,用DACS分布熵检测过早自信捷径,改善奖励模型偏好。
IronLLM:为实时具身智能锻造紧凑的端侧原生语言模型
IronLLM-0.6B为6.54亿参数端侧语言模型,融合混合注意力与X-MTP多token预测,解码提速1.48倍,性能媲美更大模型。
中文标题:PrecogUI:通过预认知模拟与经验检索实现的主动式GUI智能体
PrecogUI预认知架构融合经验池、模拟预测与闭环纠错实现主动决策,在强干扰长程任务上超越现有方法。
基于统计形状模型与深度学习的骨盆骨折复位螺钉自动规划
提出全自动骶髂螺钉术前规划流程,自动识别安全通道并生成个体化轨迹;200例验证:安全边界提升2%,规划时间减少逾90%,接受率达95%。
状态轨迹推理解释作为强化学习中的辅助任务
STRAT以预测自身状态文本轨迹为辅助任务,助RL攻克稀疏奖励难题,压缩状态表示并提供可读解释。
World2Motion:将视频世界模型转化为三维人体动作生成器
将视频世界模型改造为单阶段3D人体动作生成器,构建混合数据并提出偏移解耦噪声调度,推理提速约3.3倍。
视觉并行搜索:通过并行瓦片检查与自适应缩放学习搜索高分辨率图像
提出VPS视觉并行搜索框架,主智能体并行检查图像瓦片并自适应缩放,提升高分辨率视觉问答,且可训练。
WEFT:面向通用智能体的工具使用后训练规模化
WEFT提出全系统演化框架,协同扩展交互系统、执行驱动自演化与稳定后训练,多基准超越同规模基线。
VesselBench-800K:面向多模态船舶检测、计数与密度估计的大规模感知基准
迄今最大全球多模态船舶感知基准,含80万张512×512光学/SAR图像,支持检测、计数与密度估计。
Back2Struct:让结构化图像重新可编辑
从图像恢复可编辑 SVG/XML 代码,让图表等结构化图像可编辑并保持视觉保真。
Salt++:面向少步流式多模态生成的上下文对齐后训练
Salt++以因果自流与上下文对齐自回归DMD两阶段后训练,实现4步流式音视频生成,视觉与运动质量大幅领先。
当上游消息覆盖正确答案:多智能体LLM协作的受控研究
错误上游消息可使下游在32%情况下覆盖正确答案,94%为答案替换;通信应依据上游可靠性有选择地进行。
UltraMatch:面向超快与内存高效图像匹配的传输路径路由
UltraMatch以路由少量候选路径替代稠密token匹配,大幅提速省内存,单卡支持6K分辨率推理。
大语言模型预训练的相对泛化不变性
提出相对泛化不变性(RGI):优化器与架构变化下近似成立,数据流变化则显著改变相对泛化。
多轮大模型污染中的认知策略分歧:一项协议梯度研究
多轮对话中虚假前提可被LLM当作事实采纳;五种污染协议沿权威梯度揭示模型采纳率与恢复能力的显著分化。
大语言模型能在多大程度上模拟真实学习者对教育反馈的评价?
LLM模拟真实学习者评价能力仍有限;提供画像与示例可改善分数校准和个体模拟,但难提升群体一致性。
从输入到输出:面向稀疏自编码器特征双端解读的灵活智能体
提出DAFI智能体,从输入端与输出端双向采集证据并迭代解读稀疏自编码器特征,兼顾准确率与效率。
超越次高斯检测器得分:面向人机文本分割的鲁棒加权轮廓损失变点检测
提出RWCP,以截断权重、Huber增益和可靠度坐标搜索稳健定位人机文本作者切换点,WindowDiff降17.6%。
HorizonFlow:面向离线目标条件强化学习的可变长度规划
HorizonFlow将规划长度作为生成输出,以插入式生成加流匹配联合生成内容与长度,无需价值模型,多基准平均性能最优。
驾驭框架演化即学习:自我改进型个人智能体的近似、泛化与优化极限
将驾驭框架演化视为学习问题,从近似、泛化与优化误差解释个人智能体自改进的局限。
面向星上数据缩减的嵌入式双时相建筑损毁评估
基于YOLOX孪生检测器,压缩上行参考并在星上比对,仅下行目标级损毁结果,抗配准误差,嵌入平台验证。
STAR-GRPO:面向表示依赖型奖励黑客的规范锚定与可靠性优先优势估计
提出STAR-GRPO,以可靠性优先优势估计分离质量与学习影响,锚定规范信号,有效抑制奖励黑客并提升真实质量。
基于采样内原始-对偶引导的可行流匹配图重建
提出约束原始-对偶PIFM,以采样中演化的拉格朗日乘子引导图重建,可行性提升11–26个百分点且无需重训。
神经科学中的深度学习方法:从分子机制建模到意识状态分类
综述深度学习在意识状态分类、麻醉脑建模与意识标志物识别中的应用,指出现有模型可解释性与标准化不足。
强化学习中的自确认叠加陷阱
RL训练可陷入自确认叠加陷阱,拟合全局最优仍维持低回报;保留被忽视状态可减少干扰并提升控制。
决策而非生成:基于Jev类型化决策的竞争性维度ABSA
冻结Jev以类型化决策完成维度ABSA三任务,无需生成微调;回归RMSE最低,抽取F1超微调大模型。
表格数据噪声标签的自适应集成选择
集成模块依数据属性为多类检测器赋权,诊断并清洗噪声标签;受控噪声下媲美置信学习,效果随数据属性变化。
面向高效视频生成的参数化条纹注意力
提出参数化条纹注意力PSA,统一刻画视频DiT的周期对角条纹,单内核生成稀疏掩码,提速1.57倍。
MemoReason:评估参数记忆对大语言模型上下文推理的影响。
提出配对真实与虚构推理的基准,发现大模型存在记忆偏差,性能降达15.7%,但非直接参数捷径。
面向业务化哨兵-2小麦面积估算中地面真值标签噪声消解的双轨数据整理与分类框架
用13期哨兵-2 NDVI与849样本,XGBoost最优;预测面积较官方仅高2.99%,优于空间掩膜25.11%,提出双轨整理分类框架。
衡量同质面板LLM辩论中的崩溃与纠正
提出可审计协议,追踪同质辩论的崩溃与纠正,揭示防崩溃可能以损失纠正为代价。
超越令牌节省:LLM智能体上下文压缩的系统性研究
系统研究LLM智能体上下文压缩,发现令牌减少未必更快更省,策略效果因模型和任务而异。
SCBO:面向基于大语言模型的社会调查的语义连贯批处理与排序
SCBO为免训练框架,用语义批处理、共享参考库与难易排序,降低token消耗与推理时间并提升准确率。
数据应当教会什么?在电路、存储与使用间迁移瓶颈
电路视角揭示形成计算、内容可用与路径选择三瓶颈,按缺失操作设计监督;实验证明早期电路训练助益后续学习。
RBF-GNN:面向伪坐标图卷积的有理基函数
提出RBF-GNN,用有理Padé基函数替代随维度指数增长的B样条,提升关键点匹配等任务性能。
评分标准感知的同策略自蒸馏:面向大语言模型个性化
提出GRASP框架,用评分标准感知的同策略自蒸馏将用户偏好转为token级监督,并验证教师质量,在LaMP-QA上达最优。
基于通用函数逼近的抗饱和对决老虎机
研究BTL偏好模型下通用函数逼近的上下文对决老虎机,提出SI-CDB,消除饱和导致的1/σ'因子。
当文字比图像更响亮:理解视觉语言模型中的语言偏见
VLM易受语言偏见,本文基于词补全分四阶段追踪传播,揭示语言先验与跨模态覆盖交互。
约束流策略更新:广义薛定谔桥视角
提出RAFALE,沿流策略生成路径直接优化增广拉格朗日,免估计得分,在七个安全任务中兼顾奖励与约束。
裁剪还是不裁剪?重尾噪声下平均 SGD 的有限样本权衡
重尾噪声下,裁剪未必提升平均SGD主导精度,但可让重尾修正对置信度的依赖由多项式降为对数。
偏微分方程先验的高效消息传递
基于因子图消息传递与矩匹配推断PDE参数后验,无需采样或全局优化,精度媲美基线且具结构化不确定性。
从差距中学习:面向GRPO的差分感知优势剪枝与自适应展开采样
提出FastRL框架,用优势感知剪枝和自适应采样提升GRPO等方法的训练效率与精度。