闭环:循环语言模型的实用训练配方
提出循环语言模型实用训练配方,训练预算从7.7T降至310B,1.4B模型超越同参密集模型,并可低成本改造预训练模型。
MoRA:基于路由器偏置学习与专家近似的MoE剪枝
提出MoRA框架:学习路由器偏置并加路由多样性正则以识别关键专家,再用专家近似补偿,剪枝后性能超越现有方法。
什么构建了场景?亮度主导3D高斯泼溅中的几何形成
3DGS几何形成由亮度主导:仅亮度监督接近RGB重建,色度可在几何冻结后重拟合,色度单独监督较差。
仅对齐 x:对齐预测,而非表征
表示对齐收益难迁移至像素干净图像预测,JAx对齐跨噪声预测,提升FID与收敛,无需外部编码器。
SemanTok:可预测的语义令牌,实现高效自回归视频生成
SemanTok 让冻结 DINO 特征可由各 token 前缀单独重建,实现高语义对齐与视频保真,小模型媲美 3.4 倍大模型。
Incident-Arena:让智能体达到可靠性的最后九个“9”
Incident-Arena:20项真实K8s故障注入基准,采用功能验证,前沿模型低于64.3%。
迈向鲁棒的数值论断验证
LLM数值论断验证脆弱;对扰动样本对抗微调后,小型Qwen3准确率达98.7%,超越前沿模型并可泛化迁移。
当更多数据还不够:生成式AI个性化中的上下文充分性前沿
提出上下文充分性理论:相关上下文比数量更重要,分不足、充分、饱和、干扰四态;实验表明无关上下文反降效果。
面向规范引导决策的简单信念道义逻辑
提出简单信念道义逻辑,定义规范遵从优化问题,区分主客观优化并给出归约至加权部分MaxSAT的条件。
以风格推理:发现并控制语言模型中的风格
无监督发现语言模型输出中六种风格,显式条件微调可控制风格并提升数学推理。
FedMAD:面向遥感图像分类的联邦学习调制感知定向聚合
提出FedMAD个性化联邦学习框架,分离全局与客户端参数,并设计调制感知定向聚合,抑制异构数据下的冲突更新。
《Soundwich:分层可控音频的视频生成》
Soundwich将冻结的音视频生成模型改造为生成多条与视频同步、可独立编辑的音频分轨的免训练框架。
面向自动化决策门控:System One 决策模型与训练分类器及语言模型的基准对比
在匹配条件下,基准测试 System One 决策模型、分类器与语言模型用于自动决策门控,优劣取决于标签、任务与风险条件。
基于推理与反思的个性化图像生成
提出首个基于用户历史的个性化图像生成基准,含场景与创意两任务,并推出推理-反思循环方法PEARL,指标平均提升15%。
基于本体、经推理器验证的科学AI大模型推理评测基准
提出从OWL本体自动生成多选题基准,推理器验证干扰项,六模型准确率41-77%,可诊断推理失败。
大型语言模型中的言语化概率与内部概率相互耦合
大模型内部与言语化概率均受训练数据分布和断言不确定性影响且相互耦合,言语化概率可探测内部分布。
M²Weather:联合多站点与多变量天气预报基准
提出M²Weather基准,覆盖三级2809站点5个耦合变量,统一协议与即插即用适配器,证明联合建模站点-变量关系可提升预报精度。
压缩语言模型中散度如何转化为决策翻转
总变差而非KL可直接预测压缩模型决策翻转率,中位比值1.05,并能预测投机解码接受率。
面向高效生成模型对齐的流形约束初始噪声优化
提出ZeNOVA:流形约束超球Langevin、退火软值引导与MH跳变无梯度优化初始噪声对齐黑箱奖励。
面向MDP中稀疏策略部署的贝尔曼认证舍入
有限MDP中连续策略稀疏二值舍入:2d+2次贝尔曼求解构建包络,候选界与局部积分提升认证、收紧损失界
注意力头消融何时能支持因果主张?投影级混杂、地板效应与匹配对照
单头消融易受投影位置、地板效应与对照不当影响;需连续指标和匹配对照,修正排名才稳定,但因果结论仍须审慎。
R-GroundBench:面向Markush分子编辑中R基团定位的诊断性基准
提出基于真实专利Markush结构的R-GroundBench基准,揭示模型在R基团定位与编辑上存在显著能力差距。
手语机器翻译
综述手语机器翻译进展与挑战:数据集与评测不足,需捕捉三维同步结构,强调伦理及与聋人社群协作。
ReLiveGym:在数周重放现实环境中评估长期运行智能体
提出ReLiveGym,用重放数周现实数据评估长期智能体,发现行动时机与反馈机制是设计关键。
FAER:面向语言模型后训练的可审计效用对齐轨迹回放
FAER提出可审计全轨迹回放框架,以学习者感知选择器对齐下游效用,在GSM8K上显著提升质量。
MemFit:高效的长期智能体记忆
MemFit 用免LLM的追加式存储与多路径检索,降低记忆构建成本与延迟,在三大基准达最优性能。
VTV-FM:通过变分终端速度闭合的流匹配
提出二阶流匹配框架VTV-FM,以最小化加速度能量推导缺失的终端速度,实现闭式闭合,提升传输几何与生成质量。
Sapien:面向自主 AI 智能体的有状态策略引擎
Sapien 是有状态策略引擎,用扩展正则约束工具调用序列,效用近无损,可拦截 93-95% 的攻击。
语境轨迹与增量语境位移:迈向利用大语言模型理解动态的、特定话语的意义建构
逐词重算上下文化词嵌入构建增量轨迹,能有效区分花园路径句与消歧句,话语信息分布于多表征尺度。
企业表示简化(ERS):降低企业AI的表示复杂度
提出企业表示复杂度(ERC)四维模型及经济成本模型,简化任务级表示可降低AI理解负担、提升推理准确率。
STCFormer:面向站点天气预测的动态聚类Transformer自适应时空建模
提出STCFormer,按时间片动态聚类站点,融合簇内局部与全局注意力,在八项天气预测任务中领先。
偏好不确定性下的鲁棒纳什对齐
提出鲁棒纳什对齐,用四玩家代理博弈与乐观镜像下降算法应对偏好不确定性,具收敛保证并提升表现。
魔鬼藏在重建损失尺度中:重新思考大语言模型量化中的优化
揭示LLM的PTQ中MSE重建损失尺度致优化失衡,RMSE变体隐式梯度归一化显著优于MSE。
视频生成模型:后训练与对齐综述
首篇视频生成后训练与对齐综述,提出隐式/显式对齐框架,归纳四类方法、数据基准及开放挑战。
视频证据索引:从视频预览中学习该看哪里,面向 Token 预算受限的长视频问答
提出视频证据索引,用低分辨率预览构建高分辨率证据集,联合证据定位与预算规划,自蒸馏提升长视频问答。
基于方差缩减序贯蒙特卡洛的特异性感知扩散引导
提出特异性感知扩散引导:以重叠目标设计分布,用方差缩减序贯蒙特卡洛采样,抑制负区域、减少模式偏移并稳定采样。
Kepler:面向 ARC-AGI-3 的可审计世界模型
Kepler以可执行世界模型表示假设并加以验证,在ARC-AGI-3公开25款游戏全获满分,表明公开集分数区分度有限。
为过多 Token 买单?基于简单启发式的有效且经济高效多模态 LLM 标注
系统评估短视频VLM标注启发式:准确率≠推断效度,单模态文本可能足够,2×8图像网格约15%成本达全视频理解。
VLM低层视觉表征中的几何相似性
提出GeoSim四层框架,分析24项低层视觉任务中AR与DiT表征的几何相似性,揭示共性组织原则及跨任务/模型局限。
EvoGen-Harness:学习在何处以及如何演化图像生成外围框架
通过失败归因引导多职责协同演化,在冻结T2I生成器外围自适应,显著超越单维度方法。
面向可解释语音音段分析的儿童适配结构化音系表征
PhonoQ-2.0适配儿童语音,清浊F1达0.97+,方式受监督影响,部位稳定,保留临床相关变化。
教育者引导的LLM教学智能体:面向概念数据库设计的支架式反馈
教育者引导LLM智能体,基于ERD与评分标准分四阶段提供支架反馈;383次中71.1%采纳隐藏诊断。
Lang3DSeg:基于点变换器的无标注开放词汇3D分割
Lang3DSeg首次以点变换器为骨干,实现无标注开放词汇室外LiDAR分割,修正投影深度歧义,两大基准均达最优。
DeBERTa-ConPara:攻击感知且面向真实部署的 AI 生成文本检测
提出DeBERTa-ConPara,推理端Unicode归一化有效,RAID隐藏测试AUROC达99.61%,主要提升同形字与零宽空格攻击检测。
MatrixReward:面向开放式生成的基于评分标准矩阵的奖励
提出MatrixReward,用rollout×rubric胜率矩阵构建奖励,以列离散度与相关性加权,借正负理想画像距离评分,四基准均分63.02,超基线约2.0%。
上下文关系的几何:语言模型按提及顺序寻址事实
大模型按提及顺序而非名称定位事实,形成共享、低秩、可操控的事实地址,随预训练涌现。
用于预测rTMS抑郁症治疗结局的时频图像融合技术
融合EEG时频图像并用轻量CNN预测rTMS抑郁疗效;严格受试者不交叉验证下性能崩溃。
面向交互策略快速适应的元多智能体强化学习及其在自动驾驶中的应用
提出元多智能体强化学习框架,建模马尔可夫博弈并定义元纳什均衡,实现交互策略快速适应,自动驾驶中优于基线。
OmniMed-Jev:通过 System One 校准 LVLM 置信度,实现可信的医学多模态决策。
OmniMed-Jev以候选集概率分布建模医学决策,替代生成式文本输出,显著降低校准与可靠性误差。
ReHoPER:面向增强推理的滚动时域规划
免训练零样本方法,滚动时域迭代规划并回答中间问题,多路径推进,任务无关,组合推理提升显著。