TRACE:面向生成校准的单次解码轨迹风险定位
TRACE将解码时不确定性视为轨迹,记录token意外度与熵,用局部风险算子保留尖峰并转为答案级置信度;TRACE+校准后在四任务上降Brier、升AUROC。
NRF-GS:面向高表达力与紧凑高斯泼溅的神经残差场
以共享全局神经残差场替代逐高斯球谐,增强视角相关反射建模,高斯数量减少50%仍保持或提升渲染质量。
AnyAct:面向自进化智能体的通用动作层
提出通用动作层AnyAct,以渐进检索与测试时演化统一异构反馈,实现动态工具生态下的可靠高效编排。
面向医院患者流优化的物理信息多智能体协调
提出物理信息多智能体协调框架,将BCMP排队先验嵌入去中心化强化学习,协同优化患者流并降低系统延迟。
语言作为界面:基础模型对比学习连接转录组与电生理
LangPatch以语言为界面,用冻结文本编码器对齐基因与电生理表征,实现跨模态预测及脑区、物种迁移。
低秩参数化之外:通过梯度分解缩小LoRA与全量微调之间的差距
GDLoRA将权重梯度正交分解,提取LoRA切空间之外的“法向梯度”直接更新基权重,不增显存即缩小与全量微调的差距。
无模态误导的端到端自监督RGB-T跟踪
ESMTrack:端到端自监督RGB-T跟踪,免伪标签与密集标注,缓解模态主导,五基准领先且实时。
从可行失败前缀中学习:面向长时程LLM智能体的里程碑可行性潜力策略优化
提出MVPO,从可行失败前缀学习并修复零信用优势,显著提升长时程LLM智能体表现。
MSTypography:通过平衡词语可读性与物体可识别性实现多字符语义排版
提出全局到局部的多字符语义排版框架,兼顾字形可读性与物体可识别性,在五种语言上超越SOTA。
FedLAFP:联邦微调中低秩聚合与全秩个性化的融合
FedLAFP以共享LoRA低秩聚合、客户端私有RandLoRA全秩个性化,仅交换共享参数,四基准平均准确率86.93%,超最佳基线1.30个百分点。
MatToolBench:面向真实材料科学工作流的多模态智能体基准测试
首个真实材料科学软件多模态智能体基准,含204项任务,最佳仅GUI 25%、代码45%成功率。
面向设备-边缘多模态推理的基于残差向量量化的任务导向视觉特征压缩
提出Q-TOFC,用残差向量量化压缩视觉特征,融合查询相关聚合与量化误差补偿;负载较TOFC降53.6%,性能相当,时延更低。
ACTR:对齐思维与响应,提升推理型大语言模型的多语言安全性
ACTR框架通过定位安全思维神经元并优化推理与响应一致性,提升推理大模型多语言安全性。
基于项目反应理论的评分标准奖励
提出RRT,以项目反应模型聚合评分标准判定,在线EM更新,减少评审请求并优于GRPO。
观看-思考-交互:用强化学习自举长时程多轮流式视频推理
提出WTI闭环框架,以记忆与选择性回忆实现多轮流式视频推理,在基准上取得最佳性能。
面向结构化表示学习的几何感知算子族
提出GIOF,从固定几何构造传播算子族并按上下文动态选择,理论完备,交通缺失场景MAE更低。
Mycelium:面向配电系统的可泛化跨电网多任务模型
提出可泛化跨电网多任务模型Mycelium,基于异构图与物理仿真,在未见配电网多数指标上超越专用基线。
自适应循环 Transformer 提升测试时扩展
提出 TaH2,按需分配循环迭代,提升测试时扩展效率;AIME 上准确率-算力斜率提高 53%,同算力超基线 3.4 分。
从宪法到控制:面向语言模型对齐的可解释奖励
提出基于评分标准的框架,将通用宪法转为可解释、可调的奖励模型,通过重加权定向控制行为并缓解偏见。
改进的分布扩散模型
将粒子扩展推迟至后层并引入时间相关评分规则调度,使分布扩散模型少步生成质量优异且不随采样步数退化。
KernelZero:协同进化提议器与编码器,持续改进 GPU 内核生成
KernelZero 通过提议器与编码器协同进化,按能力生成训练模块,先确保正确再优化性能,持续提升 GPU 内核生成。
自动微分的精确性局限:论物理信息机器学习中自动微分的失效
自动微分虽能精确计算导数,却无法感知物理结构,数值精确不等于物理保真,这一缺陷将重塑PDE神经代理模型的构建。
打破静态评估下评审可靠性的幻象:面向基于大语言模型的科学审稿人的SCOPE模糊测试
构建三层扰动评估框架,揭示静态评估的分层脆弱与覆盖不足,提出SCOPE-Fuzzer持续挖掘被忽视的漏洞。
为何多模态大模型难以计数:以ConvStack突破个体化与聚合瓶颈
揭示MLLM计数受分块个体化与聚合压缩双瓶颈制约,提出ConvStack注入局部结构提升密集计数。
D-JEPA:具有可互换物理解码器的设计可恢复JEPA表示
D-JEPA从几何学得设计可恢复表示,配可换物理解码器复用,抑制塌缩,兼顾预测精度与可微设计优化。
眼所惧者:以读盲写入解释 Transformer 中的巨量激活
巨量激活源于注意力与FFN的读写不对称:读时无视MA、写时照常,阻断纠错并累积;读盲先于FFN放大且被主动维持。
ECG-Scroll:面向动态心电图解读的长时程流式基准与智能体环境
提出长时程流式心电图解读基准与智能体环境,按块流式输入,在线定位阵发事件,规则奖励并可衡量检测延迟。
后层注意力层单独即可复制实体词元,但需关注其上下文
Qwen3-8B中,后半部两组注意力层是实体复制必要且充分条件,上下文对实体词元的注意力也不可或缺。
基于指令分解的多粒度语言引导模仿学习
提出指令分解的多粒度语言引导模仿学习,将整体任务描述拆解为细粒度子任务指令,提升学习效率与性能。
TaoFlowForge:基于级联流匹配的渐进式原生网格生成
基于级联流匹配将网格生成分解为顶点与连接预测,两阶段粗到细,图像条件下达开源拓扑生成SOTA。
QuanReview:面向人类与LLM跨度标注的离线、可审计协调
开源系统对齐人工与LLM标注,自动合并一致项,将冲突交由人工裁决并导出修正标注层。
追溯三千年来甲骨文字的演变
提出流形文字演化框架MSEF,将甲骨文至楷书字形建模为流形连续演化,以神经常微分方程学习跨时代转换规则。
Waypoint-1.5:面向消费级硬件的实时视频世界模型
Waypoint 1.5 是可实时运行于消费级硬件、响应键鼠操控的交互式视频扩散世界模型。
MS-GLA:多尺度门控线性注意力——以多时间分辨率破解表征瓶颈
MS-GLA让注意力头跨多时间分辨率分工,粗粒度抓长程依赖、细粒度保局部句法,动态融合重组,不增单头状态即扩记忆。
从非规则观测中免模拟学习高斯过程随机微分方程
提出免模拟变分框架GP-SDE Matching,处理不规则观测,提升漂移恢复与预测。
线性注意力如何记忆
线性注意力用固定循环状态存储事实,读写集中,多事实共享表征且相互干扰,负载越高召回与可编辑性越差。
执行框架学习实现可泛化的测试时自适应
训练提议模型按执行反馈修正求解器的执行框架,测试时不改参数即可泛化适应新任务。
语言模型会依据隐藏效价行事
激活引导显示,语言模型会依据隐藏效价做选择;该效应在DPO后显现,模型还会主动移除强加的负效价。
大语言模型能否正确评估证据价值?动态医学诊断中的证据—价值错位
提出动态医学诊断基准,揭示大模型证据价值错位,并设计框架,准确率提升12–51个百分点。
CARVE:利用可复用专家经验打破芯片布局数据壁垒
以冻结基础策略和验证专家复用经验,新任务先复用否则新训;宏布局耗时降58.5%,免训复用6/7电路。
EviViT:面向细粒度感知的证据自适应视觉Transformer
EviViT借视觉搜索轨迹预测证据密度,引导区域重读与token分配,冻结主干通用,提升细粒度精度。
@elonmusk:给AI做沙盒隔离的最佳办法,就是把它送上达美航空的航班——它绝不可能连上互联网!
马斯克调侃:把AI放到达美航班上,因其网络太差无法联网,堪称最佳沙盒隔离。
@_akhaliq:Audio8 ASR Infinite
流式语音识别模型,原生架构每秒解码12.5次,滚动KV缓存使内存与延迟恒定,支持7×24运行。
马斯克在白宫回应AI抢工作:人人都会有"全民高收入",工作会变但不会消失
马斯克白宫回应AI抢工作,称人人将有"全民高收入",工作会变但不会消失。
@alexandr_wang:该表扬就表扬,他们确实躲过了“屁眼”指控
该夸就夸,他们确实避开了“屁眼”指控。
Anthropic、Meta、Google 签署白宫 AI 安全协议:内部审查加外部审计,企业自愿执行
Anthropic、Meta、Google CEO 在白宫与特朗普会面,签署自愿性 AI 安全开发协议,含内部审查与外部审计。
@elonmusk:查拉图斯特拉如是说
马斯克发布“查拉图斯特拉如是说”。
@elonmusk:星舰超重型
马斯克发布星舰超重型相关动态。
@Suhail:🎯
🎯
@NVIDIAAI:祝贺 OpenClaw 社区发布 OpenClaw Enterprise!🦞
祝贺OpenClaw社区推出企业版;可用NVIDIA OpenShell开源治理智能体,共促安全。