去中心化Master-Mind:多智能体路径规划中通过迭代意图去噪实现联合动作细化
DMM用迭代意图去噪细化联合动作,提升去中心化多智能体路径规划成功率、降成本并扩展至百万智能体。
迈向代码 API 的交互式理解
提出PAU基准:模型仅凭黑盒API查询理解Python代码,前沿模型表现不佳;AAC后训练提升探索。
ScopeIF:通过分级奖励建模提升大语言模型中的作用域感知精确指令遵循能力
提出ScopeIF框架,用作用域-目标-范围模式与分级奖励建模,提升模型作用域感知精确指令遵循能力。
基于经济数据与基础模型的中期多分辨率电力负荷预测
基于经济数据与基础模型的法国中期负荷预测,1–48个月误差约4%–5%,经济特征重要性随预测期增加。
NanoForecast v0.5:通过训练流程优化实现有竞争力的时间序列预测
6.5M模型仅经训练流程优化,MASE降43.8%,媲美200M的TimesFM,三个ETT数据集全胜
mu-bench:多语言话语转录基准
发布多语言语音转录基准mu-bench及语义指标UER,含4270条银行来电,与人工一致κ=0.78。
推理只会聚集错误,自一致性却浑然不觉
固定权重下仅切换推理模式,推理即令独立采样的错误高度重合,自一致性无从察觉;置信度加权在280种组合中无一优于普通多数投票。
Residual Streams Read, Recurrent States Remember: The Global Workspace in Mamba Models
现代化压缩域视频字幕生成器:SigLIP2 与 GPT-2 替换的对照研究
压缩域视频字幕中,SigLIP2替换CLIP提升指标,叠加GPT-2因过拟合反削弱增益,需权衡延迟。
使用语言模型模拟句子理解中语境与共指的影响
语境窗口与阅读数据呈U型:长语境拟合最佳;扰乱跨句共指链使预测力降20%–40%。
类型化决策模型:早期证据审计与评估清单
综述28篇论文:类型化读出未见独立精度优势,主要省延迟与成本,并提炼14项评估清单。
神经语言模型学习轨迹中的泛化与记忆:范畴化的几何阐释
神经语言模型早期即通过范畴化几何结构泛化,后期转向样例记忆并破坏该结构。
美国西海岸枢纽国内航空的三维排放制图与社会成本估算
利用自编码器重建美国西海岸枢纽航班轨迹,绘制三维排放图并估算社会成本,发现NOx是健康成本主导。
接收方条件化的潜在通信实现 94% 的 CacheBack
CacheBack 按接收方信息需求过滤压缩 KV 缓存,状态减 75%,准确率提升 14.7 点,延迟降 3.2 倍。
评委并非其孪生:后训练让模型的写作更可预测,却几乎不会让其作为评委的品味偏向可预测的写作
后训练令模型写作更可预测,但作为评委几乎不更青睐可预测文本;创意评估几乎不受影响。
OptiArena:LLM 能否在固定资源预算下改进可执行算法?
OptiArena 验证 LLM 在固定资源与五轮编辑下优化可执行博弈算法的能力:改进弱基线较稳定,优化强基线则差异显著。
同一个探针,不同的数字:激活探针能否抵御推理时的数值非确定性?
激活探针跨批大小与精度数值稳定,但准确率低估判决翻转2–9倍,翻转主因是文本变化而非浮点运算,宜报告逐样本一致性。
RPA:面向脑电图和脑磁图图像检索的残差图块 Token 适配器
提出轻量 RPA,利用 ViT 中间层全部图块 Token 对齐脑电/脑磁图,在 THINGS-EEG2/MEG 上达 SOTA。
合约监督:以权力分立治理人工智能
提出AI安全框架,以合约限定智能体行为,通过监督者与裁判分权及算力不对称执行,可实证衡量安全保证。
OmniFysics-Captioner 技术报告:将全模态理解扎根于物理世界,以提升描述能力
提出物理感知全模态描述框架,构建数据与评测基准,模型比肩 Gemini 3.1 Pro 并达最优水平。
找不到沃尔多:评估视觉语言模型对图像分辨率与细节级别的敏感性
提出受控评估框架及AUSC、PVS指标,发现VLM高分辨率下三类失败模式,连SOTA也降效。
基于混合优化策略的集成深度学习框架用于家蚕自动化健康检测与分析
提出混合残差注意力网络与集成自适应动量优化器,家蚕图像六分类准确率达98.67%。
FFN 压缩改变了下游什么?扩散语言模型中的同状态因果恢复
提出同状态因果恢复,测压缩FFN对扩散语言模型下游去噪轨迹影响,仅恢复4个转换挽回89.9%准确率。
理性对话者模型:理解与产出的统一
提出理性对话者模型,用身份、保真度、知识三参数统一理解与产出,解释对不同伙伴的交流调整。
记忆即中间件:面向自我改进的AI智能体
智能体跨会话失忆、重复犯错;应将记忆打造为可插拔的中间件层,本文归纳六大系统挑战并给出参考实现。
GameBoyWorlds:具身电子游戏中自我改进的测试平台
提出GameBoyWorlds测试平台,评估智能体在电子游戏中自主探索与自我改进,前沿模型表现不佳。
主动因果发现基准:在预算受限干预下评估LLM智能体
ACDB基准评估LLM智能体在预算干预下的主动因果发现:PC最强,LLM易过度干预,结果仅为校准。
联合嵌入预测架构预训练有助于时间序列预测吗?
大规模评估显示,JEPA预训练效益因骨干而异,部分架构持续提升、部分持续下降,跨任务族一致,并非普遍可靠。
基于选择性推断的多示例学习统计检验及其在计算病理学中的应用
提出选择性推断框架评估高注意力实例,校正数据依赖选择,计算有效p值,控制I类错误,用于病理全切片。
CLC-YOLO:一种紧凑的通道门控原型网络,用于实时防泄漏的乳腺超声病灶分割
CLC模块仅增64参数与0.0966ms开销,四数据集分组宏Dice最高提升3.11个百分点。
当关键词指标下降而分类器仍稳定:KV 缓存压缩下的软拒绝
KV缓存压缩下,关键词拒绝率下降但分类器稳定,人工更支持分类器,属软拒绝;安全审计需多评委。
MDL校准的显著性增益对编码:面向子词分词的复制感知自动停止
MDL-SG以复制检验和MDL增益自动停止子词合并,在WikiText-103上取得更低BPC。
Seq2Cause:一个自回归骨干,完成事件序列中的四类因果发现任务
Seq2Cause以单一冻结自回归骨干统一四类事件序列因果发现,无需重训,并首次扩展至数万事件类型。
智能体式视频理解:综述
综述智能体式视频理解,形式化智能体循环,按挑战-设计分类梳理关键方法、基准与评估,展望视频原生智能体。
孟加拉水稻叶片病害跨域泛化基准:强增强有效,AdaBN有害,自监督ViT亦失效,主因采集条件偏移。
孟加拉水稻叶片病害跨域泛化基准:强增强有效,AdaBN有害,自监督ViT亦失效,主因采集条件偏移。
TRAP:理解与缓解语言模型中的隐私记忆
提出TRAP,用逐token目标参考优势单侧惩罚,将隐私记忆降至未训练水平而几乎不损实用性。
梯度用于干预、激活用于检测:语言模型中的定向特征学习
对比六种定向特征学习方法:激活值法检测最强,梯度法干预最强,特征质量取决于模型信号与估计器。
DOHF:基于杜布h变换引导的在线扩散微调
提出DOHF,用杜布h变换实现在线扩散微调,以最优性权重估计局部校正并蒸馏入模型,支持黑盒奖励,提升生成对齐。
PanoFuse:全景增强的视觉-语言-动作学习与解耦语义-几何路由
PanoFuse以全景分支与解耦语义-几何路由为VLA补充全局上下文,显著提升遮挡及新场景下操作成功率。
SinBrief:僧伽罗语法律文档抽象文本摘要的混合框架
SinBrief混合框架无需人工标注,融合领域词图与神经评分,实现僧伽罗语法律文档抽象摘要。
双语AI听力师在模拟病例盲评中全面超越人类听力师:基于评分量表引导的策略手册归纳
双语AI听力师无需微调,凭量表引导的策略手册,在58例模拟病例盲评中全面胜过17名人类听力师。
面向低轨卫星星座星上学习的资源感知联邦混合专家与自适应剪枝
提出COSMIC-FL,融合联邦混合专家与自适应剪枝,实现低轨卫星星上高效学习,最多降低通信、计算和能耗80%。
逃离对齐:Best-of-N越狱的物理陷阱模型
提出物理陷阱模型,以四个可解释参数刻画Best-of-N越狱攻击面,可外推并预测温度影响。
AI 约束框架:基础模型智能体在提案条件信息下的认证
基础模型智能体认证需提案-历史关联与共同稳健安全干预;压缩为仅状态包络会破坏可认证性。
平均镜像下降与对偶梯度方法:熵正则 Gromov-Wasserstein 问题的收敛算法
提出平均镜像下降与固定步长对偶梯度法,使熵GW问题对任意代价收敛并处理不精确迭代。
含噪测试时强化学习用于代码大语言模型
提出NTRL-Code框架,仅用无标注含噪数据实现代码LLM鲁棒自进化,在三个基准上稳定提升性能。
关系压缩:受限表示中的关系保真框架
提出关系压缩框架,以关系结构为保真核心,统一图摘要、谱稀疏化与关系蒸馏,并用有限码字碰撞实现。
水印藏身何处?面向不可见水印去除的推拉解耦
提出推拉解耦,单图去除不可见水印,无需参考或密钥;实验显示解码器依赖辅助潜变量,理论仅为事后解释。
LANTERN:照亮语言模型中隐藏的数学知识
LANTERN借模型内部激活排序数学关系,在OEIS发现62条经验证关联,4条全新,全程不足8小时。
READ-Bench:面向时间序列诊断的历史实例检索基准
READ-Bench基准用12个数据集评测历史案例检索,发现少量有标签案例的重排序远胜复杂表示。