从发现到决策:LLM投票中的有限预算可恢复性
揭示LLM投票固定预算下发现与决策的差距,推导可恢复性阈值与精确锁定证明,实验省28-30%调用并提升准确率。
去噪曲面:面向扩散大语言模型服务的推理成本建模与预测
提出去噪工作负载曲面(DWS)建模dLLM二维执行结构,轻量预测器精准估计推理成本,降低端到端延迟。
大语言模型分词中的计数与最小成本编码
提出CNF-MCE分词与编码,较BPE提升压缩和token效率,下游性能相当。
面向视频生成中动态主体集合的主体一致性
提出动态主体集合一致性评估框架DynSC-Eval,并用其奖励后训练提升长视频生成主体一致性。
IrekoGPT:将结构化剪枝转化为事后可伸缩大语言模型
提出事后方法,将预训练LLM转为推理时宽度可调的可伸缩模型,多层校准加岭回归校正,高压缩下增益最大。
基于转录孟加拉语文本的开放词汇词语识别
手写孟加拉语词语识别,自建9841图像集,融合目标检测与改进NMS,F1达92.61%,词级识别率96.12%。
每个批次即其自身的验证集:面向大语言模型微调在线数据选择的留一梯度匹配
留一梯度匹配消除协方差惩罚,按梯度信噪比加权选批,无需验证集,微调效果优于全批训练。
My FAULT:自诊断作为自演化智能体强化学习中的信用分配
提出FAULT,以自诊断将终端奖励重分配为步级信用,解决长时程智能体强化学习信用分配难题。
超越最终准确率:审计大语言模型多智能体系统中的通信
ICR框架审计LLM多智能体通信,揭示相似准确率掩盖不同修订行为,消息与接收策略共同影响选择性修正。
给更新打分,而非给词元打分:面向组合式LoRA专家的下降对齐路由
VANE让路由器为专家更新打分而非词元,按下降方向对齐组合LoRA专家,以更少参数超越十二种基线。
AGO AI 质量门禁:面向检索增强生成的证据优先发布决策
AGO证据优先门禁以四状态决策与评审元评估把关RAG发布,回归时不安全上线降至22.2%–35.1%。
网络世界模型:复杂系统算法设计的环境
提出动作条件网络世界模型,快速预测干预结果,辅助算法设计;138/141设置超越基线,最高加速14.5倍。
为故障付费,而非为流程付费:无标签的流内多智能体工作流优化
提出无标签流内多智能体工作流优化法InFlowOp,统一代价权衡智能体能力与开销,发布Braid基准,最高提升11.97%。
FutureWorlds:从多种未来中学习机器人世界模型
提出从多种未来学习机器人世界模型的框架,利用记忆条件搜索引导策略优化,显著提升长时预测与运动一致性。
一池多靶:一个守恒层与档案数据所能识别的内容
提出可微RISC池守恒层;审计存档脱靶数据发现,耦合预测增益不足,竞争参数难识别。
BanglaDial-Abuse:一个用于辱骂性孟加拉语文本地域方言识别的基于语料库数据集
发布1000句平衡数据,涵盖标准孟加拉语及吉大港、锡尔赫特、巴里萨尔方言,用于辱骂文本四类方言识别。
克服逻辑门网络扩展中的核冗余
提出动态逻辑核框架,缓解逻辑门网络宽度扩展中的核冗余,提升核利用与多样性,以更高参数效率提高准确率。
时间分辨的标记归因揭示扩散语言模型的生成动态
提出DLIG,将积分梯度扩展至扩散语言模型任意层与去噪步,实现token归因并揭示生成动态。
YouRA:面向证据可追溯自主研究智能体的持久状态架构
YouRA以验证状态架构、独立控制器与反思机制持久追踪研究状态和失败证据,实现证据可追溯,优于基线。
Ego2Act:评估第一人称视频生成中的目标导向操作
Ego2Act基准含2,640个第一人称目标导向操作视频,评测多步任务模拟;模型常跳步,物理动态预测不佳。
SGD方法的精确信息核算
SGD精确信息核算:预条件步为高斯后验均值更新,遗憾分解为内在时间成本与比较器信息变化。
MVDG:面向无约束真实世界图像的高效多视图3D消歧
MVDG基于VGGT实现多视图联合消歧,单次推理替代成对比较,提升SfM精度与速度。
HeadEdit:通过冻结的解嵌入矩阵校准语言模型行为
HeadEdit免梯度,借助冻结解嵌入矩阵的低秩行为子空间,按提示坐标生成词表级校正,提升多任务且开销低
ASCRIBE:基于原子事实与临床重要性的泰语SOAP病历生成推理框架
ASCRIBE按临床重要性对原子事实分级再摘要,并发布首个泰语临床基准,提升SOAP病历生成的完整性与忠实度。
Gumbel 直线流:将自回归模型蒸馏为一步流映射
提出 GSF,利用预训练自回归模型的噪声-数据耦合构建线性路径,经流映射半群目标蒸馏为一步生成,性能优于基线。
HierGF:基于几何感知消息传递的分层高斯场用于稀疏视图三维重建
提出分层高斯场HierGF,用几何感知消息传递生成伪监督,提升稀疏视图重建一致性并补全欠采样区域。
面向自动视频标注的ASH:零样本开放词汇多目标跟踪与分割
提出GPT虚拟提示批处理与ASH分块匹配,实现零样本开放词汇长视频多目标跟踪分割,显存低于25GB。
用于视频表示中规范高斯构建的仿射对齐图集
提出仿射对齐图集规范高斯表示,以逐帧仿射变换吸收全局运动,减少错位,可低成本集成并提升大运动视频重建质量。
玛德琳:从模拟人生中学习对话记忆的非自主回忆
通过模拟人生生成线索—触发对,训练查询编码器学习记忆关联,无需LLM调用即可精准回忆。
外部控制框架退火:学习以更少外部控制行动
HAT结合显式控制监督与逐步弱化外部控制框架的课程,使智能体内化控制,撤除支持后仍保持表现。
HHR:面向高效大语言模型生成的分层哈希检索
提出分层哈希检索HHR,以几何感知路由与学习哈希投影对齐汉明距离与注意力相关性,提升长文本推理效率与精度。
PhysicsLENS:诊断视频生成模型中的物理属性盲区
提出基准PhysicsLENS,用配对场景评测视频模型,发现其常忽视任务所述物理属性。
AbsorbEvo:微波吸收器自主逆向设计的智能体框架
AbsorbEvo智能体框架将自然语言性能目标转化为经全波仿真验证的微波吸收器设计,测试成功率79.17%,远超通用智能体与随机搜索。
解析混合单光子激光雷达回波以重建前景视图与隐藏场景
状态感知框架从遮挡单光子直方图重建前景与隐藏场景,并发布真实配对数据集,提升隐藏深度与点云精度。
CortexBridge:面向基础模型的脑电电极布局皮层对齐
CortexBridge用电极与图谱坐标把任意脑电布局对齐到共享皮层空间,15项评测中13项提升。
运动特异性关节选择何时有效?评估与控制设计的审查
审查1,057次康复动作发现,关节选择增益随评估方式变化,需明确估计目标与结构对照,未确立新算法或临床益处。
从任务混合到专用专家
面向客户端内/间复合异质性的联邦微调,提出FedSEE,按输入路由专用专家,避免负迁移并提升性能。
评估用于降阶脑变形动力学的混合量子-经典模型
评估混合量子-经典模型预测脑变形降阶动力学;经典POD-MLP/LSTM优于量子方案,更准更稳。
审计LLM智能体环境中的动作结算:顺序、进展与重放
审计LLM智能体动作结算:保守拒绝仅完成31.25%任务,随机票据达90.28%;重放审计精确复原156个检查点并拒绝1332处构造损坏。
懂得何时留住:均匀状态扩散语言模型中的正确词元保留
均匀状态扩散模型缺乏词元保留能力;CTR-Reg损失使干净词元准确率提升26.5点,困惑度减半。
骨架与策略提示:面向视觉语言模型的免训练否定理解
提出免训练方法SSP:抽取问题骨架、检索同类问题归纳否定策略,无需更新参数即提升VLM否定VQA表现。
ReSolve:通过选择性生成式审核复用候选推理
ReSolve免训练,以选择性生成式审核复用候选推理,竞赛数学准确率超投票且更省token。
将大语言模型锚定于DSGE模拟器:面向政策生成与预测
以PPO/GRPO检验LLM在DSGE中的政策行动是否符合经济动态,以模拟后果而非语言合理性评判。
FlashBack:在流式视觉语言模型中知晓何时该记忆
FlashBack:免训练框架,先判断查询是否需要历史,再按需检索长期记忆,兼顾实时感知与长时记忆。
泛化是稳定性,而非准确性:大语言模型的多轴评估
提出SAGO多轴评估LLM泛化稳定性,发现模型普遍不稳定、各行为轴独立,跨数据集排名会逆转。
Beyond Affine Transformations: A Soft Dominance Layer for Coordinate-Wise Neural Computation
科学乌托邦?学术研究生态系统的闭环大模型模拟
提出闭环LLM模拟框架SciUtopia,发现重投稿加剧评审负担,谨慎探索兼顾影响与多样性,资源不平等无需累积优势即可涌现。
用于学习重尾测度间映射的注意力核
重尾测度下softmax注意力积分发散;改用慢增长注意力核可避免后归一化Transformer集成崩溃。
面向智能体强化学习的依赖感知奖励塑形
DARS将任务进度表示为带前置依赖的谓词,按依赖图分配步级信用,经衰减与修复机制提升训练效果。
iSEE:通过自监督实现客体永久性
iSEE 无需任何标注,借证据建模、外观—位置分离与重现线索,实现遮挡下的客体永久性追踪。