HiMoE-VLA:面向通用视觉-语言-动作策略的分层混合专家模型
HiMoE-VLA用分层混合专家模块处理异构数据,将负迁移转为正迁移,在多项任务上取得领先性能。
LHM-Humanoid: 杂乱场景中连续物体运输的长周期人体运动控制
提出双控制器与对抗性先验,实现无重置连续抓取-搬运-放置,成功率显著优于现有方法。
我们真的能学习一个表示来优化所有奖励吗?
提出FB改进变体,收敛误差小10^5倍,零样本性能提升24%。
ButterflyMoE:通过结构化蝴蝶轨道实现压缩可扩展的三值专家
ButterflyMoE用共享三值原型加旋转实现专家多样化,8专家压缩80倍,256专家压缩150倍,内存效率远超基线。
基于LLM信息辅助的模型规划与提示选择在部分已知环境中的物体搜索
提出LLM辅助模型规划与提示选择方法,结合概率估计与成本优化,实现高效物体搜索,实验提升显著。
从节拍到泄露:攻击性AI如何从播放列表推断敏感用户信息
开发musicPIIrate工具,利用深度学习从播放列表高精度推断用户隐私,提出JamShield防御框架降低10%推理F1分数。
基于逐层参数调优的最优FALQON量子近似优化方法
提出Optimal FALQON,优化每层时间步长与缩放因子,显著提升成功概率和效率,并为QAOA提供更优初始参数。
CogAdapt:适配临床心电图基础模型用于可穿戴认知负荷评估
提出CogAdapt框架,通过LeadBridge适配器与ProFine微调,将临床心电图模型用于可穿戴认知负荷评估,F1提升11-16个百分点。
结构化信念状态与首个精度感知的LLM记忆检索基准
现有记忆基准只评估答案质量,忽略检索精度;新基准与结构化代理揭示并解决精度漏洞。
Polycepta:面向多目标跟踪的以对象为中心的外观估计
Polycepta将外观估计转为递归问题,持续更新对象表征,减少身份切换,KITTI上达92.27% MOTA,速度90.57Hz。
超越可教:智能视觉生成的知识边界演化
构建新基准揭示生成器知识瓶颈,提出“先教后搜”协同训练,实现知识边界可发现与递归改进。
Wan-Streamer v0.2:更高分辨率,相同延迟
Wan-Streamer v0.2提升交互流至640x368分辨率,保持约200ms延迟,采用单GPU思考者与多GPU执行者架构,总延迟约550ms。
RoboDojo:用于全面评估通用机器人操作策略的统一仿真与真实世界基准
RoboDojo是统一仿真与真实世界的基准,含42个仿真和18个真实任务,评估泛化、记忆、精度、长时程和开放指令,支持可扩展及可重复评估。
Prompt-to-Paper: 面向生物信息学的智能体AI系统
提出多智能体框架,通过确定性检索、真实实验执行和质量评分循环,生成可验证的AI手稿,成本约0.31美元/篇。
叙事世界模型:基于叙事学的长篇小说作者记忆系统
提出叙事世界模型,利用叙事学时序图与混合检索,在多跳叙事问答上大幅超越现有方法。
使用大语言模型生成合成消费者洞察
LLM生成合成消费者数据与人类主题重叠,但风格和多样性有差异,并提出应用建议。
CSTutorBench:评估小型语言模型作为积木式编程导师的基准
提出针对积木式编程教学的小型语言模型评估基准,发现模型在深度教学行为上不足,提示工程可提升效果。
从图到梯度:物理启发的网络物理物联网系统结构归因方法
提出基于统计力学的能量框架,无需因果图即可实现依赖感知归因,在工业物联网中准确性和鲁棒性优于现有方法。
面向自动CAD生成的基础模型研究
提出LLMForge框架与两种批评机制,评估7个模型,最高性能达0.89,VLM批评实现100%水密网格。
Akashic:基于MemAttention的低开销LLM推理服务
Akashic将上下文分块并建模语义关系,减少历史重放开销,提升准确率10.2点及吞吐量1.21倍。
FirstResearch: 面向LLM科学发现代理的可审计问题形成框架
FirstResearch以结构化研究问题证书为核心,通过显式推导约束提升LLM科学问题的可审计性。
ArtisanCAD: 基于专家知识蒸馏的工业级CAD代理
提出CAD-IR可执行表示,通过专家知识蒸馏与检索,将模糊提示转化为完整CAD操作,大幅提升生成质量。
SearchEyes:通过搜索世界模拟迈向前沿多模态深度搜索智能
SearchEyes用知识图谱模拟搜索世界,以PKC和HaPO实现多模态多跳推理,27B模型平均提升6.2分。
使用标题特定激活引导控制工具调用
通过锚定位置提取引导向量,可双向控制LLM工具调用,抑制不必要使用,但几何结构非线性且工具特征重叠低。
从被动检索到主动记忆导航:学习将记忆用作结构化行动空间
提出NapMem框架,将长期记忆作为结构化行动空间,通过记忆金字塔和强化学习使智能体主动导航记忆粒度,提升对话个性化。
Onnes:基于物理的多智能体LLM模拟器,用于量子计算基础设施中的低温故障诊断
Onnes是稀释制冷机数字孪生系统,驱动多智能体LLM实现低温故障诊断,零样本分类准确率经少量示例提升至0.990,实硬件假阳性率6.4%。
StateFuse:多智能体系统的确定性冲突保持记忆
StateFuse是一种保留冲突的复制内存合约,支持安全弃权与可审计纠正,但非通用精度提升。
PolyWorkBench:多语言长时程LLM智能体基准测试
提出多语言工作流基准PolyWorkBench,评估显示LLM智能体在多语言环境下性能显著下降,需联合建模语言与决策。
展示TOFFEE:一个可学习的大规模数据智能体轨迹合成系统
TOFFEE利用蒙特卡洛树搜索合成高质量数据智能体轨迹,支持微调和上下文学习,适用于复杂异构环境。
整合知识图谱与多语种学术语料库以构建社会科学与人文学科领域自适应大语言模型
欧洲项目适配大模型至SSH,多维度评估探索合规领域敏感生成式AI,保障可靠性与认知责任。
动态多车辆路径规划的奖励密度启发式方法:性能与计算效率
提出效率启发式,计算成本极低,解质量媲美元启发式算法,适合在线动态路径规划。
预测市场中,先知何时能盈利?
提出proper投注策略,建立预测准确性与利润的等价性,该策略可靠转化准确率为利润,月回报率达80%。
A toy framework for single and multi-agent human-AI curiosity ecosystems
基于信息增益的展开策略优化:面向多轮LLM代理的自适应树结构展开方法
IGRPO通过信息增益指导展开预算分配,自适应树结构探索,导出教师分布优化策略,显著提升多轮LLM代理在长程搜索任务中的性能。
世界模型的定义与路线图
本文定义了世界模型,探讨关键技术,并规划了开发有效世界模型的分阶段路线图。
TopoBrick:面向零样本建筑物联网预测的外生变量自主拓扑采样
TopoBrick利用知识图谱与智能拓扑采样,无需训练即可实现零样本建筑IoT预测,性能优于强基线。
误入歧途:在端到端自动驾驶模型中利用可解释性
通过无监督字典学习揭示驾驶决策逻辑,实现概念级干预纠正错误,提升性能。
ExplAIner: 一种用于解释分类模型的声明式查询语言
ExplAIner语言统一表达多种模型解释,评价问题属于布尔层次,优化计算仅需多项式次SAT调用。
Danus:基于事实图谱记忆的数学推理智能体编排系统
Danus以事实图谱协调多智能体并行证明,主代理规划总结,支持人机交互,构建长数学证明。
在细节中发现幽门螺杆菌:基于证据链接的多智能体胃活检报告病例发现
nMAS系统高效提取胃活检报告Hp证据,准确率98.61%,大幅节省人工审查时间。
存续权限:面向编程代理的可撤销资源与效果能力
PORTICO监控器通过可撤销能力解决编程代理权限残留,实验证明完全阻止违禁操作且不影响任务成功。
FreqDepthKV:频率引导的深度共享实现长上下文LLM推理中鲁棒的KV缓存压缩
FreqDepthKV通过频率引导深度共享和在线探针分配,在长上下文推理中实现3.9倍KV缓存压缩,保持精度并提升吞吐量。
DepthWeave-KV:面向长上下文KV缓存压缩的令牌自适应跨层残差分解
提出DepthWeave-KV,通过跨层残差分解与令牌自适应路由,在长上下文推理中实现8.3倍KV缓存压缩,保持近全缓存任务质量。
大型癌症助手(LCA):一种模型无关的可扩展肿瘤临床决策支持编排框架
提出模型无关编排框架LCA,解耦数据与AI推理,验证低开销与高容错性。
从文化遗产保护视角重新审视印度AI
从文化遗产视角审视印度AI,综述NLP演进与语言挑战,提出“文化感知”研究方向以构建包容性模型。
KVpop -- 基于预测性在线剪枝的键值缓存压缩
KVpop用未来注意力监督驱逐策略,75%压缩率下保持98%性能,高效降低内存。
人工智能研究中的催化剂论文:2017-2025年ICLR全景分析
分析ICLR 2017-2025的36113篇论文,采用EDM识别催化剂论文,发现评审分数与论文的颠覆性无关。
阿拉伯大学英语课堂中的AI工具:回顾与展望
AI工具在阿拉伯大学英语课堂中受学生欢迎,但对高阶写作和口语提升有限,需教师引导。
生成式AI技能绕过:绘制大学生与教职员工AI素养的分化路径
学生先掌握高阶创造任务后学基础概念,与教职员工线性路径相反,导致脆弱的AI流畅感。
你的NPU准备好运行大语言模型了吗?剖析移动端大模型推理中隐藏的效率瓶颈
NPU擅长预填充但解码弱,框架放大性能差距达10倍,调度浪费40%能源,优化可降耗54.8%。