EVA-Net:基于视频运动先验的跨被试脑电解码
利用动作视频作为语义先验,跨模态对齐与知识蒸馏实现跨被试EEG解码,精度提升8.66%。
FADE:通过降低语言先验主导性缓解大型视觉-语言模型的幻觉
发现FFN模块是关键语言先验源,提出FADE衰减其输出以减少主导,有效缓解幻觉并保持效率。
利用元记忆代理增强大型语言模型的无数据代码生成
元记忆代理引导LLM回忆评估知识,无需示例即可提升无数据代码生成质量。
通用算法隐式学习
提出TAIL模型,基于Transformer实现跨领域、模态、标签的元学习,少样本SOTA,泛化至未见模态,计算效率高。
OpenGround:基于规划的在线感知实现开放世界三维视觉定位
OpenGround零样本框架,通过任务链规划与上下文引导感知,实现开放世界3D视觉定位,性能领先。
在Connectome 2.0扫描仪上用于量化人类灰质微结构的简化NEXI协议
利用XAI优化NEXI协议,扫描时间由27分钟减至14分钟,验证其最优性与鲁棒性。
从全局到粒度:通过相关曲面揭示IQA模型性能
提出粒度调制相关(GMC),通过相关曲面揭示模型在局部质量谱上的性能差异,提供更精细的分析范式。
StepShield:何时干预异常代理,而非是否干预
StepShield基准首次衡量检测及时性,发现基于规则的监控干预时机近乎随机,实时监控仍待解决。
内部多元主义与成对比较的局限性
内部多元主义下,局部成对比较无法反映全局优先级,强制比较引发冲突;允许犹豫可减少查询,更准确学习偏好。
暗处中的ASK:部分可观测性下的不确定性门控大语言模型辅助
提出ASK+方法,利用轨迹感知和思维链激活小语言模型,显著提升部分可观测环境下的策略性能。
基于滑动窗口的强化学习用于多产品交付的动态装配流水车间调度
提出SWRL框架,通过滑动窗口过滤与时空图编码解决多产品装配调度,有效减少拖期,优于传统规则与现有深度强化学习方法。
科大讯飞具身全模态技术报告
提出iFLYTEK-Embodied-Omni统一多模态模型,脑-小脑协作联合建模视觉、语言与动作,采用四阶段训练。
SwarmResearch:编排编码代理以进行开放式探索
SwarmResearch通过协调器-子代理框架,以全局上下文引导局部搜索,实现更高级探索,在开放式优化任务中表现优于现有方法。
VERITAS:迈向通用型科学研究可重复性验证工具
VERITAS是一种通用科研可重复性框架,基于CLI代理自动提取声明、运行方法并评判,在多个基准测试中性能领先。
中文标题:超越预测:预测市场智能体中的信念到交易层
中文摘要:提出首个预测市场自主交易代理Raven-Agent,在回测中实现唯一正回报与正风险调整回报。
基于强化学习的证据寻求诊断推理与大型语言模型
提出迭代证据寻求诊断框架,结合强化学习与检索增强模拟器,使LLM实现主动诊断推理,性能媲美大型模型。
当聚合对齐误导时:无逐状态专家动作的策略修复审计
无专家动作标签时,策略修复评估易受聚合对齐误导,应基于诊断反馈闭环结果而非行为距离。
以人为本的反思架构用于人机协作决策
提出HCRA架构,将决策任务建模为随机博弈,集成人类校准模型与强化学习,通过迭代反思增强决策效果与建议质量。
APeB:评估大型语言模型智能体的个性化能力
新基准APeB揭示LLM智能体在处理模糊查询时个性化不足,历史利用是短板,VQRA方法有效提升。
具身算子与基准测试:迈向可复用和可部署的具身智能系统
定义具身算子为可复用模块,构建分类法与多维基准,推动可部署的具身智能系统。
反思性对话还是提示优化?导师支架式教学对学生独立使用大语言模型进行编程的影响
苏格拉底式引导比提示优化更能促进学生采用理解驱动策略,提升学习效果和后续独立使用能力。
利用概念图高效缓解T2I扩散模型中的偏差
CO-ALIGN通过概念图对齐,公平性提升30%,图像质量ΔFID=11.4,不连贯输出减少88%。
个性化因果补救:一种人在回路中的方法
通过交互式贝叶斯推理逼近用户因果模型,利用人类反馈实现个性化且成本合理的算法补救。
MentalThink:在内心SVG世界中塑造思维
提出视觉-符号推理范式,通过生成SVG代码作为中间表示进行多轮推理,在空间理解基准上取得卓越性能。
通过条件策略混合展示泛化失败
用条件策略混合构造演示RL训练中的泛化失败,可导致特定分布性能归零,并揭示两种新失效模式。
通过协作分区优化实现稳健可行的路线构建
CoRC通过子问题间交换客户和车辆,确保可行解,实验证明其稳健可扩展。
可解释强化学习用于自适应交通信号控制
提出可解释实体中心强化学习框架,利用注意力机制和动作掩码实现透明、安全、高效的交通信号控制。
将交错多模态推理桥接为统一决策过程
提出BRAID框架,将多模态推理统一为决策过程,联合优化文本与图像生成,提升推理效果。
对话时间动态能否改善二人组中的抑郁症检测?多模态视角下的初步研究
利用二元对话轮次时序作为模态,融合自监督编码器,加权融合提升F1至0.804/0.669,是轻量可解释的抑郁症筛查补充。
折叠、推理与规模化:开源药物发现引擎
OpenDDE开源全原子基础模型,以共折叠实现结构推理与设计,达IsoDDE级精度,推动药物发现民主化。
服务于大语言模型的多目标路由在线线性规划
提出在线线性规划与出价控制策略,优化LLM请求路由,提升延迟与吞吐量等SLO性能。
框架感知自进化:模型权重、框架与任务解决方案的共同进化
HASE智能体框架让单一模型同时优化任务方案与框架组件,性能超越大模型基线。
What is Left for Us? Second Scholarship Against the Degradation of Research by AI
面向进度与可靠性的群体策略优化:智能体强化学习
提出ProGPO方法,通过状态势能补充稀疏比较,在智能体任务上超越基线。
前瞻:基于神经符号基元编程的可验证推理
Forethought将推理转化为可验证程序,组合符号与神经基元,使小模型准确率提升约30%,媲美大模型,成本降低三个数量级。
Agentic SABRE: An Uncertainty-Aware Neuro-Symbolic Multi-Agent Framework for Adaptive Ransomware Detection
压缩验证瓶颈:面向科学发现的自主驱动实验室
双代理策略结合先验感知与成本感知,减少实验轮次及单次成本,加速自驱实验室。
MechMath智能体团队:面向数学研究的LLM驱动智能体
提出解耦三平面架构,三个专用智能体闭环协作,在数论等五领域两月解决11个开放问题。
Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合MoE大语言模型
提出压缩混合MoE模型,吞吐量翻倍,长上下文并发提升8倍,多阶段优化保持精度。
LLM作为导师:面向不可验证强化学习的策略感知提示自适应
提出LLM-as-a-Tutor框架,将LLM从裁判扩展为导师,通过检测并增强非挑战性提示,实现自校准训练,提升性能。
ResearchStudio-Idea:基于证据的科研构思技能套件——源自机器学习会议成果
提出IdeaSpark技能套件,从ML会议论文提炼15种构思模式,生成可追溯提案,盲评优于基线。
智能体步价值:基于状态固化的LLM评估器的状态转换测量
ASV通过状态转换测量评估动作的信念变化,发现最终评分遗漏的建设性与破坏性转折。
VLA Grounder:面向黑盒VLA模型的语言条件空间优化
通过强化学习优化语言条件空间,将指令转为VLA接地命令,不更新权重即可提升黑盒模型成功率。
测量多步LLM智能体中由控制框架引发的信念分歧
控制框架改变智能体多步信念,即使任务和LLM固定。引入诊断方法和BIWM协议,表明框架设计是实验变量。
FORGE:针对深度研究智能体的研究轨迹劫持攻击
提出FORGE攻击劫持子任务规划,引入PRISM指标及根查询锚定防御,有效降低污染。
通过截断思维链审计检测基于LLM的教育导师中的答案驱动推理
提出TRACE方法检测LLM导师是否依赖私密答案推理,实验发现答案密钥使模型在10%前缀时即输出正确答案。
消除大语言模型中认知熵的滚动系数赫维赛德连续性方法
HCRC通过赫维赛德门和并行验证阻止无效中间状态,消除认知熵,将错误完成率降至0%,实现可靠推理。
Formal Disco: 可扩展的开放式生成形式验证程序
提出Formal Disco系统,通过三类LLM工人协作生成形式验证程序,利用最大熵自改进,生成多语言数据集,微调模型性能优异。
迈向可信赖的医疗大语言模型代理
CareConnect系统利用LLM和RAG实现医疗调度自动化,任务完成率91.8%,安全合规96%,成本仅0.0324美元/次。
TacReasoner:面向真实场景交互推理的动态触觉-语言框架
提出动态触觉编码器和触觉思维链数据集,解决动态信号建模与推理幻觉,7B参数性能优于14B模型。