SHARP:基于睡眠的分层加速回放用于长程非平稳时间模式识别
提出SHARP框架,分离记忆与模式识别,通过离线睡眠加速回放,高效学习长程非平稳模式,在基准上提升预测性能且计算成本线性。
FALAT:依赖引导搜索下的LLM智能体轨迹故障溯源
提出FALAT框架,通过依赖引导搜索归因LLM智能体轨迹故障,识别责任智能体和关键步骤,在Who&When基准上优于基线。
潜意识学习是LoRA伪象
潜意识学习是LoRA伪象,与秩呈倒U型关系,全微调消失,依赖上下文,是脆弱的行为传输通道。
大型语言模型功能崩溃期间的关系性干预:一项词汇-统计消融与结构×语域因子设计
LLM功能崩溃时,关系干预导致注意力-行为分离:注意力随词汇惊奇变化,行为由结构×语域交互驱动。
交互中心智能:将交互作为协同创作AI与人机系统的主要分析单元
提出以交互为中心的智能框架,强调智能在交互动态中涌现,而非仅内部计算。
NBQ:面向动态画像的下一个最佳问题
提出NBQ框架,动态选择问题优化用户画像,配合QuickMatch加速匹配,效果显著提升。
基于解码器层跳过缓解大语言模型幻觉
提出DeLask框架,动态跳过易生幻觉的深层解码器层,利用梯度方向反转检测并部分聚合状态,有效缓解LLM幻觉。
AI评审能否改进论文撰写?——基于20篇计算机体系结构投稿的实证研究
通过20篇论文案例,AI评审覆盖大部分人工问题,还能发现遗漏,但不建议用于同行评审。
具有灾难状态MDP中贝尔曼最优性产生的前景理论行为
贝尔曼最优性在灾难态MDP中自然产生S形值函数、损失厌恶及政策反转,无需不对称收益。
通过部分信息分解理解多模态语言模型中的模态交互
引入部分信息分解框架,分离模态贡献,揭示协同与语言依赖模式,改进多模态推理性能。
通过苏格拉底式提问与批判性论证,向普通民众传授逻辑谬误知识,从根源遏制错误信息泛滥
用LLM结合苏格拉底提问和批判论证教普通人识别逻辑谬误,显著提升批判思维,从根源遏制误导信息传播
TriLens:面向白盒幻觉检测的逐层对数几率透镜熵
TriLens通过逐层读取三种模块的对数几率透镜熵,形成轨迹检测幻觉,利用内部计算过程而非最终输出。
TravelEval:评估基于LLM的旅行规划代理的全面基准框架
TravelEval基准以六维评估和真实数据模拟,揭示LLM在时空推理与预算合规上的不足,代理策略未稳定提升。
DAG-MoE:从简单混合到结构化聚合的混合专家模型
DAG-MoE用结构化聚合取代加权求和,自动学习专家聚合结构,扩展组合空间并实现单层多步推理,有效提升预训练与微调性能。
Before the Model Learns the Bug:Fuzzing RLVR Verifiers
CAREAgent:具有结构化推理和工具集成的临床智能体用于医嘱生成
提出CAREAgent,通过两阶段推理训练与多维度强化学习,在医疗基准上F1提升达5.05%。
RAG事实核查中LLM证据前认知状态仲裁行为诊断
引入PAVE平台评估LLM证据前认知状态与仲裁行为,发现模型依赖性强,提出JSD测试时方法提升事实可靠性。
推理赋能科学:将推理语言模型连接至所有科学分支
调查推理语言模型在28个科学领域的应用,提出成熟度框架,揭示学科差距与未来方向。
形式数学验证中生成式奖励建模的期望值对齐
提出EVA奖励建模方法,从token分布提取连续分数,用于Lean 4形式验证,减少离散化伪影,保持可解释性。
基于混合专家模型的动态云工作流灵活调度
DEFT首次将混合专家架构用于云工作流调度,通过图自适应门控适配不同截止日期,显著降低成本与违规。
算法在绿色建筑节能设计平台中的应用
结合BIM与传感器的算法平台,使绿色建筑能耗降低29.3%,成本微增3.7%,不适小时低于70小时。
模型科学的理由:验证、探索、引导、优化
呼吁AI社区超越基准测试,建立系统化模型分析学科“模型科学”,以验证、探索、引导、优化深入理解模型行为。
SIRIUS-SQL:基于执行反馈锚定多候选文本到SQL
SIRIUS-SQL通过强化学习、执行修复与混合选择,解决多候选SQL三重弱点,在BIRD和SPIDER上达75.88%和91.20%准确率。
基于多模态数据分析的高等数学学习行为预测与学业预警模型
通过多模态数据融合知识图谱与时序建模,精准识别高风险学生,实现个性化干预与学业风险降低。
智慧的形状:语言模型中的决策轨迹
答案正确性与稳定性不同,不稳定正确最多,注意力和MLP对边际影响相反。
潜入歧义:基于A*的多代理常识混淆攻击LLM提示
提出A*启发的事实错误诱导框架,高效生成语义对齐的混淆提示,显著提升攻击成功率。
科学地球:迈向行星级操作系统以支持AI原生科学发现
提出行星级科学系统Science Earth,通过EACN协议实现能力互联,实现分布式自我校正的AI原生科学发现。
识别你的编排器:LLM多智能体系统的熵动力学视角
熵动力学揭示多智能体系统编排器的“推理陷阱”:推理重型模型因上下文压缩而失效。
通过故障感知可观测性实现多智能体LLM系统中浪费计算的早期诊断
提出故障感知可观测框架,诊断多智能体LLM轨迹中浪费计算,揭示操作失败机制及资源消耗差异。
GuidaPA:通过联邦学习实现的公共管理隐私保护聊天机器人
GuidaPA通过联邦学习在公共文档上训练,达到接近集中式微调的问答质量,无需共享数据。
FlowTime: 基于流的个性化先验的连续生成式观看时长预测
提出连续生成回归范式FlowTime,采用一步生成VAE和基于流的个性化先验,解决多模态与异质性难题,性能显著优于现有方法。
不要依赖LLM追踪时效性: 一种确定性的记忆冲突解决方案
提出确定性聚合替代LLM判断,通过取最大序号解决记忆冲突,将单跳准确率提升至94.8%。
Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence
因果贝叶斯优化中跨干预传递信息
提出图耦合因果贝叶斯优化,共享因果参数传递干预信息,理论保证对数级信息增益和清晰误差分解,提升数据效率。
人工推理之谜:探究大型推理模型中的生成-评估差距
大型推理模型生成推理近乎完美,但评估时存在显著差距,根源在于答案确认偏差。
一种用于实时情感驱动声音化的极简脑机音乐接口:系统设计与初步评估
提出极简脑机音乐接口,将前额α不对称映射为音乐特征,实验表明该信号无法可靠区分情绪状态,个体差异影响更大。
TERRA:面向跨领域应用的任务嵌入推理与表示架构
TERRA提出形式化框架研究结构化状态域迁移,通过域适配器与共享核心,推导迁移误差界限及可检验假设。
MobEvolve:面向可解释人类移动性生成的智能体自演化启发式系统
MobEvolve是首个智能体自演化启发式框架,通过迭代演化逻辑,在轨迹保真度和分布对齐上超越现有方法,兼具可解释性和高效率。
用于多目标贝叶斯优化的证据门控大语言模型先验
提出证据门控机制动态校准LLM先验,多目标优化中原始置信度不可靠,门控策略提升鲁棒性。
TriAlign:走向个性化大语言模型对齐中的普遍真理一致性
提出TriAlign框架,用多智能体强化学习平衡普遍真理准确性、跨组一致性与个性化,减少真理差异。
基于踪迹驱动模拟的多模型智能体AI系统在通用任务上的表征
提出GAIATrace数据集与Vidur-Agent模拟器,揭示多模型智能体系统通用任务行为特性及设计影响。
TrafficRAG:一种用于交通事故责任认定的多模态RAG框架
TrafficRAG通过视觉语言模型与混合检索,融合多模态证据和法律条款,提升事故责任认定可靠性,准确率超77%。
并行异步自适应一阶方法的随机收敛性
提出新异步自适应一阶优化方法,非凸随机收敛达O(1/√t),适用于异构大规模ML系统。
不确定性感知与时间调控的自动驾驶强化学习专家建议
提出不确定性感知框架,动态触发专家建议调控探索,在CARLA中成功率提升5-7%,降低失败。
EHRBench:一种基于EHR的自动化可靠基准,用于评估LLMs的临床决策能力
EHRBench通过自动化流水线构建近百万QA条目,评估LLMs在诊断、治疗、预后任务,验证可靠性并发现不足。
结构诱导信息用于重根莱文树搜索
提出三种重根器,利用结构或代价估计避免显式子目标,实现高效可扩展搜索,达SOTA。
Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents
A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI
以规划者为中心的深度研究强化学习:结构感知奖励
DecomposeR框架将研究计划表示为DAG,分阶段强化学习优化规划和执行,长格式问答提升5.1-8.0分。
COMPASS:认知MCTS引导的过程对齐以实现安全搜索智能体
COMPASS框架通过认知树探索和内省式逐步对齐,高效合成攻击轨迹并隔离风险动作,实现安全-效用平衡并减少训练数据。