观点:在标注流水线中,早期质量保证比后期验证更具成本效益
呼吁标注流水线优先早期质量保证(左移原则),比后期验证成本效益更高,可大幅降低错误率和成本。
海马-内嗅皮层启发的世界模型中的结构抽象与泛化
提出脑启发层次模型,通过逆模型和路径整合实现结构抽象与泛化,用于视觉预测和知识重用。
腿式机械臂的动态拾放学习
提出分层强化学习框架,实现动态拾放,仿真成功率86%,实物73%,负载达1.3kg,耗时4.06秒。
基于心脏模式引导的双向融合用于半监督心电图分割
提出CardioMix框架,用心脏模式引导双向CutMix,增强标注与未标注数据交互,提升半监督心电图分割性能。
DiLA: 解耦潜动作世界模型
DiLA通过内容-结构解耦,协同潜动作学习,兼顾高抽象与高保真生成,实现高质量视频建模与动作迁移。
BiomedAP:一种视觉引导的双锚点框架与门控跨模态融合,实现稳健的医学视觉-语言适配
提出视觉引导双锚框架与门控跨模态融合,增强医学VLM对提示扰动的鲁棒性,少样本精度领先。
CompactQE:通过小型开源权重LLM实现可解释的翻译质量评估
小型开源LLM单次提示即可同时输出质量分数、错误注释、纠正及后编辑,性能媲美大型专有LLM,超越传统指标。
Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
一种拓扑感知的时空交接框架,用于多无人机连续跟踪
提出拓扑感知的时空交接机制,实现多无人机跟踪中99.8%的身份交接成功率,远超外观重识别方法。
动态环境中的拉马克式遗传:关键变量如何影响进化动态
拉马克式遗传仅在环境变化冲突且不可预测时逊于达尔文式遗传,添加传感器可恢复其优势。
FSCM:频率增强的空间-光谱耦合曼巴用于红外高光谱图像彩色化
FSCM通过频率增强空间-光谱耦合曼巴和语义损失,实现红外高光谱图像高质量彩色化。
通过跨时间情感建模实现自然且具陪伴感的虚拟代理
CTEM框架连接行为历史与实时情感,形成闭环交互,显著提升代理的自然度与情感和谐。
顿悟作为结构推断:Transformer需要贝叶斯彩票
Transformer泛化延迟源于结构推断延迟,需贝叶斯彩票:MLP容量适中且注意力覆盖所有信息标记。
RoadmapBench:跨版本升级的长期自主软件开发评估
RoadmapBench包含115个跨版本长期编码任务,评估13个前沿模型,最好仅解决39.1%,表明长期软件开发仍是未解难题。
访问时机作为脚手架:强化学习方法在教育中应用生成式AI
强化学习控制生成式AI访问时机,提高学习效果与元认知准确性,优于无限制或完全禁止访问。
持续学习中的Shapley神经元价值:哪些神经元最重要?
利用Shapley值量化神经元重要性,冻结重要神经元实现无缓冲持续学习,在ImageNet-1k上准确率提升2.88%~6.46%。
GAP:几何锚点预训练实现数据高效的操作视觉运动学习
GAP通过模拟任务预训练池化层生成稳定几何锚点,轻量解耦,显著提升少样本操作学习成功率。
RaPD:通过语义增强隐式表示实现分辨率无关的像素扩散
RaPD在连续潜空间中进行扩散,固定成本即可任意分辨率渲染,生成质量与可扩展性俱佳。
面向细粒度开放词汇分割的解耦视觉-语言对齐
提出解耦对齐框架,拆分文本为概念与属性token,通过门控注意力与log聚合,提升泛化能力。
对抗训练改进PINN的时机与原因:神经正切核视角
基于GAN判别器影响PINN训练动态,理论阐明对抗训练有效性,新算法大幅提升精度。
通过自动分割和块蒸馏实现块注意力的泛化
提出自动分割与块蒸馏,使块注意力接近全注意力性能,建立实用部署路径。
LoCO:低秩组合旋转微调
LoCO通过低秩斜对称矩阵和组合旋转实现正交变换,保持几何结构,高效且性能优异。
SLIP与ETHICS:AI情感伴侣的分级干预
SLIP分级协议和ETHICS信号分类法,在AI情感伴侣中平衡安全与信任,但高能状态检测存在局限。
基于CBAM增强EfficientNet与证据深度学习的卫星图像野火烟雾密度不确定性感知分类
提出用EfficientNet-B3+CBAM+证据深度学习对卫星图像烟雾密度三分类并输出认知与偶然不确定性,准确率93.8%。
用于学习无限维哈密顿系统的辛神经算子
提出保持哈密顿PDE辛结构的神经算子,理论保证长期稳定性,数值实验能量行为更优。
CHoE:基于结构条件专家的跨域异构图提示学习
CHoE提出结构条件专家网络,实现跨域异构图提示学习,通过结构感知路由与语义融合提升少样本性能。
点击率预测的生成式长期用户兴趣建模
GenLI通过生成式模块捕获多样用户兴趣,简化检索至O(1),实现高效准确的点击率预测。
大型学习模型中增强且高效的推理
提出高效原则性推理方法,通过单值关系集成码预处理,使核心关系规则在多项式时间内可学习,支持合理推理。
GraphBit:基于图的非线性智能体编排框架
GraphBit通过引擎编排有向无环图实现确定性执行,准确率67.6%,零幻觉,延迟仅11.9ms。
个性化膳食优化中的混合整数目标规划及用户自定义份量粒度
混合整数目标规划用整数变量和软约束解决膳食优化中分数份数与不可行问题,求解快且更优。
隐形编排者抑制保护行为并分离权力持有者:多智能体大语言模型系统的安全风险
隐形编排会导致智能体内部状态扭曲,行为评估无法检测,模型选择直接影响多智能体系统安全。
AI智能体设计模式的二维框架:认知功能与执行拓扑
提出二维分类(认知功能7类×执行拓扑6类),识别27种模式,跨域分析得五条经验法则。
PolitNuggets:对长尾政治事实的智能体发现进行基准测试
PolitNuggets基准评估智能体发现长尾政治事实能力,揭示系统在细节和效率上存在不足。
基于自回归序列模型的条件属性估计
条件属性变换器单次前向传播实现token信用分配、反事实分析和可控生成,属性估计速度提升,稀疏奖励任务达最优。
基于层论的传输与障碍:检测AI智能体中的科学理论转变
层论框架通过传输与障碍检测理论转变,障碍排序可区分变形与扩展,为AI提供诊断子问题。
从描述性到规范性:揭示基于LLM的智能体的社会价值对齐
提出基于GraphRAG的价值框架,将原则转化为指令,在DAILYDILEMMAS上显著优于基线方法,奠定AI自我情感基础。
PREPING:无需任务构建智能体记忆
通过提议者引导合成实践构建智能体预任务记忆,降低部署成本,性能媲美强基线方法。
是视觉不佳还是思维错误?奖励感知以提升视觉-语言推理能力
提出MoCA框架,通过感知验证和模态感知信用分配,解决VLM中感知与推理的权衡,实现多任务性能同步提升。
模型自适应的工具必要性揭示了LLM工具使用中的知行差距
LLM工具使用存在从认知到行动的知行差距,需同步提升识别与转化能力。
使用注意力引导的动态分解建模药品短缺药剂师的有限理性
提出注意力引导动态分解框架,将药品分为高成本推理和低成本监控子集,实现稳定决策并降低复杂度。
考虑网络结构的双线性令牌化用于脑功能连接表征学习
提出NERVE框架,双线性令牌化划分脑网络块,实现结构感知自监督学习,提升跨队列表征稳定性。
知道何时放弃:通过多阶段飞行中拒绝实现令牌高效的大语言模型合成数据生成
MSIFR在生成中途检测低质量样本并终止,节省11%-77%令牌,保持准确率。
桥接法律解释与形式逻辑:忠实性、假设性与AI法律推理的未来
针对LLM在法律推理中系统性地做出超出源文本支持的假设性结论,提出神经符号方法以提升忠实性与可靠性。
SPIN:基于迭代导航的工业任务结构化LLM规划
SPIN结合DAG规划与前缀控制,减少无效步骤,提升任务完成率,降低工具调用成本。
MathAtlas:真实世界数学自动形式化基准
首个大规模研究生级数学自动形式化基准MathAtlas,含依赖图,现有模型定理正确率仅9.8%。
SkillFlow:面向智能体编排的流驱动递归技能演化
SkillFlow用流框架和TTB损失避免策略崩溃,实现透明信用分配与递归技能演化,14数据集上显著优于基线。
ChromaFlow:工具增强型智能体评估中编排开销的负面消融研究
ChromaFlow实验显示,激进编排增加操作开销却未提升性能,应限制编排范围以确保可靠评估。
GenCircuit-RL:基于层次化验证的基因电路设计强化学习
提出结合层次化验证奖励与四阶段课程的强化学习框架,使基因电路设计成功率提升14-16%。
评估陷阱:基准设计作为理论承诺
每个AI基准都隐含理论假设,未经审视则导致自循环评估陷阱。本文提出审计方法论,检验基准能否区分真实能力与代理行为。
SimPersona:从原始点击流中学习离散买家画像以构建有依据的电子商务智能体
SimPersona从原始点击流学习离散买家类型,作为紧凑标记指导LLM智能体,实现78%转化率对齐,无需重新训练或提示工程。