Spatula:探索按需原位界面与交互实现属性控制
提出Spatula系统,自动生成按需原位属性控制界面,支持动态图形迭代,提供直观细粒度交互,并泛化至网页与3D设计。
将大脑动力学建模为端口-哈密顿系统
将运动皮层建模为端口哈密顿系统,通过度规积积分器拟合EEG,实现临界态和锁相恢复。
基于证据引导推理提示缓解代码异味检测中的大语言模型谄媚偏误
LLM在代码异味检测中谄媚偏误严重,证据引导推理提示(EGDP)将决策翻转率降至12%,假对齐率降至21%。
Motif:发现并自动化个人网页工作流程
Motif系统通过被动观察浏览器活动,自动发现可编程的交互模式并推荐给用户,生成程序,发现模式多于用户自识且实用。
闪电般快速的匹配依赖发现:基于Desbordante
优化HyMD算法,提出采样、泛化查找与依赖表示技术,实现超40倍加速(最高170倍),支持Python双向集成。
实践者如何构建软件工程智能体?来自混合方法研究的启示
实现成本降低使瓶颈转向非编码工作,评估驱动开发成核心,面临评估不可靠、理解债务等六大挑战。
分布式科学否定:间接数据投毒如何使AI系统实现科学欺诈工业化
间接数据投毒攻击成功率达49.56%,检测率仅6%,溯源审计可完全防御,威胁科学诚信。
使用Copilot进行注释:学生代码生成规范的分类与多年分析
学生主要写“做什么”注释,程序化结构转向“如何做”,更关注验证代码而非反复修改注释。
分布式智能体系统:具身智能体间的容错协作
提出分布式智能体框架,通过容错对齐与半形式化协议,实现异构具身智能体可靠协作。
审计隐藏信息社交推理游戏中的信念条件LLM代理
构建可审计框架,发现主动信念关联好人方胜率提升(0.205→0.390),但行为信念一致性低,机制未明。
基于功能性的操作规划:文本目标与通过真实到仿真图像转换实现的仿真到现实泛化
基于视觉预测和文本目标匹配的操作规划系统,利用图像转换实现仿真到现实泛化,处理遮挡跟踪。
关键时思考:基于条件VLM推理的社交导航与强化学习策略
提出HUMA混合架构,结合RL高效性与VLM深度语义,动态切换处理社交导航,显著提升成功率并减少侵犯。
BackendForge:面向后端服务的智能体端到端代码生成基准测试
BackendForge评估LLM生成可部署后端服务的能力,GPT-5.5最终仅28.6%成功,表明模型难以完成完整后端任务。
相同故事,不同旅程:AI中介的同伴职业探索中从社会比较到意义构建
JobMate将真实职业帖转为对话AI,变被动浏览为主动对话,促进意义构建并转化社会比较为自我重构,但仍需真实同伴情感基础。
通过注意力头控制扩散变换器中的运动迁移
通过分析DiTs注意力头,区分运动与结构专用头,实现无参数更新的精确运动迁移。
VIA:面向机器人控制的视觉界面代理
VIA框架让基础模型通过浏览器3D界面零样本控制机器人,无需微调,成功率高达96.7%。
多智能体大语言模型未能相互探索
现代LLM多智能体探索失败,MACE框架通过结构化同伴选择显著提升探索与任务性能,理论表明探索价值随多样性增加。
BeatEdit:将符号音乐生成作为显式编辑
BeatEdit提出显式编辑框架,通过三种机制实现高精度符号音乐生成,推理小于100ms。
RepTran:基于搜索的Transformer模型修复方法
RepTran通过差分进化优化前馈网络权重,平均修复率74.7%,提升AI软件可靠性。
AMT-X:基于阶段结构的多轮红队测试与检查表门控评估
AMT-X框架通过阶段化多轮攻击与多角色检查表门控评估,揭示部分与完全可操作危害间达33%的成功率差距。
HandFlow:基于流匹配的全生成式4D手部重建
HandFlow采用流匹配全生成式方法,实现单目视频4D手部重建,精度、平滑性和速度均达SOTA。
DeepBias: 大型视觉语言模型中社会偏见的自适应深度探测
DeepBias采用生成-进化-探测循环,自适应深度暴露LVLM社会偏见,构建了挑战性基准。
面向Android到OpenHarmony的GUI测试迁移的实证研究
首个实证研究:现有迁移方法成功率仅15%-26%,改进后ITeM-HM提升至81%。
迈向可预测、对齐且可扩展的机器人学习
通过潜在空间推理与多阶段模态对齐,实现跨模态一致的预测动作生成,在复杂任务中优于现有模型。
中文标题:一个用于全面心脏CT分割和表型分析的统一框架:人在回路数据标注、视觉基础模型开发、多中心评估和临床验证
中文摘要:提出统一框架,集成人在回路标注与自监督预训练,构建最大心脏CT标注数据集,多中心验证优于现有工具,支持人群表型分析,已开源。
编程语言政策作为人工智能素养公平问题:一项十五国比较分析
十五国课程分析揭示编程教育缺失与“语法天花板”问题,考试驱动不公,需重构AI素养公平路径。
故障感知且可解释的测试预言预测
提出FOCAL模型,通过代码LLM预测测试结果,重点强化失败案例并给出语句级解释,显著提升未知项目的故障检测能力。
Mako:面向自主网络利用的自进化智能体操作系统
Mako是首个自进化智能体操作系统,自主网络利用全覆盖104个CTF应用,揭示能力稀缺定律。
理解AI代码助手对安全API使用的影响:一项实证研究
研究表明AI编码助手Copilot改善功能正确性,但未显著提升安全API使用,开发者安全意识不足。
BackgroundMellow:一种多模态协同框架,用于叙事驱动的丰富电影音景生成
提出主-专智能体架构和NLP模块,将文本分解为多层音频线索并精准混音,实现叙事连贯的电影级音景生成。
EO回归任务的不确定性量化:建筑物高度、树冠高度和地上生物量估计
提出高斯与分位数两种不确定性量化方法,提升遥感回归任务置信度,超越现有模型。
李代数胚上的智能体技能优化
LASKO框架用李代数胚数学结构,以微秒级筛选测试替代大模型验证,实现技能优化数量级加速。
IG-GAN: 基于内在几何的空气动力学数据生成对抗网络
提出IG-GAN,用贝塞尔曲面表示流形生成空气动力学数据,预测均方误差降低82%-97%。
使用编码代理进行主动流控制的启发式学习
提出用编码代理搜索显式控制律的启发式学习,在13个流控基准中10个超越DRL,控制器紧凑可解释。
小米机器人-U0:基于世界基础模型的统一具身合成
提出38B参数多模态自回归模型U0,统一具身合成任务,支持多视图场景生成与可控转移,SOTA性能并提升机器人成功率。
从世界行动模型到具身大脑:开放世界物理智能的路线图
提出从世界行动模型到具身大脑的路线图,解决模型碎片化,通过共享契约和闭环后训练实现自适应具身智能。
VoxENES 2026:针对大语言模型时代语音合成与转换的语音欺骗检测器泛化能力基准测试
VoxENES 2026基准测试显示,LLM时代语音合成使现有检测器性能大幅下降,最佳EER仅28.98%,多数接近随机,凸显对脆弱伪影的依赖。
StoryTeller:无需训练的长篇音频描述叙事锚定
提出StoryTeller框架,通过叙事记忆实现跨场景连贯描述,无需额外数据,显著提升叙事质量。
考虑时滞的深度强化学习在PPVC模块工厂柔性作业调度中的应用
提出时滞感知深度强化学习方法,在模块工厂调度中逼近约束规划最优解,优于所有调度规则和遗传算法。
评估面向可解释性的需求工程实践:整合戴姆勒卡车洞察的可解释RE框架提案
戴姆勒卡车案例揭示现有需求工程实践难以系统应对可解释性需求,存在概念模糊、可测试性差等挑战。
基于LoRA的级联多模态融合在医疗培训环境中的动作识别
级联LoRA多模态融合框架分阶段整合模态,参数高效,在医疗培训数据上优于单模态,性能接近基线。
Transformer引导的群体智能实现节俭神经架构搜索
提出融合Transformer和蜂群算法的节俭NAS,消费级GPU上3小时搜索CIFAR-10达84.85%精度(17.4万参数),并有效应用于欺诈检测。
基于证据的视频问答
提出E-VQA任务,要求输出答案与时空证据,构建基准与数据集,微调模型显著提升。
ARCANA:面向ARC-AGI-2推理的反思式多智能体程序合成框架
ARCANA通过感知、假设、执行和反思的迭代协作,提升ARC-AGI-2抽象推理效率与质量。
通过格遍历的多层感知机区间认证
通过格遍历将对抗鲁棒性转化为区间认证,区分声音与完全认证,并揭示优化不对称性。
CogniConsole:将推理时控制外化为形式化抽象以实现可靠LLM交互
CogniConsole将推理时控制外化为结构化接口,实验证明控制不足是失败主因,而非模型能力。
GATS:基于图增强的树搜索与分层世界模型的高效智能体规划
GATS通过图增强树搜索与分层世界模型,零LLM调用实现100%规划成功率,远超LATS和ReAct。
长时终端基准:用密集奖励评分测试智能体在长时终端任务上的极限
提出含46个长时任务的终端基准,分解细粒度子任务实现密集奖励。评估15模型,最强通过率仅15.2%,揭示巨大提升空间。
Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents
多模态强化学习中的奖励欺骗
多模态奖励欺骗严重,代理奖励提升时新增失败率超48%,规模增大仅部分缓解,需可靠验证的奖励设计。