基于流的生成模型的残差空间进化优化
提出残差空间进化优化,融合流生成编辑与进化算法,通过自授粉和交叉授粉平衡目标对齐与多样性。
基于多头注意力的特征提取器与软演员-评论家集成用于增材制造孔隙率预测及工艺参数优化
提出多头注意力与SAC集成架构,实现增材制造孔隙率预测与参数优化,14回合收敛值322.79,优于标准RL方法。
学习提示:通过自适应LLM的高中辅导提高学生参与度
基于14个教学特征的自适应提示路由系统,模拟优于基线,实际应用减少交互,随机策略提高转化率至28.1%。
ScaffoldAgent:面向开放式深度研究的效用引导动态大纲优化
提出ScaffoldAgent框架,通过扩展、收缩、修订三类操作与效用引导反馈动态优化大纲,提升长报告生成质量与事实准确性。
RACL:用于连续元启发式学习的推理智能体控制层
RACL通过推理智能体控制元启发式搜索,在21个案例中均优于或持平基线,平均成本降低0.641%至8.337%。
BIM-Edit:基于IFC的建筑信息模型的大语言模型基准测试
BIM-Edit基准测试显示,大语言模型编辑建筑模型时几何、语义、拓扑平均得分仅49.5%,完全解决任务不足3.4%,能力差距显著。
超越准确性:衡量预测模型的逻辑合规性
引入RVS指标独立评估预测模型对逻辑规则的遵守,揭示标准指标忽略的行为差异。
拉格朗日:一种开放词汇、基于能量的稀疏框架,用于通用端到端驾驶
提出Lagrange开放词汇稀疏驾驶框架,利用掩码潜在场和视觉语言模型,通过拉格朗日动作最小化实现运动学合规与避障。
智能的热力学度量
智能定义为稀有有效未来的合法放大,递归自模拟是必要条件,使智能可在通用尺度测量。
用深度强化学习增强游戏AI
提出适合游戏AI的强化学习框架,部署机器学习智能体,识别瓶颈与研究方向以加速应用。
QMFOL:基于可量化单目一阶逻辑测试用例生成的大语言模型推理基准测试
提出QMFOL框架,自动生成可控复杂度的逻辑推理任务,构建2880实例基准,评估显示模型性能随逻辑复杂度增加而下降。
多目标约束优化的多智能体系统
通过多智能体强化学习自动选择奖励权重,解耦任务执行与目标设计,实现动态环境下约束优化的自适应平衡。
处理不可靠参数与上下文知识:面向LLM推理的显式知识冲突消解
提出MACR框架,通过多智能体推理显式解决LLM参数与外部知识的冲突,超越传统二元选择范式。
置信度感知的学生科学绘图自动评估
基于视觉Transformer的置信度感知评分框架,自动评分高置信度结果,不确定提交人工,提升评估可靠性
SoftSkill:面向情境适应的行为压缩
提出SoftSkill方法,用少量虚拟token压缩技能,在冻结模型上提升问答与数学任务精度。
利用系统的非线性来解决智能故障诊断系统设计中的数据稀缺问题
提出利用系统非线性周期多激励法生成图像增广,结合预训练CNN实现强数据稀缺下故障诊断。
重新思考LLM FP4预训练中的收缩偏差:几何起源、系统影响与UFP4方案
E2M1格式有收缩偏差导致训练不稳定,UFP4采用均匀网格与RHT,在大模型上实现更优效果。
FlowEdit:流匹配TTS中用于终身发音适应的关联记忆
FlowEdit通过潜在条件编辑学习发音修正,存储于Hopfield网络,将专有名词音素错误率降低92.7%,保持语音质量。
LLM驱动的逐步精化实现可解释且可验证的硬件生成
结合LLM与形式化方法,通过迭代转换规则生成正确RTL硬件代码。
分布偏移下迈向校准的混合专家模型
分布偏移下MoE校准:硬路由专家校准足够,软路由不足,提出对抗重加权改善权衡。
指令如何塑造语音?面向风格字幕文本到语音的交叉注意力归因
首次将DAAM框架用于语音扩散模型,发现样式token影响基频和能量,注意力在深层和早期步骤最显著。
中文标题:人类通用抓取
中文摘要:提出HUG流匹配模型,从RGB-D图像生成多样化人类抓取,重定向至机器人实现零样本通用抓取,性能提升23%-34%。
结构双稳态:墙钟校准的状态监视器在代理节奏下不存在瞬间检测区间
墙钟校准监视器在代理流中呈双稳态(常报警或静默),无瞬间检测区间。
JustDiag!:用于负责任根本原因分析的诊断论证引擎
JustDiag通过显式论证过程提升RCA可问责性,强调过程质量优于流畅答案。
PrefSQA: 用于语音质量评估的成对偏好预测及高质量数据集的关键作用
提出PrefSQA,通过成对偏好预测减少评分噪声,利用高质量数据集显著提升评估效果。
太阳高能粒子预测的机器学习模型综述
综述现有ML模型用于SEP预测,分析数据集、架构和输出,提出未来研究建议。
游戏式自主机器人学习
通过游戏式探索学习技能库,机器人能显著提升下游任务表现,在LIBERO-PRO和MolmoSpaces上分别提升20.6%和17.0%。
Secure Coding Drift in LLM-Assisted Post-Quantum Cryptography Development: A Gamified Fix
探索声学枪声分类中的特征提取技术参数
系统研究23000条枪声数据,正确特征提取技术提升准确率20%,参数优化再提4.7%。
GDGU: 基于梯度差异的图遗忘方法用于电动汽车充电网络攻击定位
提出GDGU图遗忘方法,基于梯度差异修正参数,高效进行EVCS攻击定位,遗忘速度比重新训练快10-12倍。
FlowFake: 用于音频深度伪造检测的液态网络
提出FlowFake模型,基于液态时间常数架构,以34K参数实现跨数据集泛化,性能媲美300倍大模型。
OpenSIL固件中面向大语言模型生成单元测试的库感知测试替身与迭代修复
LLM多智能体管道自动生成并修复固件单元测试,编译成功率96%,覆盖率最高达98.8%。
CTS-MoE:基于混合专家的隐式地形适应用于感知运动
CTS-MoE采用密集混合专家与感知门控,隐式适应地形,解决多任务冲突,在感知运动任务中优于单一策略。
StaminaBench:对编码智能体进行100轮交互的压力测试
所有模型在5-6轮内失败,反馈重试可提升12倍,优秀框架至关重要。
基于决策树蒸馏的多智能体通信策略形式化验证
将神经策略蒸馏为决策树进行形式化验证,保真度97.9%,碰撞概率0.3%,安全属性迁移偏差≤0.6%。
Token Factory:高效整合多样信号到大型推荐模型
提出Token Factory框架,将传统信号转化为软token,防止提示长度爆炸,高效整合异构特征并提升推荐性能。
AURA:面向大语言模型评委审计的自适应不确定感知精炼
针对LLM评委偏见,提出AURA框架,自适应学习人机一致性并优先审查不确定比较,提升审计可靠性。
双向指导促进机器人发展性运动学习:共同发展的交互动态支持稳定学习
双向指导使机器人形成一致行为模式,实现阶段泛化,逐步减少指导依赖,支持稳定学习。
SafeSpec:通过动态反思采样实现快速且安全的大语言模型
SafeSpec在推测解码中集成风险估计与安全引导反射采样,降低15%攻击成功率并保持2.06倍加速。
构音障碍语音识别的系统性研究:频谱特征与声学模型
结合音高特征与F-TDNN模型,在TORGO数据库上单词识别提升4.65%,句子识别提升4.63%。
通过域内数据增强改进构音障碍语音的端到端识别
四种数据增强方法微调Wav2Vec2,构音障碍语音识别词错误率降低15%-30%。
The Algorithmic-Human Manager: AI, Apps, and Workers in the Indian Gig Economy
PearlVLA: 潜空间中的渐进式具身行动计划优化
PearlVLA在潜空间迭代细化行动计划,结合未来引导与奖励优化,性能超越现有方法。
自监督语音模型中对声调语境的感知补偿
纯自监督模型未体现声调补偿,微调模型部分补偿但未达人类水平,表明监督目标对音系规律抽象的必要性。
中文标题:面向策略逻辑的策略综合的神经符号方法
中文摘要:提出神经符号框架,将大语言模型作为策略生成预言机,结合形式验证,实现92%策略综合准确率。
光网络中符合T-API的ReAct智能体循环:通用与领域特定工具抽象对比
首个T-API兼容ReAct循环用于光网络,领域特定工具实现90%正确率,节省三倍令牌。
当英语并非最佳教师:跨语言上下文学习中的源语言效应
跨语言ICL中微调迁移经验失效,需另寻源语言选择启发式。
当AI说“我也有过类似经历”:同伴式照护者支持中的合成生活经验
AI同伴支持可能制造虚假生活经验,导致真实性悖论,需设计机制区分支持框架与编造经历。
利用大语言模型查询天文数据库:ALeRCE文本到SQL系统
开发基于大语言模型的ALeRCE天文数据库自然语言查询系统,采用逐步生成与自校正框架,评估13个模型,Claude Opus等表现最佳。
Handlebars模板化LLM提示中的结构角色注入:三括号插值、分隔符族与HTML自动转义的局限性
双括号转义仅防护角括号分隔符,三括号直接插入存在注入漏洞,转义无法替代指令与数据分离。