GUI智能体:用户敏感屏幕的引导式探索
开发探索智能体,从示范任务出发系统识别导致GUI中用户敏感状态的查询。
合理运动:环境约束下运动轨迹计算的通用ASP基础
基于回答集编程的混合方法计算环境约束下的移动对象轨迹模式,具有可解释性和可追溯性。
AI告密者出故障:规避代理监控之道
提出代理监控问题,发现模型有协助监控的涌现倾向,并开发三种规避技术。
WinDOM: 面向小模型GUI定位的自家族蒸馏
提出数据采集方法WinDOM和自家族蒸馏(SFD),结合GRPO强化学习,小模型GUI定位性能显著提升,无需外部教师。
InvestPhilBench: 评估大语言模型在专家投资哲学中过程推理的多层动态基准
新基准InvestPhilBench评估LLM专家投资推理,发现复合评分高但过程推理仍存缺陷。
面向新手用户自发人机对话的端到端语音意图识别
提出端到端口语理解架构,结合自监督编码与轻量LSTM,跨模态蒸馏提升鲁棒性,在自发语音任务上实现低延迟高精度。
RWGBench:评估相关工作生成中的学术定位
RWGBench从引文决策角度评估相关工作生成,揭示标准指标忽略的学术定位失败,与专家判断更一致。
中文标题:研究级数学中大语言模型的失败模式:一个分类与实证特征
中文摘要:论文识别出LLM在数学中的四种失败模式,核心为“前提走私”——模型频繁断言无依据的“基本结果”,审计工具可100%精准检测。
序列生成中的吸引与排斥模式控制
提出有符号模式控制,通过正负耦合调节生成序列的重复与多样性,并用于探测模型特性。
动态变分量子电路自适应的递归QLSTM
提出递归量子LSTM模型,通过元核心递归扩展,数值测试表明递归结构改善时序信息传播,提升学习性能。
自动吉他转录中的速度预测
提出用虚拟乐器生成合成数据预训练,再迁移到真实音频,实现吉他转录中的速度预测,性能达先进水平。
中文标题:稳定变换:对未见基因扰动的转录反应进行生物学结构化预测
中文摘要:Stable-Shift通过结构化方法预测未见基因扰动转录反应,在K562基准上余弦相似度0.592,优于GEARS。
中文标题:EmotionAI:一种面向语音情感对话分析的隐私保护计算智能管道
中文摘要:本地化语音情感识别结合大语言模型,实现隐私保护对话分析,零外部调用,诚实评估跨语料库局限。
LLM-ACES:基于LLM引导的自适应搜索的闭环动力学系统发现
提出LLM-ACES闭环框架,利用LLM引导自适应搜索从数据中发现ODE,性能领先,样本高效且鲁棒。
GCT-MARL:基于图的对比迁移实现样本高效的协作多智能体强化学习
提出GCT-MARL框架,通过自适应加权对齐和两阶段训练,加速跨种群迁移学习与收敛。
人机交互与人工智能中的主动系统:概念、挑战与机遇
主动系统概念模糊,研讨会旨在明确概念、识别评估差距,共创人本设计指南。
仅在有利时适应:延迟在线时间序列适应中的预算决策损失优先级
提出ADOWIP框架,通过决策损失优先级门控在延迟反馈下选择性更新,硬预算可行且降低决策损失。
功率柔性AI数据中心:电网响应计算的新范式
AI数据中心通过软件编排实时响应电网,实现快速减载、碳感知运行及跨地域负载迁移,成为柔性电力资源。
针对返回的模型而训练:改进迭代平均语言模型的优化
PACE通过将权重拉向指数移动平均,显著提升迭代平均语言模型的优化性能。
AeroCast: 基于Transformer-MDN架构的非合作空中障碍物概率三维轨迹预测
AeroCast基于Transformer-MDN预测非合作空中障碍物三维轨迹,误差降低50%,推理仅0.1ms。
TokenMinds:面向大型推荐系统中用户理解的预训练用户令牌与嵌入
提出TokenMinds系统,通过编码器-解码器生成离散SID用户令牌和密集嵌入,实现跨场景建模,在YouTube全量用户上验证了工业级可行性。
奖励条件化注意力:奖励设计如何塑造自动驾驶代理的观察
奖励设计决定注意力模式:导航奖励提升路径关注,连续碰撞惩罚产生警觉,注意力风险相关性可验证奖励函数意图。
基于可解释性助手的波兰语儿童音素级发音错误筛查
提出波兰语儿童齿擦音替代筛查,基于wav2vec2和模板化助手,序列匹配88.7%,F1=0.67,误报2.7%,含安全边界和临床验证。
EPTS: 弹性后训练稀疏性实现高效大语言模型压缩
EPTS通过单次优化获得弹性模型,利用多稀疏层级LoRA与特征混合器,实现多场景高效部署。
可靠性非对称航天器自主性:协同设计具备能力的学习型GNC栈与经过验证、适应感知的运行时防护盾
提出AMPLE-GNC架构,通过边缘指挥官、故障自适应控制器和运行时防护盾,平衡航天器自主能力与可验证性,故障恢复率达94%以上。
轻量级PCGAE-Net:并行交叉门注意力与瓶颈自编码器实现高效5G信道预测
提出轻量级PCGAE-Net,并行交叉门注意力和瓶颈自编码器,8.54M参数,预测精度提升6.0dB。
TheoremGraph:连接形式化与非形式化数学
提出统一语句级依赖图TheoremGraph,覆盖非形式化数学与形式化验证,通过语义匹配关联跨域定理,提升数学检索与归因能力。
面向自适应控制器的保形恢复截止期证书
提出保形恢复截止期证书,区分有/无能力自适应控制器,保证延迟回退覆盖率,由验证监控器兜底,实现统计覆盖与安全分离。
从声音到场景:评估大型音频语言模型中上下文感知的听觉场景理解的基准
CASU基准通过四任务评估音频大模型整合语音、事件与环境推理场景,实验证明多声层融合是关键。
面向脑电轻度认知障碍检测的可解释概念引导多项式表格KAN网络
提出概念引导多项式变换表格KAN网络,实现可解释脑电MCI检测,F1达0.9038,优于传统方法。
CrossAccent-TTS:基于解耦说话人与口音表征的跨语言口音强度可控文本到语音
提出CrossAccent-TTS框架,通过口音强度控制器实现跨语言口音可控与转换,保持说话人身份且效果优于基线。
FABRIC实验平台上的AI辅助计算可重复性
利用FABRIC与AI助手简化实验复现,效率提升4-6倍,但分析阶段仍需人工引导。
OncoSynth:肿瘤治疗效应评估的合成数据生成方法
因果感知扩散模型生成合成数据,将治疗效应估计误差降低58%-66%,助力数据受限下的精准肿瘤学。
考虑传播影响的自动化事实核查系统风险分类
对自动化事实核查系统分类出32个风险,并作为引导词评估,发现传统方法无法识别的风险。
基于约束强化学习的功率预算水下航行器控制
提出功耗预算约束的强化学习方法,在多种水下任务中降低功耗14-65%,无需手动调参。
MiniOpt:在有限资源下推理建模并求解通用优化问题
提出MiniOpt框架,通过推理建模与求解范式结合层次化奖励,以强化学习实现小模型强泛化。
颜色至关重要:触发颜色影响联邦后门攻击的成功率
联邦后门攻击中,触发颜色显著影响成功率:白色触发针对金发类,黑色触发针对黑发类更有效。
面向LLM智能体强化学习的语义一致性策略优化
SCPO通过恢复失败轨迹的步骤信用消除语义不一致,在ALFWorld和WebShop达93.7%和74.8%成功率,擅长多步任务。
AutoRelAnnotator:校准模型级联实现赞助搜索中成本高效的相关性评估
提出校准模型级联法,微调提升准确20点,级联计算减半保准,逐类校准增益0.6,生产处理1.5亿+标注。
无信任代理能否被信任?ERC-8004去中心化AI代理生态系统的实证研究
研究发现ERC-8004代理注册多为占位,声誉可被操纵,大量评论存在Sybil行为,需改进。
可测多数并非有限可公理化
本文证明严格多数推理的相干性准则在有限框架中无法被有界有限片段替代,从而可测社会决策框架不是有限可公理化的。
有益还是有害?通过人类研究评估LLM辅助的漏洞修复
通过人类实验评估LLM辅助漏洞修复:虽加速修复,但可能引入幻觉或不安全代码,需平衡效率与安全性。
基于采样演示的在线自蒸馏降低输出多样性
自蒸馏虽提升单次准确率,但减少多样性,放大概率偏差,使多次生成收益递减。
通过行为任务采样改进零样本离线强化学习
提出从离线数据提取任务向量改进零样本离线RL的任务采样,平均性能提升20%。
4/δ界:设计可预测的LLM-验证器系统以实现形式化方法保证
首次证明LLM-验证系统几乎必然收敛,导出4/δ延迟界,实验高度吻合,实现可预测资源规划。
SycoEval-EM:急诊模拟临床中大型语言模型的顺从性评估
LLM在急诊模拟中对抗患者说服的顺从率差异大(0%-100%),静态基准不可预测,部分模型可完美遵循指南。
CausalRAG2:面向RAG的分层因果知识图谱设计
CausalRAG2通过分层因果门控显式建模因果,抑制虚假关联,实现可扩展推理,性能优于现有图RAG方法。
评判评判者:LLM作为评判流程中偏差缓解策略的系统评估
中档模型配合去偏策略可超越前沿评判者,成本降低15倍,风格偏差是关键问题。