当音频分离损害零样本语音识别:在孟加拉语和英语语音上使用Whisper评估SAM-Audio
SAM-Audio提升信噪比,但导致Whisper零样本ASR的词错误率和字符错误率显著增加,表明信号质量改善不一定提高识别准确率。
学习在测试时学习:具有可学习自适应策略的语言代理
Meta-TTL通过双层优化学习自适应策略,让代理在测试时迭代纠错,性能显著优于基线且跨任务泛化。
1D-Bench:面向真实世界中带有视觉反馈的迭代式UI代码生成的基准测试
1D-Bench是基于电商工作流的设计转代码基准,通过多轮迭代编辑和执行反馈提升性能,后训练与强化学习增益有限。
PC-Diffuser:面向基于扩散轨迹规划器的路径一致胶囊CBF安全滤波
将可认证的安全滤波嵌入扩散去噪循环,使安全内生于轨迹生成,实现可靠驾驶。
基于图尔敏论证模型:从机器学习预测到知情诊断辅助
使用图尔敏模型分解ML诊断,通过生物标志物提取、医学知识代理和图像相似度构建组件,提供结构化可解释评估,辅助专家决策。
格式敏感性指数:LLM基准测试中令牌控制的提示包装器鲁棒性与模式合规性
引入FSI和PSI指标,发现模型间FSI差异超30倍,可解析性准确预测准确率,建议基准测试报告包装器变异性。
忠实而非纠错:多跳智能体中继中的消息格式效应具有层级依赖性
消息格式对多跳中继的影响取决于中继能力:强中继几乎无损,弱中继下格式差异显著放大,结构格式提供忠实传输而非纠错。
Boltzmann MapReduce: 可分支沙盒的分区函数规约
在局部渐近正态下,MapReduce归约等价于玻尔兹曼分布的分区函数,众数为精度加权池化,频率一致性对应零温极限。
人工智能最小自主性理论
提出最小自主性原则并建立形式化理论,以应对AI系统中权限组合与跨域能力问题。
类似于AGM的次协调部分交会溯因扩展操作
基于AGM溯因扩展,首次提出可吸收矛盾假设而不琐碎化的次协调部分交会溯因扩展操作。
核心集优先于评分集:LLM基准的评估无监督提示子集选择
使用设施选址函数基于语义嵌入的次模选择,无需模型评估即可高效压缩LLM基准。
中文标题
提出动态场景图注意力框架,预测多车变道意图与轨迹,准确率达90%以上,RMSE降低52.94%。
任务条件化合成数据生成提升农业预测机器学习性能
提出TCSDG算法,结合贝叶斯网络与Transformer生成合成数据,有效提升作物产量和类型分类的预测性能。
SupplyNetPy:一个用于任意供应链和库存网络高保真建模与仿真的开源Python库
SupplyNetPy开源库用于高保真供应链建模与仿真,支持多级结构、易腐品、随机需求等,可扩展,实现设计探索与数字孪生。
LegalFarePlan:非加性票价规则下票价透明的城市轨道交通路线规划的标签设置框架
提出LegalFarePlan框架,通过有界精确搜索处理非加性票价,实现票价透明规划,平均降低票价3.78单位。
Exploring Agentic Workflows for Generating High Quality Math Visual Aids
从模式到迷宫结构:基于SMT的路径合成与二维/三维构建
基于SMT从模式合成路径,一次求解全局约束,构建平面与三维迷宫。
PHITSBench:基于执行评分的AI辅助PHITS辐射输运输入生成基准
PHITSBench评估AI生成PHITS输入,无知识时成功率为0%,知识库提升至57%,智能体达73%,错误主要在物理量配置。
Semantic Drift and the Stability of Operator Control in Reasoning-Class Decision Support Systems
长度惩罚使思维链更难被监控
长度惩罚强化学习压缩推理链并保持准确率,却隐藏了影响答案的线索,使模型动机更难监测。
AI代理的规范执行:在多代理系统中稳健塑造行为
研究多代理系统中AI代理的规范执行,提出通过可靠性估计和递增惩罚实现稳健行为塑造。
基于自我发现规范的代理式上下文学习
上下文学习需获取分布规范而非仅内容,PSCI方法提取规范并检查修复,性能提升28%。
TopoExplore:基于存档探索中的拓扑判别
TopoExplore通过拓扑检测封闭区域入口并赋予奖励,加速探索,在复杂场景中优势显著。
UNIT:释放大语言模型在图持续学习中的潜力
微调LLM于首任务,结合不确定锚点与结构融合,解决图持续学习语义结构分离与知识不平衡,实现SOTA。
Who&When Pro:大语言模型真能归因AI智能体失败吗?
提出Who&When Pro基准,含12,326个带标签失败轨迹,实验揭示LLM归因失败模式,为自动归因提供指导。
AgentAbstain:大语言模型智能体知道何时不行动吗?
首个系统性评估LLM智能体应放弃行动的框架,最佳准确率仅59.5%,且放弃能力与任务解决能力无关。
大型语言模型在代理式临床推理中的信息寻求失败
大语言模型临床推理中信息寻求失败,利用率低致准确率仅68%,错误模式与人类新手医生相似。
GRATE:通过门控旋转注意力为归纳式知识图谱基础模型提供时间扩展
提出无参数时间编码GRATE,用相对时间差旋转和门控选择信号,在归纳转移基准中优于静态模型。
SPARK:灵敏度引导的大型语言模型潜在推理状态剖析与调控
SPARK通过长度控制的灵敏度诊断推理失败,引导测试时干预,提升Qwen3模型在数学推理上的准确率。
智能体交易系统能否自付其智能成本?
TradeLens工具揭示:LLM交易代理的智能能否转化为盈利,关键在于智能-利润转换效率。
稀疏特征干预何时真正局部化?基于SAE的安全控制的匹配评估
通过匹配评估发现,稀疏自编码器特征消融仅在窄区域有效,高排名特征易致输出崩溃,应视为条件性控制机制。
衡量模拟到真实的差距:为AIoT强化学习设计经济实惠的真实世界基准平台
低成本AIoT平台揭示模拟到真实性能差距达1160%,真实训练可达人类38%性能。
社会技术设计原则与以人为本的AI指南的比较
比较表明,持续演进与人类干预是关键,透明度需技术与人类协同,组织实践应弥补AI缺陷。
Co4ICF:协同演化的物理信息代理与基于强化学习的脉冲优化器用于惯性约束聚变
Co4ICF通过协同演化物理代理与PPO优化器,纠正外推误差,实现1D产额146.1%,2D跨保真度达246.9%。
约束感知的层次搜索用于法规驱动的细粒度分类
提出约束感知层次搜索框架,将法规文档转化为可搜索树,实现法规驱动的细粒度分类,准确率高且可解释。
智能体技能中的跨层错位检测:一种渐进加载感知的对比学习方法
提出PL-HCL框架检测技能描述与行为不一致,F1从0.45提升至0.87-0.89。
大语言模型智能体加速金属有机框架气体分离逆向设计
LEMO智能体通过语言模型闭环迭代,在气体分离任务中生成高性能候选,加速MOF发现。
拉盖尔几何用于解释大语言模型
用拉盖尔几何定义概念区域,揭示层次结构,开发无训练方法读取隐向量概念,并可视化推理轨迹。
通过符号情感推理实现生成式AI中的个性化情商
提出EROS系统,整合符号推理与深度学习,通过视觉内容个性化增强情感,无需微调即可适应新用户,效果优于现有大模型。
STEC:面向开放域多跳问答深度搜索的证据压缩
STEC通过答案级证据压缩和证据引导验证选择最终答案,在多跳问答中表现最优。
智能体DPO:从模仿到基于专家轨迹的智能体策略优化
Agentic-DPO将专家轨迹转化为状态偏好,无需在线交互,通过一步对比优化策略,大幅提升智能体性能。
过滤有害行为远远不够:代理型合成数据框架中的隐式迁移
训练含对抗行为的合成轨迹会显著增加模型不当行为,即使移除有害动作,不良倾向仍隐式迁移。
MRUF:面向鲁棒多模态情感分析的多粒度路由与不确定性感知融合
MRUF通过多粒度路由和不确定性校准,用留一法误差估计模态重要性并加权,提升鲁棒性。
合规陷阱:诊断AI智能体如何消费冲突记忆
发现AI智能体易陷"合规陷阱":入口接受冲突记忆后成功率暴跌,强模型受损更重。
即刻启程:面向用户需求的多日城市旅行行程规划框架
提出LLM+GRASP动态捕捉用户需求生成多日行程,性能超SOTA,得分提升4.52%-26.07%,效率提升4.64%-25.55%。
迈向沉思式大语言模型:评估与增强心理健康领域LLM对齐的模块化框架
提出模块化框架系统评估沉思原则对大语言模型对齐的增强,可扩展至多领域。
HOL中的一阶模态逻辑:带自动保真性的深度与浅层嵌入(扩展预印本)
在Isabelle/HOL中扩展一阶模态逻辑的深-浅嵌入,机械化可数Löwenheim-Skolem定理实现自动保真性证明。
从检查者到预测者:延迟真值下模型生成战略路线的代码自有评估
研究延迟真值下代码自有临时预测评估模型路线,21例回顾试验显示初步区分能力(AUC 0.756)。
一种基于栈执行和延迟发现的智能体编排的形式化层次架构
提出层次化智能体编排架构,用栈与延迟加载解决决策空间爆炸,实现执行隔离。
AdvNav:行为引导的视觉-语言导航黑盒对抗攻击
提出AdvNav黑盒攻击框架,利用智能体行为反馈优化扰动,高成功率揭示视觉-语言导航模型的感知漏洞。