大型语言模型是否已准备好进行科学发现?面向AI科学家能力导向的基准测试
SDABench评估LLMs科学分析能力:描述性分析表现好,但假设选择、因果推理等任务下降明显。
NextFund:代理型投资组合管理的统一性能跟踪平台
NextFund平台实时观察金融代理行为,通过交互式竞技场提升投资组合管理评估的透明度和公平性。
PREF-Gate:面向图欺诈检测的受来源约束的关系证据融合与验证门控选择
PREF-Gate通过验证门控选择标签证据,在欺诈检测中实现条件有效性与可审计决策。
当谈论LLM规划时我们在谈论什么:两种不同规划能力的证据
LLM规划表现差异源于两种独立能力:操作推理(局部动作评估)与结构枚举(目标可达性),后者对模型规模不敏感。
先编译,再分页:面向程序化LLM智能体的可执行SOP程序与能力门控运行时
编译SOP为可执行伪代码,能力门控分页,强模型性能提升,弱模型需先检查状态纪律
让规则归纳回归流体智力研究?ARC-AGI基准在人类中的初步验证
ARC-AGI基准在人类中首次验证,心理测量特性良好,与流体智力高度相关(ρ=0.63),初步支持其作为人类流体智力测量工具。
高效测试时优化的多智能体证明自动形式化
ToMap多智能体框架通过测试时优化聚焦分解器,使证明自动形式化性能提升19%,成本更低。
验证器引导的十二音作曲:用于符号音乐生成的生成-验证-修复框架
提出神经符号框架,通过生成-验证-修复循环提升十二音作曲局部一致性,交付率从13.3%升至48.1%,专家偏好显著。
AutoVSR:从电路原理图自动进行视觉到符号推理以生成符号表达式
AutoVSR利用视觉语言模型与符号求解器,自动化生成电路符号表达式,准确率提升30-59%以上。
从神经网络决策到训练案例:基于案例决策理论的精确解释
提出通过OLS分解将神经网络决策精确映射到训练案例加权支持,实现高效案例级审计。
OpsMem:带跨记忆共振的双记忆推理用于故障诊断
OpsMem双记忆框架协调诊断状态与操作经验,提升故障诊断Match和Relevant最高46.88%和18.39%。
多模态关注的潮起潮落:为基于证据的VLM推理调度视觉中继窗口
揭示VLM关注三阶段重分布,提出TRACE框架调度视觉中继窗口,增强证据推理,平均提升4.33点。
瓶颈思考:用于严谨归纳的沙漏推理
提出沙漏推理,通过阶段隔离和符号压缩传递,显著提升大模型少样本归纳推理准确率。
拉马努金AI挑战
提供数学常数公式集评估AI数学技能,含已知证明(暂加密)与未证明公式,考验AI创新能力。
V型梁热传感器的数据驱动正向与逆向建模
提出两阶段数据驱动框架:神经网络正向模型与梯度下降逆向优化,实现目标位移、最小体积与应力,预测MAPE 4.76%。
具身视觉与语言导航的综合综述及系统性真实世界评估
综述VLN方法,分类动作与模型范式,真实场景评估显示模拟与真实性能差距大,强调鲁棒性挑战。
CSI的通用语言:统一跨设备与环境的无线感知
提出将CSI视为结构化语言的基础模型框架,统一异构信号,实现跨系统感知,性能优于基线且泛化能力强。
物理信息驱动结构锚定与捕获感知原型校准的跨环境射频指纹识别
提出PISA-CAPC方法,结合物理信息与无标签校准,跨环境RF指纹识别Macro-F1达0.9257。
通过VLAC-CUT引导的流程最大化大规模机器人后训练中的人类效率
提出VLAC-CUT引导的后训练流程,通过角色分工和自动数据筛选,让少量人员监督多机器人,成功率80%-95%,吞吐量提升1.7-4.2倍。
暴力狂喜是否终成暴力结局?衡量智能体代码合并后的命运
纵向研究发现,自主代码代理合并后需更多纠错维护,引入更多安全漏洞,且维护负担与低审查率正相关。
TS-Mask VLA: 用于视觉-语言-动作模型的有效桥接的二维时空掩码
TS-Mask VLA提出桥接注意力的离散扩散动作专家和二维时空掩码,在LIBERO达95.7%成功率,CALVIN序列长度4.19。
Robo-ValueRL:离线到在线强化学习的可靠价值估计
提出可靠价值估计框架,实验证明其影响策略优化,在精密操作中达86%和84%成功率。
你训练什么就得到什么:音频深度伪造检测中的性别偏见、训练构成与事后缓解
训练数据性别构成决定模型偏见方向,事后校准无法消除性能差距,需从训练阶段解决公平性。
LLM驱动的代理推荐系统:面向联网电视内容发现
提出LLM代理推荐系统,融合非结构化信号,采用混合架构克服推理延迟,提升联网电视内容发现效果。
基于知识的多智能体安全控制推荐框架
提出知识驱动的多智能体安全决策系统,以无遗憾在线学习实现高覆盖率与低资源消耗。
量子电路视觉:面向量子代码生成的视觉AI智能体的成本感知评估
提出成本感知评估框架,发现中端模型平衡精度与成本,电路深度是失败主因,级联路由策略优化开销。
超越贝叶斯纳什:非对称信息下对抗性团队游戏中的最小最大遗憾均衡学习
提出PR-MRE均衡,在高置信度类型子集最小化最坏遗憾,提升对抗性团队博弈的分布鲁棒性。
使用手工MFCC主导声学生物标志物的自发言语无转录轻量级阿尔茨海默病检测
基于176条录音提取MFCC等手工特征,轻量SVM实现平均AUC 0.674,表明无转录声学特征可用于AD筛查。
面向消费级设备的混合CPU-GPU大语言模型推理的自动张量调度
ATSInfer通过张量粒度调度与负载感知动态传输,在消费设备上将LLM推理吞吐量提升最高3.29倍。
通过深度特征锚定的偏好优化打破流式目标说话人提取中的质量-可懂度权衡
提出深度特征锚定DPO,扩大卷积核,打破流式TSE质量-可懂度权衡,可懂度提升10.9%
部分契约足够:基于LLM推断的可靠回归验证
首次提出基于部分契约的回归验证,证明调用者充分的契约已足够,检查可靠且无假等价。
ActiveFly-Bench:面向空中具身感知的视觉-语言-动作与具身问答对齐基准
首个无人机具身感知基准,分解三层主动感知任务,揭示行为规划与视角调整挑战。
程序合成驱动的通用酉算子自动设计
AI程序合成自动发现酉矩阵分解及稀疏优化规则,实现最少MZI并维度无关推广,节省硬件资源。
世界模型作为对抗者:多智能体自博弈微调实现鲁棒运动规划
提出AWM框架,将世界模型转为对抗者,通过解耦优化实现多智能体自博弈,提升密集交通场景的鲁棒规划性能。
临时授权,持久效果:LLM智能体的提交时授权
LLM代理提交时授权失效致安全风险,CommitGuard可阻挡过期提交。
中文标题:何时限制编码代理仅用execute_code有帮助?机制×代理设计消融实验
中文摘要:限制代理仅用execute_code在多数场景更便宜,但效果取决于任务和代理设计,成本差异在缓存调整成本而非通过率。
PromptGraph: 图引导的提示清理方法,用于平衡大语言模型推理中的隐私与效用
提出图引导的提示清理方法,通过图结构建模隐私与上下文依赖,显式平衡隐私与效用。
覆盖路径规划:经典基础、近期进展与未来方向
综述覆盖路径规划经典与进展,分六类方法分析挑战与方向。
动作映射策略:通过像素分类学习3D闭环操作
把3D动作投影到相机图像平面,以像素点作为离散类别,实现高精度、多模态的快速闭环操作策略。
MDQEC-QAS:结合硬件感知VQC搜索与置信门控恢复的量子纠错元解码框架
提出元解码框架,硬件感知VQC搜索+置信门控恢复,在高挑战纠错场景下显著降低逻辑失败率。
基于确定性策略的扩展平均场控制的演员-评论家学习
提出连续时间扩展平均场控制的无模型强化学习,采用确定性策略推导策略梯度,开发深度确定性策略梯度算法,实验验证有效。
面向自动驾驶车辆的异构边缘GPU上视觉Transformer的边缘物理AI部署
提出H-FraDS调度,在异构边缘GPU高效部署视觉Transformer,实现125.93 FPS、92% F1分数,满足实时约束。
平衡即初始化:物理结构深度均衡推理中的惰性恒等坍塌
深度均衡模型推理中平衡解恒等于初始值,迭代无效,精度无改善,呈惰性恒等坍塌。
CGS:具有有界邻域损失和查询支持的可配置图摘要
CGS可配置图摘要框架,支持有界邻域损失与多查询,实现高压缩高精度。
视频大语言模型真的在“看”吗?——长视频角色追踪失败诊断
模型追踪角色依赖性别等浅层线索,未能真正区分个体,基准得分不代表真实能力。
Pix2Act: 基于图像空间的操作策略与等变增强
Pix2Act将3D控制简化为2D轨迹预测,利用等变增强提升泛化,在模拟和真实任务中超越现有方法。
MusicMark: A Robust Generative Watermarking Framework for Music Generation
MusicMark是首个生成式音乐水印框架,在扩散模型中嵌入水印,鲁棒抗攻击且保持质量。
PRISM Edit:一个向量应对所有时间性答案
提出PRISM Edit,利用模型固有调制路径优化多义表示,实现时间正确预测,性能提升超2倍。
与智能机器人长期物理共存的初步探索
提出PHILIA多机器人系统,通过统一接口解耦推理与执行,实现插件式集成,完成长期复杂服务任务。
纵向多视角乳腺癌风险预测
提出LMV-Net模型,结合纵向对齐的CC和MLO多视角,提升乳腺癌风险预测性能,优于现有方法。