分层认证语义承诺:用于拜占庭鲁棒的LLM智能体协作
提出H-CSC协议,将嵌入信号转化为类型化终结结果(语义/裁决提交或中止),实现拜占庭鲁棒,实验验证有效。
AI主权:当AI成为国家权力工具时的战略竞争定性模型
本文提出AI主权定性模型,识别加速器、电力、数据等杠杆点,预测直接动能与间接非动能行动如何驱动国家间战略竞争。
大语言模型引导的删除纠正码搜索
LLM引导进化搜索发现删除纠正码构造,单删除达最优,多删除改进现有方法,但仅适用于短码。
通过隐藏表示引导与稀疏自编码器实现Whisper幻觉检测与缓解
利用稀疏自编码器潜变量引导,Whisper幻觉率从70-80%降至14-27%,接近微调方法性能。
面向任务无关持续学习的稀疏子空间到专家共享方法
SETA通过稀疏子空间分解为任务特定和共享专家,解决塑性-稳定性困境,在LLaMA-2等模型上表现优异。
TSAQA:时间序列分析问答基准
提出统一基准TSAQA,覆盖6类任务210k样本,当前最佳LLM得分仅65%,开源模型需提升。
自适应交通系统中的模型上下文协议综述
首次系统调查MCP作为自适应交通系统统一范式,提出五类分类,揭示其语义互操作与AI驱动集成能力,奠定下一代智能交通基础。
小型语言模型智能体实现高效高质量知识挖掘
Falconer框架结合LLM规划与轻量代理,成本降90%,速度提20倍以上。
CHDP:参数化动作空间强化学习的合作混合扩散策略
提出合作混合扩散策略框架,用序列更新和码本嵌入解决混合动作空间难题,基准测试成功率提升19.3%。
MACD:基于反事实数据的模型感知对比解码
提出MACD,利用模型反馈构建对象级反事实输入,结合对比解码减少视频幻觉,提升准确性。
面向视觉多智能体系统的双潜在记忆
提出L²-VMAS框架,用双潜在记忆打破智能体协作的扩展墙,准确率提升2.7-5.4%,token消耗减少21.3-44.8%。
面向短视频平台策略评估的LLM增强数字孪生
提出四模块LLM增强数字孪生架构,集成决策服务,实现闭环仿真评估平台策略。
Gradient descent at the Edge of Stability: free energy model and kinetic description of the two-layer network
模型上下文协议服务器运行时故障分类法
首个MCP服务器运行时故障实证分类法(11大类27子类73种故障),经55名开发者调查验证,覆盖广泛运行时故障。
有心无力:通过Abliteration分离代码LLM中的拒绝与能力
通过低秩权重编辑消除代码LLM对漏洞注入提示的拒绝,发现拒绝与生成能力可分离,注入率受模型参数规模限制。
人工智能能否驳倒经济理论?来自知识截止点之外的证据
AI在人类指导下可辅助发现错误,但无法独立驳斥经济理论,尚不能替代同行评审。
实践中对自主系统的人类监督:开发者使用软件代理的监督工作、挑战与启发式方法探究
对17位开发者访谈发现四种监督工作形式及挑战与启发式方法,监督兼具反应性和预防性。
VASO:面向物理AI代理的形式化可验证自进化技能
VASO用形式化验证反馈自进化机器人技能合同,无需微调模型,达97%以上合规。
基于策略条件的反事实信用用于长视野语言智能体的可验证强化学习
CVT-RL算法用反事实信用和约束提升长视野语言智能体,任务成功78.9%,黑客行为降至3.9%。
信任,但不核实:大语言模型来源评估中的认知盲点
大语言模型能识别虚假数据,但在多源综合时忽略数值有效性,只依赖方法论文本特征,导致认知盲点。
CausalPOI:基于时空图因果建模的冷启动POI签到预测
提出CausalPOI时空图因果框架,建模功能交互与反事实,显著提升冷启动POI签到预测性能。
The Role of Instructional Guidance in Generative AI-Assisted Learning: Empirical Evidence from Construction Engineering Education
选择性优势熵自适应视野GRPO:面向语言模型高效强化学习的非对称词元级折扣
SA-AH-GRPO对负优势轨迹施加熵自适应折扣,保留正优势轨迹梯度,降低训练方差,提升数学推理性能。
GOTabPFN:从特征排序到紧凑标记化——面向高维数据的表格基础模型
提出GOTabPFN,通过图引导排序与神经子单元压缩,实现高维低样本表格数据的高效紧凑预测,提升稳定性和准确性。
ADK竞技场:通过LLM即开发者评估智能体开发工具包
ADK Arena评估51个框架:生成成功率57%,成本差5.6倍;最佳解决80%任务,中位数32%;信息源可替代。
具有动作条件保证的共形风险规避决策
引入动作条件共形预测,基于pinball损失最小化算法,显著提升共形基线在决策中的动作条件性能。
表示学习实现可扩展的多任务深度强化学习
表示学习是实现多任务强化学习可扩展性的关键,MR.Q算法结合预测性表示,无需规划即超越基于世界模型的方法。
SlotGCG:利用大语言模型中的位置脆弱性进行越狱攻击
提出SlotGCG方法,通过VSS评分选择最易攻击位置,越狱成功率比GCG高14%,可插拔且仅增200ms预处理。
当表层形式改变审核决策:代码混合工作流不稳定性的配对研究
代码混合输入使审核决策翻转率达0.265,审核率与误报率显著上升,工作流评估能发现分类评估遗漏的失败。
数据流控制:面向AI代理的数据安全策略
数据流控制框架在数据库查询中声明式执行安全策略,Passant实现零开销,将数据安全融入基础设施。
面向自主航天器的TinyML驱动网络安全:SPARTA射频与网络威胁检测的延迟-精度分析
逻辑回归在航天器威胁检测中实现微秒推理,精度仅降1%,是有效的TinyML基线。
面向分布式基础设施系统的认知威胁情报与可解释联邦安全分析
提出集成联邦学习、可解释AI的认知安全分析框架,实现分布式环境协作且隐私保护的威胁检测。
时变干预下流行病时间序列反事实预测的基准测试
构建基于真实数据的流行病反事实预测基准,支持时变干预,评估因果方法凸显性能差异与挑战。
可解释人工智能驱动的美国关键基础设施智能治理中的网络风险分析与模型可靠性评估:基于XGBoost与SHAP的入侵检测框架
本研究基于CICIDS2017数据集,利用XGBoost等机器学习模型检测网络恶意活动,并集成可解释AI增强透明度,实现网络风险预测与模型可靠性评估。
GenTI:评估大模型自动生成IDPS规则以应对未知攻击的基准
提出GenTI基准,利用LLM自动生成IDPS规则,未知攻击检测率从45%提升至87.4%,假阳性率降至2.3%。
UniVoice:语音与歌声生成统一模型
UniVoice基于条件流匹配,分解内容、旋律、音色,用空旋律标记实现语音与歌声统一生成,性能优异。
密度融合的组合边界
研究密度融合顺序不变性,归一化加权线性池化是唯一可分层且顺序不变的规则,成对平衡不满足全局组合性。
通过零样本迁移学习实现机器人操作任务的高效低层运动规划
提出iCEM+TL框架,利用迁移学习和奖励重设计,将仿真成功率提升23%,并在真实机器人上验证。
TLA-Prover:通过偏好优化低秩适应实现可验证的TLA+规范综合
TLA-Prover模型在30个基准测试中达30%通过率,较基线提升3.5倍。
TOKI:面向LLM智能体持久记忆中矛盾解决的双时态算子代数
TOKI提出双时态算子代数统一冲突解决启发式,明确写时正确性契约,消除三类写时异常并保留审计溯源。
MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action
OneReason 技术报告
OneReason通过增强感知与认知,在生成式推荐中激活推理能力。
DAST:一种用于O-RAN跨接口异常检测的VLM-LLM框架
提出零样本多智能体框架DAST,通过VLM-LLM-VLM流水线检测O-RAN跨接口异常,优于传统TSAD方法。
通过多任务表示工程提升LLM生成代码的可读性
提出多任务RepE框架提升LLM代码可读性,理论分析并实验验证可读性与正确性的权衡。
利用梯度信息修正logit的离散扩散模型即插即用引导
提出GILC框架,利用预训练去噪网络高效估计引导信号,无需训练,在多项任务中达到最优。
量子增强的稀有事件发现与采样
提出无需预知稀有事件的量子算法,实现最优量子缩放,对重尾系统有二次加速,对平稳过程有多项式加速。
子空间感知稀疏自编码器:实现有效机制可解释性
针对SAE特征分裂问题,提出子空间感知SAE,用子空间解码器与块稀疏正则化,减少分裂,提升可解释性与效率。
弥合领域专业性与泛化能力以进行性能评估
FRAP融合外部基础模型与基模型,校准对齐后加权融合为参考分布,显著提升分布偏移下的性能估计效果。
LatentWave:用于无线基础模型的JEPA预训练
提出LatentWave,用JEPA在无线频谱图和信道状态信息上预训练,学习可迁移表示,优于掩码重建基线。
IDEAL:利用大语言模型的无限与动态特性实现查询聚焦摘要
提出两个模块对齐查询与长文档摘要,实验证明有效且可推广。