FLINT:从5G物理层侧信道指纹识别联邦学习架构
FLINT利用5G物理层调度信息,黑盒推断联邦学习模型架构(CNN/RNN/Transformer),F1得分达0.930。
进化算法引导的大语言模型用于物理信息神经网络设计
进化算法引导大语言模型迭代生成PINN配置,在波动方程上误差最高降95.38%,验证可行性。
MemoGuard:面向通信受限机器人导航中记忆陷阱的自适应运行时防护
MemoGuard通过契约验证避免记忆陷阱,降低电池安全违规76.6%,减少回退推理开销。
以5赫兹思考,以20赫兹行动:面向闭环驾驶的异步快-慢视觉-语言-动作推理
快慢架构实现异步推理,每50ms生成新控制,路线完成率从37%升至94%,红绿灯违规降三分之一。
IMBench:直观机器人操作基准
新基准IMBench评估机器人直觉操作,发现现有模型难以整合推理与执行。
面向多事件长视频理解的模块化动态粒度视频大语言模型
提出MoD-VLLM框架,通过正负分段定位与动态粒度反射迭代自反思,显著提升长视频多事件理解性能。
朝向视觉皮层与扩散模型中推理的机制性理解
提出V1感知推理的扩散模型等价体,揭示循环动力学与层次表示,桥接神经科学与机器学习。
RTL-Sequencer:基于序列范式的可扩展RTL时序预测
提出RTL-Sequencer序列范式,线性化逻辑锥结合序列模型,显著提升RTL时序预测可扩展性。
感知通用人工智能:可信度是维度完整性而非能力
提出AI可信度源于维度完整性而非能力,由时间、真理、熵、爱四种行为姿态决定。
中文标题:何时不应自动化:AI优化组织中人类保留的正式协议
中文摘要:提出PHP-AIO协议量化四种系统风险,实现角色级可审计决策,避免标准成本收益分析导致的盲目自动化。
多智能体系统何时有帮助?信息瓶颈视角
多智能体系统在有限中继下通过压缩冗余上下文提升效率,但可能损失信息;模型越弱,优势越明显。
基于大语言模型的代理式人工智能在5G/6G网络中的应用:关于架构、协议和标准化的教程与综述
大模型代理式AI实现5G/6G自主控制,教程系统阐述架构映射、协议集成与标准化挑战。
面向图数据概率推理的神经符号方法
提出融合GNN与RBN的神经符号框架,通过MAP推理实现节点分类优化与多目标决策。
一种面向AI生命周期治理的可审计可信度水平方法论
提出轻量级AI治理可信度方法,含形式化框架与治理程序,支持生命周期监控与可审计诊断。
JoyNexus:面向服务的多租户VLA模型后训练
JoyNexus提出多租户VLA后训练服务,解耦训练、推理与环境,通过组批处理实现跨租户调度,降低GPU耗时并提升资源利用率。
基于MaxSAT的反馈机制指导视觉语言模型解决数独
提出神经符号方法,利用MaxSAT求解器验证并反馈纠正VLM的数独错误,提升逻辑一致性和解题率。
SciVisAgentBench:一个用于评估科学数据分析和可视化智能体的基准
提出基于108个案例和多模态评估的SciVisAgentBench,用于评测科学可视化智能体。
感知对齐的AI输出:面向临床决策中不确定性沟通的端到端视觉预测
提出VL4ML框架,通过视觉表征传达预测与不确定性,临床试验显示超79%参与者认可,提升记忆与决策速度。
BrainPilot:使用智能体研究自动化脑发现
BrainPilot开源多智能体系统,通过可追溯日志和验证,加速脑科学研究,性能可比先进框架。
显存受限场景下的长上下文微调
HGA结合分段反向传播与分层KV存储,16GB显存实现16K tokens训练,性能接近密集注意力,显存增长可控。
AI评估中,项目反应理论可靠吗?
研究揭示AI基准中IRT因数据规模与分布不匹配而可能不可靠,小模型集下可扩展估计器易致错误推断。
ACPO:多智能体强化学习的智能体链式策略优化
提出ACPO方法实现联合策略梯度分散分解,智能体独立训练构成联合步骤,多智能体任务表现优异。
MirrorCode:AI可仅凭行为重建完整程序
MirrorCode基准测试AI通过观察行为重建整个程序的能力,最强模型达56%准确率,可复现万行级生物信息学工具。
少许自由,大有裨益:生成模型下强化学习的经典与量子算法
提出生成模型下强化学习的经典与量子在线算法,直接计算最优策略,量子算法实现多项式对数时间步长遗憾,打破经典平方根壁垒。
早期本科生计算机科学中的支架式生成式AI实验室:一项混合方法、多课程评估
简短支架式GenAI干预提升学生开放性与舒适度,改变使用策略,但未增加评分作业使用频率。
无监督深度学习在计算机断层扫描逆问题中的应用
无需真实数据,单次前向传递重建CT图像,速度提升万倍,性能媲美监督方法。
SLAC:通过无监督模拟预训练实现安全高效的实机强化学习
SLAC用低保真模拟预训练潜在动作空间,实现实机强化学习安全高效,一小时学会复杂操控任务。
用于无人机探测的声学成像:密集波束形成能量图与U-Net SELD
提出U-Net对波束形成能量图进行球形语义分割,实现360°声源定位,后处理质心获方向估计,适用于无人机探测和SELD。
面向交互感知的柔顺物体运输全身控制
提出仿生交互导向全身控制,通过强化学习实现重载交互下稳定全身行为与柔顺运输。
通过自适应编码器冻结实现节能的联邦学习用于MRI到CT转换:一项绿色AI引导的研究
自适应编码器冻结减少联邦学习能耗23%,保持MRI-CT转换性能,推动绿色AI医疗。
基于PDDLStream的大语言模型在任务与运动规划中的系统性研究
零样本实验表明,LLM规划器成功率低、耗时长,几何细节增加任务规划错误,直接LLM变体优于推理变体。
DiffuMamba: 基于Mamba骨干的高吞吐量扩散语言模型
DiffuMamba用Mamba骨干实现线性建模,长序列推理吞吐量提升8.2倍,性能不输Transformer。
受人类启发的神经符号世界建模与逻辑推理:用于可解释的安全无人机着陆点评估
NeuroSymLand分离感知建模与逻辑推理,实现可解释的无人机着陆安全评估,72场景61成功,优于基线。
中文标题:评估基于LLM的端到端CLI工具场景中的0到1软件生成
中文摘要:新基准CLI-Tool-Bench测试LLM从零生成命令行工具,顶级模型成功率仅43.8%,显示0到1软件生成仍极富挑战。
超越成功率:成本感知的攻防安全代理评估
安全代理评估需兼顾成本与成功率,进攻性能随计算提升,防御更依赖工具使用,应衡量经济效率。
软Q(λ):一种利用资格迹进行熵正则化强化学习的多步离策略方法
提出软Q学习的n步离策略方法,引入软树备份算子,统一为Soft Q(λ)资格迹框架,实现任意行为策略下的高效信用分配。
RESOURCE2SKILL:从人类创建的多模态资源中提炼可执行代理技能
从多模态资源提炼可执行技能,构建分层维基,代理检索组合,提升平均11.9个百分点。
memorywire:一种用于智能体记忆操作的厂商中立线格式
memorywire通过JSON-Schema标准化五种记忆操作与四类记忆,提供治理审核接口,测试召回率达1.0。
Jetson-PI:基于前瞻对齐异步推理的机载实时机器人控制
Jetson-PI通过前瞻对齐异步校正,在Jetson Orin上实现控制频率提升8.66倍,成功率提升14.8%。
AI治理中的部署后问责制:对AI事件的跨监管实证分析
分析AI事件数据库发现,77.1%缺乏上市后监控,99.6%缺数据保护评估,内部监控合规率远高于外部,据此提出主动AI治理合规框架。
攻克吉尔布雷斯猜想:从深奥数论到金融科技与网络安全
提出基于筛法的新方法论攻克吉尔布雷斯猜想,引入反向筛法,可应用于随机性测试、欺诈检测、网络安全等领域。
网络化智能:面向人机协作团队科学的主动共享上下文图
Mycelium系统通过主动共享上下文图自动连接研究者与AI,将局部发现转化为团队协同的机制约束和实验设计。
利用图工具提升小语言模型的分子性质预测
利用GNN工具增强提示,使小语言模型分子性质预测准确率提升高达74%。
现代智能体系统中的自我改进:综述
提出基础模型与操作支架耦合框架,形式化自我改进为自诱导更新算子,综述应用与评估,探讨未来方向。
Oracle代理内存:面向长周期AI代理的企业级内存基座
Oracle Agent Memory作为企业内存基座,实现长周期AI代理,在LongMemEval达93.8%准确率,节省10.7倍令牌。
通过世界模型从人类偏好和理由中学习安全智能体行为
利用世界模型和人类偏好理由训练奖励模型,实现安全高效的智能体部署。
CayleyR:通过循环交集解决TopSpin谜题
提出cayleyR包,通过Cayley图循环交集双向搜索求解TopSpin谜题,采用C++和GPU加速实现。
面向交通管理的成本最优基础模型部署组合
提出FMDP混合整数规划问题,证明NP-hard并给出贪心算法,案例显示混合部署成本降低97%。
AI-Native Insurance for Agentic AI: Pricing, Underwriting, and End-to-End Automation
面向自主AI的AI原生保险框架,实现承保定价、合同优化与自动化理赔。
AI建议削弱了人们说“我不知道”的意愿,即便建议有误且准确性受激励
五项实验表明,AI建议即使错误也抑制人们暂停判断,导致回答更多但正确率骤降,信心却翻倍。