取决于数据集:脑编码模型的预测响应何时在视频可记忆性上胜过其视觉骨干网络
脑编码模型预测响应提升视频可记忆性预测,效果因数据集而异,非通用先验。
多智能体系统的可组合验证管道
提出基于Tiles的模块化验证框架,通过可组合功能管道处理多智能体系统动作与状态,支持YAML定义,保证终止。
从意图到基础设施:面向通感一体化网络的LLM驱动智能体编译器
LLM驱动的编译器将工程意图转为通感一体化配置,慢速策略与快速算法分离,支持闭环自适应。
物理信息特征工程的一维CNN用于静止卫星多层云检测
嵌入物理先验的1D-CNN提升多层云检测,发现可增强传统算法,但需考虑传感器差异。
智能引导的自适应纯化用于抗DDoS量子网络:基于CUDA-Q的研究
提出IDS感知自适应纯化策略,将DDoS攻击下量子网络交付率从0.098提升至0.344,接近最优水平。
身份一致表情场:一种用于少样本人脸表情合成的解耦神经辐射场框架
ICEF解耦静态身份与动态变形,通过身份保持正则化和置信度加权扭曲,在少样本下实现高质量表情合成且保持身份一致
GraphDx:面向顺序诊断的成本感知知识增强多智能体框架
通过知识图谱与多智能体协作,GraphDx将诊断成功率提升至79-93%,同时降低测试成本20-54%。
对可信AI工具、认证框架及实施鸿沟的批判性分析
可信AI工具和认证框架存在伦理焦点失衡、生命周期覆盖不均等鸿沟,需扩展目标、嵌入全周期并促进多元参与。
因果审计:通过目标感知因果链构建实现显式可审计的图推理
提出显式可审计因果推理框架,用目标感知因果图与路径聚合突破LLM局限,提升可解释性。
逻辑、优化与人工智能
逻辑与优化结合提升规则AI透明度,综述合作领域与方法,展望未来。
ToolVerse:为智能体强化学习解锁大规模环境与长期任务
ToolVerse框架通过构建大规模工具环境和长期任务,显著提升智能体在动态环境中的推理能力。
SeerGuard:基于世界模型预测的移动GUI代理安全框架
通过预执行指令筛选和动作风险评估,SeerGuard框架显著提升移动GUI代理安全性与实用性。
面向信息抽取的智能体模型的行为可控性:从固定工作流到反思型智能体
研究LLM智能体在信息抽取中的行为可控性,比较固定工作流与反思型智能体,评估过程行为及任务改进效果。
基于隐式神经表示的数据驱动视频编解码器
用SIREN网络联合压缩视频音频,蒸馏量化后压缩比达2.61,视频PSNR超28dB。
基于形式化基础的ODRL评估器:实现与比较
首个基于形式语义的ODRL评估器,支持全部规则类型,高效实现访问控制与监控,性能优于现有系统。
SciForge:面向科学发现的AI原生多模态工作台
AI原生多模态科学工作台,集成模块化服务与可审计决策,助力基因发现、蛋白质设计等科研场景。
协调AI安全阈值
提出协调AI安全阈值方法,针对滥用风险基于预期伤害建模,自动化研发基于进展率,解决阈值不一致与逐底竞争。
CRAFT:聚类评分标准以诊断大语言模型薄弱能力并生成针对性微调数据
通过聚类评分标准能力描述,诊断LLM薄弱节点,生成针对性微调数据,在金融法律领域提升模型性能。
Empathy as Predictive Misalignment Tolerance: A Co-Regulation Framework and the Regime Structure of Dialogue Repair
拓扑斯因果模型的立方体形式化:干预、层黏合与直觉主义do演算
机器验证拓扑斯因果模型核心:干预、层黏合、内语言,修复拓扑缺漏,证明j稳定性及上下文性阻碍。
云端可扩展的LLM智能体工具访问
提出MCP网关系统,解决服务集成、协议兼容与工具选择难题,实现98%召回、8.9倍加速及23.8倍降耗。
AEGIS:面向开源液体处理机器人的实验感知协议验证与运行时监控
AEGIS双层守护:LLM+规则库验证协议(F1=0.97),PCA模型监控物理错误(F1=0.71),开源首个统一方案。
基于反例增强草稿的智能体综合
该方法通过反例修正代码草图,保留审查后的策略,减少重复工作,提升修复效率。
地图作为提示:面向跨场景无线定位的多模态空间信号基础模型学习
提出SigMap模型,通过循环自适应掩码与地图提示框架,实现跨场景无线定位零样本泛化,性能显著领先。
AuEmoChat:面向对话语音合成的真实情感理解与渲染
AuEmoChat通过离散情感令牌与上下文合并,实现对话语音的真实情感渲染,性能超越现有方法。
社会文化对意见形成的影响:口碑传播、大众媒体与行为发展
口碑与媒体影响多元群体意见形成,揭示社会分裂与代沟。
用量子Fisher信息重新思考量子持续学习
提出QEWC,用量子Fisher信息正则化,通过量子态几何识别参数重要性,有效缓解遗忘且抗噪。
光学相干断层扫描中跨域视网膜层分割的空间归一化
研究空间归一化预处理提升OCT视网膜层分割的跨域泛化性,并提出无标注的拓扑质量评估指标。
低压电网中基于强化学习的拥堵管理的鲁棒性
结合随机森林预分类与强化学习控制器,噪声鲁棒,模型不匹配下仍有效缓解违规。
当模型合并可与联合多任务强化学习相媲美:任务向量几何分析
模型合并媲美联合多任务RL,专家任务向量近正交且方向支持解耦,合并方法效果无差异。
Muon何时助力智能体强化学习?
Muon在智能体强化学习中可显著提升成功率,效果依赖学习率和优势估计器,低学习率下表现更优。
RAD: 检索高质量演示以增强决策
提出RAD,通过检索高回报状态生成子轨迹,提升离线强化学习泛化能力。
RL-Struct:面向LLM可靠结构化输出的轻量级强化学习框架
提出RL-Struct框架,用GRPO和分层奖励对齐结构约束,减少38%显存,JSON任务达89.7%结构准确率,自组织学习先语法后语义。
评估开放权重大语言模型生成自动驾驶汽车漏洞的结构化威胁信息
评估11种开放权重LLM生成CAV漏洞的STIX结构化信息,单模型SDO和CWE的F1达0.94和0.99,但MITRE ATT&CK映射困难,多智能体方案部分提升。
通过文本-关卡-草图共享表征的人类对齐过程性关卡生成强化学习
提出VIPCGRL框架,利用多模态共享嵌入与对比学习实现人类对齐,性能优于基线。
支付宝支付集成基准测试(Alipay-PIBench):面向编码智能体的真实支付集成评估
支付宝支付集成基准测试Alipay-PIBench评估编码智能体,带技能下平均通过率提升10.31%,最高91.37%。
FAIR_XAI: 通过可解释性提升多模态基础模型在健康评估中的公平性
VLM在健康评估中存在性能差异和偏见,XAI干预效果有限,需联合优化准确率、公平性和泛化性。
中文标题:为什么CNN擅长特征提取?一个数学解释
中文摘要:通过新数学模型证明,卷积神经网络可零误差解决图像分类任务,因能实现检测特征的分段线性函数。
毒化以检测:联邦学习中的目标过拟合检测
提出三种检测方法,能在1-2轮内有效识别协调者诱导的目标过拟合,F1达0.7。
CTC:合作多智能体强化学习的复合任务挑战
提出复合任务挑战(CTC),强制分工与合作,现有合作MARL方法全部失效,指导方案可解但次优。
MAnchors:基于记忆的锚点加速——规则重用与变换
通过存储和变换规则,大幅缩短解释生成时间,保持保真度和可解释性。
AuditVotes: 通过高效增强与条件平滑提升GNN的可证明鲁棒性
AuditVotes框架整合图重连增强与条件平滑,同时提升GNN的干净准确率和认证鲁棒性,理论保证且效果显著。
延迟-响应理论模型:通过响应准确性与思维链长度评估大型语言模型
LaRT模型联合建模响应准确性与思维链长度,引入能力与速度相关参数,提升评估准确性
PASs-MoE:通过路径激活子空间缓解路由与专家错位共漂移的持续学习新方法
提出PASs-MoE,用路径激活子空间校准路由并稳定专家方向,提升持续学习抗遗忘能力。
中文标题:嵌入空间中的捉迷藏:基于几何的大语言模型隐写术与检测
中文摘要:提出低可恢复性隐写术,用嵌入空间替代任意映射,并通过线性探针检测微调后内部签名,准确率提升33%。
非弹性本构Kolmogorov-Arnold网络:一种自动发现可解释非弹性材料模型的通用框架
iCKANs自动发现材料弹性与非弹性本构定律,准确捕捉粘弹性行为,保持物理可解释性。
GeoRouteNet:面向几何的非自回归神经求解器,用于欧几里得旅行商问题
GeoRouteNet利用几何特征与多候选强化学习,在TSP-50训练后,TSP-100和TSPLIB上分别降至1.26%和3.60%的差距,优于基线方法。