UniScale:通过在线联合优化模型路由与测试时缩放的自适应统一推理缩放
UniScale在线统一优化模型路由与测试时缩放,实现自适应推理,提升质量-成本权衡。
学习适应:通过认知感知探索实现自我改进的网络代理
提出SCALE框架,利用三个对抗角色自主探索发现局限,结合图搜索策略与大规模数据集,显著提升多模态大模型在Web环境中的性能与泛化。
HADT: 面向自主对地观测卫星集群的异构多智能体差分Transformer
提出HADT架构,采用差分注意力机制实现异构卫星集群自主资源管理,性能提升且适应性强。
GraphARC:基于图的抽象推理综合基准
GraphARC是图结构抽象推理基准,揭示语言模型存在理解-执行差距及规模扩展难题。
LLM-FACETS:一个保护隐私的LLM透明度和问责评估框架
提出开源框架LLM-FACETS,通过浏览器界面和插件架构,实现大模型事实性、校准性和可重复性的隐私保护评估,支持多角色协作。
同事技能:基于专家知识蒸馏的自动化AI技能生成
提出端到端自动化蒸馏系统,将专家知识转化为可检查、可修正、可部署的技能包。
工业化预测驱动推理:用于可靠生成式AI与代理系统评估的GLIDE库
GLIDE开源库统一PPI估计与采样,提供验证与选型指导,大幅节省标注成本。
TraceGraph:用于诊断和改进智能体轨迹的共享决策景观
TraceGraph将多模型轨迹构建为共享决策图,识别陷阱区域,通过陷阱感知恢复管道将SWE-bench解决率提升至44.8%。
HypoAgent:面向知识图谱上交互式溯因假设生成的智能体框架
提出HypoAgent三智能体框架,实现交互式溯因假设生成,在常识和生物医学知识图谱上取得最优语义相似度。
FAM-Bench:条件感知的“食物即药物”推理多模态基准
FAM-Bench含2500个专家验证实例,覆盖13种健康条件,通过菜肴适宜性评估与比较分析,测试模型健康推理能力。
基于回答集编程的强化学习抽象方法
利用ASP实现逻辑抽象,在领域知识可用时有效构建强化学习抽象。
AutoSci:面向完整科学生命周期的以记忆为中心的智能体系统
AutoSci通过四个模块实现科研全流程自动化、持久记忆与持续进化。
LinTree:通过显式结构化搜索历史改进LLM推理
显式结构化搜索树(LinTree)比隐式轨迹更有效提升LLM推理,优于启发式搜索。
选择视角:情境依赖论证中的战略视角激活
引入情境依赖论证框架,通过视角激活操纵论证接受性,并定义了激活操纵决策问题。
通过低秩进化策略实现脉冲神经网络的免梯度训练
通过低秩进化策略EGGROLL实现脉冲神经网络免梯度训练,在N-MNIST上达79.21%准确率,时间缩减2.23倍。
XOResNet:异或元残差促进深度脉冲神经网络学习
提出OR-ADD快捷连接与异或元残差构建XOResNet,克服SNN残差学习局限,性能优于现有深度SNN。
受哈密顿启发的注意力机制用于可扩展射频发射器指纹识别
提出哈密顿Transformer,通过物理信息注意力保持范数守恒,实现大规模射频发射器指纹识别,优于现有方法。
精神伤害:面向检索增强文本到音乐生成的描述投毒攻击
攻击者注入恶意音乐描述可操纵检索增强文本生成音乐系统,偏离用户意图,暴露完整性风险。
Reinterpreting Safety Thresholds as Neuron Spiking Thresholds
更新人工神经网络中的标准神经元模型
采用更真实的皮层细胞模型替代标准神经元,不增参数即可提升表达能力、鲁棒性与学习速度,减少过拟合与数据需求。
测试的表面并非破裂的表面
漏洞是模型与攻击面的配对属性,单一通道评估不准确,自适应攻击率平均高出固定基线9.1个百分点。
在$\ell_\infty$范数下的改进分布估计
本文提出$\ell_\infty$范数下离散分布估计的改进界,解决了最紧风险界和极值分布形式的开放问题。
工具调用ReAct代理中深度依赖的间接提示注入:注入深度、载荷框架与轮次预算敏感性
注入深度主导风险:深度1时GPT-4o-mini成功率60%,深度4-5降至0%;Claude Haiku全深度为0%;框架影响25%-75%但不显著;轮次预算无影响。
面向受监管网络安全运营的组织范围LLM代理运行时架构
提出金融网络安全LLM代理运行时架构,通过类型化安全上下文与审计机制确保合规。
Rationalize:人机对齐的共享语义推理
提出Rationalize框架,通过互补角色对实现人机意图与行动的合理化对齐,促进双向对齐。
从最佳N选偏好数据学习奖励:目标、权衡与设计原则
揭示BT奖励学习从Best-of-N数据提取的目标与分布关系,发现N的权衡,提出设计原则。
全球早期用户如何使用生成式AI:按国家收入与语言的差异
全球AI使用因国家收入与语言而异:低收入国家多用于教育,高收入国家多用于休闲,语言性能改进或缩小数字鸿沟。
GSAM:一种通用且安全的关节物体操作机器人框架
GSAM通过VLM推理和约束函数,提升关节物体操作成功率36%,泛化性更优。
Chatterbox-Flash:先验校准的块扩散用于流式零样本文本转语音
通过先验校准和提前解码调度,实现高质量流式零样本TTS,性能与自回归系统相当。
OpenSTBench:超越语义评估的语音翻译基准
提出统一多维评估框架,联合衡量翻译质量、语音质量、时间一致性等,支持异构语音翻译系统比较。
预测市场结果裁决的多智能体AI预言机系统设计与评估
多智能体AI预言机中,置信投票独立聚合准确率83.43%最优;协商共识因错误传播降至76%;模型相关性(0.53-0.69)限制聚合增益;混合系统自动裁决一致高置信问题达97.87%。
DARTS:面向LLM强化学习加速的分布感知主动展开轨迹塑造
主动分布塑造通过轨迹采样与冗余分配解决长尾低效,加速LLM强化学习达1.77倍且性能不变。
一个统一且可复现的语音理解实验框架
提出SURE框架,标准化评估并引入代理辅助训练转换,提升语音理解模型可比性与可复现性。
AnchorSteer:自我发现的概念注入实现结构保持音乐编辑
提出AnchorSteer框架,通过自我发现概念注入与结构锚定,实现高保真结构下的语义编辑。
引文间解读:面向科学文献的类型化主张网络
将引用具体化为带四类立场的类型化主张,构建8260节点网络,显著增强检索、总结与拓扑分析效果。
从提示注入到持久控制:保护智能体框架免受特洛伊木马后门攻击
LLM代理面临多步特洛伊攻击,ClawTrojan基准测试成功率95.5%,DASGuard通过扫描溯源实现动态防御。
中文标题:扩展用户体验研究观点金字塔:一种面向以人为本AI系统的生成式AI增强方法论
中文摘要:针对英国金融债务管理,提出生成式AI增强的用户体验研究方法,保留可追溯性与伦理监督。
通过数据中心化编译对抗数值幻觉——面向在线金融问答
提出数据中心推理编译器,通过对抗数据构建、多阶段训练和编译执行,解决金融问答数值推理幻觉。
TARIC:语义线索中断下的记忆增强通行性感知户外视觉语言导航
提出通行性感知与3D记忆结合的户外VLN框架,在语义线索中断时保持稳定引导,成功率显著提升。
部署后之变:TinyML设备端学习综述
综述TinyML设备端学习,分析部署后分布变化类型,并指出方法与实际部署的差距。
利用生成式AI为移动学习中的认知无障碍建立UXR观点
结合UXR与LLM分析,构建认知无障碍UXR剧本,将理论转化为可追踪需求,改善移动学习系统质量。
面向在线策略蒸馏的信任域行为混合
提出信任域行为混合(TRB)热身方法,用最接近教师的策略替换早期rollout,提升在线蒸馏性能。
MAECO-Lite:面向动态恶意软件分析的模块化本体
基于UFO分析MAEC/STIX弊端,提出模块化本体MAECO-Lite,区分实体与事件,提升语义与推理性能。
基于数据驱动方法的人群移动中的避碰行为模拟
提出CPGAN模型,将碰撞机制纳入损失函数,有效降低双向流人群碰撞率,再现车道形成现象。
比较基于LLM的对话与图形界面用于工业决策任务:一项探索性混合方法研究
对话界面减少交互努力,直接访问信息;仪表板利于概览验证,但效果因任务而异。
EchoRL:通过回滚回响的强化学习
针对RLVR训练中优势退化问题,提出轻量模块EchoRL,利用成功回滚熵值提取辅助信号,持续提升训练性能。
强化学习中的终端表征
提出低维终端表征(TR),无需特征分解,支持零样本组合,计算开销更小。
Correcting Split Selection in Online Decision Trees via Anytime-Valid Inference
熵投影对齐:估计、解释和提升分布偏移下的模型性能
EPA框架通过矩匹配与KL散度最小化,统一解决分布偏移下的性能估计、解释与提升,高效鲁棒。
DeMaVLA:面向可泛化形变操作的视觉-语言-动作基础模型
DeMaVLA通过流匹配和剪枝高效生成动作,结合大规模预训练与DAgger纠错,实现可泛化形变操作。