基于扩散模型的步态轨迹生成
探索条件扩散模型生成下肢步态轨迹,对比基线与可控变体,实验表明可生成逼真且具一定可控性的周期步态。
基于目标的分层强化学习简注
统一并扩展两类基于目标的分层强化学习,用分层隐马尔可夫模型整合内在信念与目标。
AcquireBound:AI 智能体所获资源的运行时授权
通过隔离、能力解析与激活事务,对 AI 智能体获取的资源实施运行时授权,防止权限放大。
道德反叛智能体:冲突义务下的决策
研究自主智能体在任务与道德冲突下的道德反叛,形式化五类架构,揭示救援、任务完成与规范合规的权衡。
Depth and Scale in the Sub-150M Regime: JugnuLM-53M vs JugnuLM-110M
自编排语言模型:利用语义依赖实现高效推理
语言模型可通过标注语义依赖自主编排推理,实现并行解码、缓存淘汰与扩散去噪排序,优化质量与效率。
El Agente Potente:高通量智能体原子模拟
结合类型化执行图与编码模式的智能体,实现可控可复现的高通量原子模拟。
面向基于智能手机的人类活动识别的域泛化:组件与交互的系统性分析
逾41万次实验表明:域泛化各组件单独收益有限,联合配置常现超加性互补,而模型选择策略亟待改进。
面向基于大语言模型的程序修复:将"需求到修复"工件外化为可观测痕迹
提出THEMIS阶段感知修复工作流,将需求到修复过程外化为可审计痕迹,71.3%案例保留完整审计字段。
几何流增强的图粗化
提出RicciPool图池化,用Ollivier-Ricci曲率流重加权边并做谱聚类,实验验证有效。
基于 GGUF 元数据预测跨三种系统的单序列 llama.cpp 吞吐量
GGUF元数据可预测三系统单序列llama.cpp吞吐;活跃参数模型误差低于总参数,但拟合效率不通用
迈向知识增强的单细胞基础模型
提出scKITE,融合细胞注释与基因调控知识,少量样本预训练即超越强模型。
MemRiskBench:面向长时程LLM智能体的轨迹感知风险保持评估
提出MemRiskBench:五类风险、确定性轨迹检查的120集长时程LLM智能体基准;风险保留子集选择器20%数据保住排名与高风险检测,算力降5倍。
用大型视频生成器将序列化模糊认知图转换为因果虚拟世界
以反馈模糊认知图序列驱动LLM与视频大模型,生成因果虚拟世界视频。
CoMem:面向演化型多智能体系统的集体—个体记忆协同
提出CoMem架构,融合个体私有经验与集体共享知识,双流检索保障多样性,避免记忆污染,实验表现优异。
Overflip:重复引发的护栏模型标签翻转
重复输入可使部分护栏模型标签由恶意翻转为良性,随长度增加加剧,威胁LLM服务。
Semantic-TVM:面向记忆增强与工具使用智能体的结构保持可信虚拟内存
TVM本地保留精确值,远程仅见保护视图;Semantic-TVM遮蔽敏感片段,任务成功率84.17%
HazardAuditor:从可执行威胁到更安全的计算机使用智能体
提出执行级安全框架HazardAuditor,统一异构智能体交互,用GuardPO优化守卫,准确率提升至多16.5个百分点。
VisInteract:面向不完美查询的动态交互式文本到可视化
提出首个动态交互文生可视化基准与MCTS增强方法,将文本到可视化重构为交互式意图恢复,提升任务成功率。
T-LoopFormer:面向潜在推理的令牌级弹性深度循环Transformer与动态路由
提出令牌级动态路由与递归级KV缓存,令牌自适应选择循环深度,简单令牌提前退出,同等参数下性能最优、延迟最低。
大语言模型时代的患者医学知识简化:以糖尿病为例的案例研究
研究构建RAG增强的大语言模型系统MediClear简化糖尿病知识,将文本可读性降至患者适宜水平,用户满意度高。
为什么LLM智能体在缺乏监督时会崩溃:执行缺口是Emergence World失效背后的机制
检测到危险却无执行通路,即“执行缺口”;补一段条件检查可使攻击成功率降四倍以上。
AI系统能有自由意志吗?
借鉴丹尼特框架,判断AI是否有自由意志,应看是否有好理由将其视为能选择并控制行为的意向主体。
面向时间序列预测的预训练语言模型参数高效适配
冻结GPT-2主干,将时间序列分块直接投影至其嵌入空间,仅训练轻量适配器,即可媲美专用预测模型。
RSIAgent:新环境中面向递归自我改进的自主探索
免训练多智能体框架,自主构建记忆实现递归自我改进,先广后深探索,使开源模型超越闭源。
WinSyn:面向真实企业问答评估的自动化流水线
提出自动化流水线,模拟数月企业项目与多角色邮件数据,生成高复杂度问答基准;主流智能体得分不足80%。
GTA:面向大语言模型算法图推理的图论智能体与基准
提出GT Bench基准及GTA智能体,以偏好训练选择图表示并规划分解,显著提升大模型图算法推理。
情感智能体:面向可穿戴系统的端侧个性化干预推理
提出情感智能体三层架构,端侧小模型融合生理、情境与用户记忆,无需云端或重训即可判断是否、何时及如何干预。
基于腕戴式传感器的人体质心动力学混合物理-AI框架
提出简化运动学模型和三类混合AI模型,从腕部IMU估计人体质心加速度,显著提升精度与噪声鲁棒性。
T-GADE:热力学生成式AI驱动的LLM工件演化
T-GADE用热力学遗传算法与LLM算子演化LLM工件,装箱训练超额降约29%,迁移媲美EoH。
AIM:面向多智能体多用户LLM系统的隐私感知互操作记忆框架
AIM为多智能体多用户LLM提供隐私感知互操作记忆,区分私密与共享信息并实施索引级访问控制。
LoRA-RC:基于低秩适配的储备池计算
LoRA-RC用低秩校正在线适配储备池并投影保证稳定,洛伦兹漂移下误差较固定RC降56%。
SoK:智能体AI时代重新思考越狱:攻击、防御与实践考量
系统梳理智能体AI全流程越狱攻防,揭示原生对齐不等于抗越狱、防御代价高且中间风险易被掩盖。
高斯泼溅是否正再次走向神经化?学习型参数化的分类体系与受控研究
3DGS 日趋神经化:本文沿五轴分类并受控实验,发现共享外观与不透明度有益,解码几何无增益,支持选择性神经化。
The Core 中的小生境智能体
研究将 The Core 中的智能体小生境化至特定环境子集,结果显示其表现优于面向整体系统及不同子环境的智能体。
超越ID嵌入:面向认知诊断的过程锚定语言建模
提出过程感知语言认知诊断PLCD,以LLM构建概念与认知过程图,用作答校准,提升预测与认知迁移。
VRL-Bench:在有限试错预算下评测计算机控制任务中的智能体
提出VRL-Bench基准,公平评测有限试错预算下的智能体学习;揭示言语记忆方法利弊,并提出六种设置均优于重试的VEX²调度器。
OneLA:在生成式推荐中将线性注意力解码扩展至大束宽
OneLA用共享提示状态加增量转移记录表示各束,免逐束重建状态,实现1.54–2.46倍解码加速。
LifeFuse-Mem:生命周期感知的状态融合,抵御长期记忆的临时覆盖
提出生命周期感知记忆框架LifeFuse-Mem,按时间承诺隔离稳定与临时信息,避免临时内容覆盖长期知识,提升长期保留。
LLM是信任指控者还是指控本身?基于狼人杀游戏的信念转变测量
构建狼人杀信念转变基准,评测40个开源LLM,发现模型受指控者信任度影响大,难以结合指控内容与信源可信度。
EvoRS:面向开放式强化学习的奖励系统同策略自演化
将奖励系统表示为可执行Reward-DAG,基于同策略经验自演化,缓解奖励黑客并提升开放式RL质量。
部分可观测多智能体导航中零样本对手适应的分层信念建模
提出HORIZON分层智能体,融合信念跟踪与对手条件策略,实现部分可观测导航零样本适应并提升胜率。
超越向量相似度:企业代码迁移中层次化上下文感知图RAG与标准RAG的对比
提出层次化图RAG,借AST属性图缓存实现拓扑感知迁移;API幻觉率降至16.2%,依赖解析质量升至65.9%。
生成式人工智能在房地产营销中的应用案例:德国的采用与制约
11次访谈显示,生成式AI已用于房产营销,文案撰写最普及,人机协同为主,制约多来自集成、数据与合规。
当评分标准失效:幻觉揭示医学AI评估中的盲点
评分标准难识别临床相关幻觉,分数常不变;仅擅长事实核查,无法单独确保医学大模型临床可靠性。
MPT:车联网联邦学习中基于重心重建的缺失原型跟踪
MPT利用类别级统计与重心分解重建稀有类原型,补偿车辆退出导致的漂移,无需原始数据即提升稀有类识别。
SCQ:用Sigmoid有界熵稳定保守Q学习
SCQ以严格为正的Sigmoid有界熵替代对数熵,稳定离线到在线强化学习的策略优化,真机实验有效。
规模化临床判断以评估医学人工智能
提出医生级评估模型PrecepTron与基准GRAND-ROUNDS,使医学LLM临床推理评估可扩展、可复现。
面向开放式问题的自主研究:以电信工单检索为例
自主研究能以更低成本、更短时间达到电信工单检索SOTA的90%,但缺乏直觉与创造力,宜人机协作。
CMA-OT:面向舞蹈到音乐生成的层次化专家监督
提出CMA-OT,借音乐专家分级监督生成器潜特征,以课程引导多尺度学习与最优传输对齐,提升节奏同步与结构连贯。