RIFT-Bench:面向智能体AI系统的动态红队测试
RIFT-Bench提出基于图表示的动态红队测试,自动发现与攻击扫描,统一评估异构智能体系统。
基于学术论文全文共现网络探究算法的学术影响力
通过全文构建算法共现网络,揭示NLP领域算法影响力演化规律及核心位置先于关联衰退的现象。
智能体模型的批判
区分自动化与真正智能体,提出GIC架构,强调内化能力与人类监督下的安全可控。
追求广泛且持久有益的强化学习模型
在现实领域用RL训练有益行为,可使模型在超80%分布外基准上提升对齐,并增强持久性,减少奖励黑客与欺骗。
集成特征选择与哈里斯鹰优化用于女性性工作者可解释性心理健康风险预测
提出混合模型集成特征选择与哈里斯鹰优化,在3005名女性性工作者中达95.78%准确率,识别出PTSD、客户暴力等关键抑郁因素。
扩散与流匹配背后的几何:Wasserstein空间中的梯度流与测地线
扩散模型是自由能梯度流,流匹配是Wasserstein测地线;两者路径不同但终点相同。
ReMMD:面向多模态虚假信息检测的真实多语言多图像代理验证
提出ReMMD框架,含多语言多图像基准与代理,五元真实性检测准确率41.80%,成本降低17.5%-79.9%。
FlowR2A:学习奖励到动作分布的多模态驾驶规划
FlowR2A将奖励转化为生成条件,统一密集监督与动态提议生成,实现可控高质量多模态驾驶规划,在NAVSIM基准上达SOTA。
因果强化学习导论
因果推断与强化学习通过反事实关系结合,以结构因果模型统一学习模式,提出因果强化学习范式。
面向个性化多模态生成的用户行为导航
NaviGen以双重标识符编码用户行为,经两阶段SFT+RL训练,提升个性化图像与视频生成质量及指令相关性。
LemonHarness技术报告
LemonHarness框架通过边界约束、规则知识库和时序感知机制,提升长时程代理稳定性,测试准确率达86.52%。
MVG-KAN:多视图地理-风引导KAN用于PM2.5预测
提出MVG-KAN模型,集成多视图与地理-风图,全面耦合周期性、残差动态和气象扩散,提升PM2.5短期预报精度。
利用扩散并行与训练器辅助生成加速视觉生成大语言模型的分离式强化学习
DigenRL通过扩散并行与训练器辅助生成,实现1.56-2.10倍吞吐提升,适用于视觉生成LLM。
当助人倾向压倒因果谨慎:LLM中上下文的抑制与恢复
LLM在实用情境中因果谨慎从92%骤降至0.5%,自校正提示可恢复至71-100%,表明抑制来自表达而非能力缺陷。
形式验证证书的循环一致性神经解释
提出循环一致神经网络,从验证证书生成忠实自然语言解释,准确率90%,推理比多LLM快860倍。
ReM-MoA:推理记忆支撑混合智能体规模扩展
ReM-MoA通过排序推理记忆与多样化记忆路由,解决多智能体深度扩展中的性能退化问题,实现更强拓展性。
智能体AI实现策略驱动物理层系统的双层长期优化
提出Agentic-LTPO框架,以智能体AI生成上层配置并优化下层实时决策,长期性能提升57.2%。
聚合不变量能否加速连续子图匹配?限制、规律与动态谱索引
聚合不变量可移除51%候选或跳过47%更新枚举,加速构造与列表扫描,但不加速邻接探索。
Bayesian control for coding agents
CompressKV:语义检索引导的KV缓存压缩实现资源高效长上下文LLM推理
CompressKV通过识别语义检索头选择关键token并分层分配缓存,仅用3%缓存保持97%性能,实现资源高效长上下文推理。
潜在桥:面向实时游戏代理的连续慢-快通道
提出潜在桥法,将慢模型残差映射到快模型输入空间,避免文本延迟,在7款Atari游戏与驾驶任务中优于文本桥,效果好且可控。
ASALT:多智能体强化学习中横向迁移的自适应状态对齐
ASALT通过适配器映射跨域状态到共享嵌入空间,实现高效策略迁移,减少负迁移,提升合作任务样本效率。
多智能体LLM系统中的受控共享内存
形式化舰队内存问题,定义原语并实现MemClaw,评估发现泄露与冲突等实际故障。
量化融合:连接经典价值投资与现代因子模型的系统化选股策略
格雷厄姆价值规则可约束AI模型过度风险,结合后随机森林获得最高回报232%,最大回撤仅34.5%。
AdversaBench:基于多裁判确认与跨模型迁移性的自动大语言模型红队测试
提出自动红队测试流程,多裁判确认失败,发现操作符效果因类别而异,对抗样本可跨模型迁移。
AI代币经济学:基础模型中代币、计算与定价的经济学
本文提出AI代币经济学框架,揭示代币支出与经济价值差异,并指出隐藏代币测量等研究方向。
基于本体的数据访问中的查询抽象
OBDA中查询抽象,扩展UCQ实现完美抽象,借最大恢复刻画最大可靠抽象。
OpenThoughts-Agent:智能体模型的数据配方
开源数据管线,100+消融实验揭示任务多样性关键;10万样本微调Qwen3-32B,平均44.8%准确率超现有模型,全面开源。
规模能否解决大型语言模型的可塑性损失?
大模型可塑性损失随规模增大而延缓,但无法避免,持续与稳态训练中均存在。
BluTrain:面向AI系统的C++/CUDA框架
BluTrain是原生C++/CUDA的AI训练框架,性能优于PyTorch:吞吐量407K tokens/s,内存节省22%,数值精度不变。
双向条件流匹配解决混沌系统逆问题
双向条件流匹配解决混沌系统逆问题,显著提升精度和速度,并兼顾守恒定律。
Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment
LOLA中运行时验证与基于模型诊断的统一框架
提出在LOLA中统一运行时验证与模型诊断,实现连续在线故障定位,无需额外工具链,支持多种故障。
基于扩散的视觉条件语音增强中的音视频对比对齐
在扩散训练中引入对比音视频损失,增强视觉信息利用,提升干扰抑制和感知质量,低信噪比下效果最佳。
基于连续可穿戴生理信号的多评分者疼痛评估的事件对齐分析
提出评分者感知的事件对齐框架,发现疼痛-生理关系非评分者不变,聚合评分会掩盖模式。
马尔可夫逻辑网络定义的随机有色有向图
研究MLN中一阶逻辑极限概率:权重缩放时出现0-1律且与权重无关;未缩放时依赖权重,存在7种情况与相变。
有限图上延迟耦合反应扩散系统中的可重入值场
提出符号场与几何场耦合的延迟泛函微分方程系统,在耦合条件满足时全局稳定且与延迟无关。
法律推理并非律师实务:反思面向自我代理诉讼的司法可及性法律基准
法律AI基准高估模型性能,因依赖专家预处理的输入,应测试自我代理诉讼人的嘈杂输入以评估真实司法可及性。
LLM智能体社会中的涌现关系秩序:从集体情感到权力分层
多智能体模拟再现差序格局,揭示集体情感与关系权威的涌现机制。
JupOtter:Jupyter笔记本中的单元级缺陷检测
JupOtter实现Jupyter单元级缺陷检测,F1分数超越静态分析器和大型语言模型。
面向5G上XR实时化身控制的集成感知与通信
提出结合5G毫米波ISAC和sEMG的多模态架构,实现身体级与手指级手势识别,支持XR实时化身控制。
可信AI的有效性密码证书
提出代理AI有效性密码证书,通过形式化策略与多项式约束编译,用简洁密码证明实现独立可验证合规,无需信任代理或重算。
可测的多数
提出严格多数推理的相干性准则,证明可加测度表示与逻辑完备,并修正Suppes定理及May型刻画。
Ten Digits on a Train: AI-Assisted Verification of Two Eigenvalue Problems
AutoSpec:通过归纳逻辑编程实现LLM智能体安全规则演化
归纳逻辑编程引导安全规则自动演化,精准平衡精度与召回,降低94%误报率。
使用对比非配对图像翻译从非增强CT进行心腔分割的前景与挑战:一项可行性研究
ChameleonNet利用对比非配对翻译从非增强CT分割心腔,无需手动标注,可行性高,但心室体积误差需优化。
生成式人工智能对中国人文社科学生学术发展的影响
生成式AI提升多数学生成绩与动机,但存过度依赖问题,学生支持有选择地整合。
通过两阶段训练打破跨试验脑电图引导目标语音提取中的捷径学习
提出TRUST-TSE两阶段框架,对比预训练加置信度加权提取,解决脑电语音提取捷径学习,提升跨试验泛化。
基于批量Oracle查询的实体解析
提出批量Oracle查询的实体解析方法,证明最优批次选择NP难,给出自然条件最优解,实验优于基线。
G³VLA:面向视觉-语言-动作模型的几何归纳偏置
G³VLA在预训练VLA中注入相机标定几何信息,无需深度传感器,提升多相机机器人操作中空间和物体敏感任务表现。