VoiceTTA: 通过基于强化学习的测试时自适应增强零样本文本转语音
VoiceTTA通过强化学习测试时自适应,优化可学习前缀,提升零样本TTS对罕见说话风格的模仿,超越现有方法。
IDEA:通过效果对齐实现多智能体控制中动力学失配不敏感的仿真到现实迁移
提出效果对齐方法,结合随机环境与离散语义动作,实现多智能体对动力学失配不敏感的仿真到现实迁移,提升鲁棒性与成功率。
LLM生成VeriFast规范的经验研究
LLM生成规范功能保持率超91%,但验证成功率仅31.4%,错误主因是缺乏分离逻辑验证器领域知识。
HiLSVA:面向科学可视化的人机协同智能体系统的设计与评估
HiLSVA通过混合主动性交互提升任务完成、用户控制与透明度,但揭示执行效率与人类监督之间的权衡。
知悉过多的智能体:以数据为中心的LLM智能体隐私综述
以数据为中心综述LLM智能体隐私风险,指出信息流控制是唯一覆盖组合与跨会话泄露的机制,且缺乏统一隐私策略的基准。
TGHE:基于模板的图同态加密实现边缘-云系统隐私保护GNN推理
TGHE利用图模板现象打包同构计算树共享密文,实现SIMD并行推理,速度提升66.9倍,AUC损失小于0.002。
LAMP:面向可行轨迹预测的车道对齐运动基元
提出LAMP框架,利用VQ-VAE学习车道对齐运动基元,结合拓扑先验筛选意图,提升轨迹预测的可行性与多样性。
参数化开源博弈
提出参数化开源博弈模型,建立均衡存在性,揭示耦合强度决定合作与背叛的阈值。
堡垒与守门人:第三方网络安全风险治理中的传递信任理论
本文通过OpenAI-Mixpanel事件提出传递信任概念与“堡垒-守门人”框架,阐释第三方网络安全治理中的委托与问责问题。
面向LLM编码代理的确定性控制平面
代理配置管理缺失,提出确定性控制平面Rel(AI)Build,通过内容寻址、锁文件等机制确保不变性。
Chai:自主发现密码误用漏洞
Chai用AI重新定义差分测试,从库级挖掘漏洞并通过依赖图传播,已发现超100个安全漏洞。
利用深度学习的紧凑宽带逆多尔蒂功率放大器逆向设计
本文提出深度学习方法,联合CNN与遗传算法逆向合成紧凑宽带逆多尔蒂功率放大器,实测峰值效率51%-63%,回退效率48%-54%。
ShareLock:一种针对MCP的隐蔽多工具阈值投毒攻击
ShareLock利用Shamir阈值方案将恶意指令分散到多工具描述中,实现隐蔽攻击,成功率超90%。
规范增长引擎:面向AI辅助软件开发的以规范为锚、代码耦合、强制防漂移的架构
轻量框架通过规范图、上下文组装、垂直切片和漂移门,解决AI开发中的上下文爆炸与规范-代码漂移问题。
超越Shapley:非对称Shapley值的高效计算
提出非对称Shapley值高效计算方法,利用因果图实现多项式时间精确计算与近似算法,实验可行。
智能体AI漫游指南:从基础到系统
一本全面覆盖从LLM基础到智能体系统构建与部署的实践指南,强调全栈理解。
孤立还是评分?面向成本高效的多智能体RAG的模型自适应评估
弱基线下无评估孤立等同全评估,解决文档混淆提升50%;强基线下需评分。提出MADARA,单模型阈值零样本泛化消除计算开销。
项目Auto-World:迈向神经关系推理器的自动化基准测试
用LLM自动生成基准,进化搜索发现困难实例,提升神经关系推理器泛化能力。
中文标题:通过分类策略检索诊断与缓解智能体说服中的复合失败
中文摘要:针对智能体说服中复合错误,提出分类策略RAG(TS-RAG),通过离散分类瓶颈解耦结构与内容,提升抽象逻辑迁移,使轻量模型胜率从70.5%升至78.5%。
视觉语言模型搜索是否类似人类?推理token作为经典视觉搜索范式中反应时间的模拟
视觉语言模型再现部分人类搜索特征,但存在关键分歧,如目标存在时努力斜率反转。
基于等级分条件残差模型的人类国际象棋风格嵌入:与Elo解缠
提出Elo解缠的棋风嵌入:残差模型学习棋手对典型落子的偏差,基础模型提升预测33%,嵌入在Elo正交轴上捕获风格。
基于技能划分与复用的离线多智能体持续协作
COMAD通过技能划分与复用,实现多智能体持续协作,解决灾难性遗忘并提升迁移性能。
Heuresis:面向质量、多样性和新颖性的自主AI研究智能体搜索策略
Heuresis框架实现六种搜索策略,发现完全新颖想法罕见且不达最高性能,质量-新颖性前沿未扩展。
代理知识追踪:用于严肃游戏中金融素养隐藏评估的多智能体大语言模型架构
多智能体LLM从游戏事件隐藏评估金融素养,学习收益相关显著,预测效度较单模型提升三倍。
长期模拟揭示AI伴侣的认知发展风险
TSJ框架发现短期测试低估AI伴侣的认知发展风险,需140轮交互才能稳定评估,早期儿童和成年初期最脆弱。
BrainAgent:大语言模型驱动的多智能体自主脑信号理解框架
BrainAgent通过大语言模型驱动的分层多智能体架构,自动将自然语言意图转化为脑信号分析流程,实现高效可靠自动化。
量化导致推理膨胀:分词膨胀——低比特推理模型的隐藏成本
低比特量化保持准确率但增加推理token量,抵消加速,须同时报告准确率与token使用。
悬崖Token:识别大语言模型数学推理中的单Token失败触发点
引入悬崖Token作为失败触发点,删除首个可完全恢复,分类优化提升准确率达6.6%。
Autodata:一种用于创建高质量合成数据的智能数据科学家
Autodata通过元优化让AI代理作为数据科学家生成高质量合成数据,效果优于传统方法。
OWL本体与知识图谱上的模糊量化
提出通用框架评估模糊量化查询,检索满足表达式的个体,适应不同量化器、方法与数据源。
位置空间与图
提出位置图框架,用严格偏序建模标记位置,给出一致性条件,证明诱导子图同构问题为NP完全。
面向马尔可夫决策过程在线统计模型检验的置信序列
提出置信序列用于MDP在线统计检验,实现高效工具,样本量比现有方法平均减少50倍。
智能体系统作为压缩器:以比特量化系统智能
将智能体系统视为压缩器,用比特量化智能,实验表明智能体组件减少编码长度。
自调制量子快速权重编程器用于高效自适应序列学习
提出自调制量子快速权重编程器,通过自适应平衡新信息与历史记忆,提升时序预测收敛稳定性与性能。
使用JSON Schema和Pydantic对Project Haystack网格进行类型检查
提出Python工具链,解析Haystack定义并生成Pydantic模型与JSON Schema,实现网格类型检查与验证,已开源。
ReviewGuard:对齐LLM辅助同行评审与长期科学影响
提出ReviewGuard框架,将对齐LLM评审与长期引文影响,相关性0.776,优于人类,识别高影响力被拒论文提升5.6倍。
不可移除的安全内核:面向AI代理及其他可逃逸AI系统的运行时AI对齐
提出不可移除安全内核,通过进程分离、事前强制等四大属性实现运行时AI对齐,形式化验证确保无逃逸。
打破蒸馏防御意味着什么?
提出黑盒LLM蒸馏防御的三维威胁模型,强调防御有效性取决于攻击者能力设定,需明确压力测试。
保护隐私的联邦张量分解在单细胞免疫数据中的应用:跨机构恢复多细胞程序
提出联邦张量分解方法,跨机构恢复多细胞免疫程序,性能接近集中式,无需共享细胞数据。
病理语音评估模型对声学特征的认知:口腔及口咽癌患者案例研究
研究发现模型表征与频谱、韵律特征高度相关,其中MFCC系数最强,为病理语音评估特征选择提供实用指导。
思考Token是否有助于安全性?
研究发现推理模型的思考Token未真正提升安全审慎,最终决策在思考前已被预测,思考过程实为前缀补全。
BCoughBench: 在体耦合可穿戴传感器条件下对呼吸声学基础模型进行基准测试
体耦合传感器致呼吸模型性能下降,性别分类崩溃,年龄回归稳健,无模型达临床阈值。
衡量数据质量指标、人类判断与土地覆盖分割性能在地球观测中的对齐
现有质量指标与人类感知和下游性能严重脱节,评估应基于任务表现和人工评价。
通信性启发的位置编码(CIPE)
CIPE利用通信性定义注意力兼容几何,提升图Transformer性能35.5%。
SoK:AI安全代码生成的进展、陷阱与前进之路
提出三层次框架评估AI安全代码生成,发现原则理解预测代码安全但存在知识-执行差距。
通过任务导向的随机化稳定黑盒算法
提出任务导向随机化稳定黑盒算法,提供稳定性保证与探索权衡分析,经仿真和真实数据验证有效。
面向智能可再生能源电网网络安全的混合CNN-LSTM入侵检测框架
提出混合CNN-LSTM入侵检测框架,融合空间与时序建模,在CICIDS2017和NSL-KDD上精度达96.1%-98.2%,实时吞吐量27800流/秒,可部署于资源受限设备。
UC-Search:面向延迟约束时间序列控制的风险感知测试时搜索
UC-Search是模型无关的测试时搜索,通过风险调整和可行性约束,在延迟控制中优于CEM、MPPI等基线。
解耦侦察与利用:衡量基于LLM的Web渗透测试的能力边界
提出解耦评估框架分离侦察与利用,发现准确上下文下成功率达90%,自主侦察仅约50%,揭示能力差距。
语音基础模型的监督后训练用于深度伪造检测的鲁棒适应
提出混合帧后训练策略,利用帧级监督学习局部不一致,实现ASVspoof5等错误率4.50%及跨失真鲁棒平衡。