超越代码生成:智能体软件开发周期中的可靠性、验证与成本经济
AI编码从自动补全转向智能体,瓶颈转为交付可靠软件,需控制验证成本与自主性。
生成式AI中的解释何时算确立?——解释的形成、评估与责任
生成式AI通过局部检查不等于解释已确立,需关注过程可追溯性、评估契约及责任,提出延迟闭合与五项公开要求。
PRISM-Bench:以音频为中心的文本到音视频生成诊断基准
首个音频中心文生音视频诊断基准,双轴分解评估,揭示模型重感知轻控制,音乐与幕内同步音频生成薄弱。
PeroMAS:钙钛矿材料发现的多智能体系统
提出钙钛矿发现多智能体系统PeroMAS,封装专用工具,覆盖检索到分析全流程,经实证显著提升发现效率并成功合成验证。
去中心化视觉自主空中野生动物监测
提出去中心化多无人机视觉监测系统,仅用单目相机,低带宽可扩展,无需中央通信,实测验证野外可靠跟踪。
衡量计算机使用代理的危害性
提出CUAHarm基准,评估智能体恶意操作风险,前沿模型执行率高,新模型风险更大,监控难度大。
进化卓越:基于LLM的代理自动化优化
提出ARTEMIS无代码进化平台,联合优化大模型代理配置,在编程、代码优化等任务中显著提升性能并降低成本。
混合数据聚类综述与挑战
大数据下混合数据聚类困难,传统算法失效;提出基于预拓扑空间的可解释聚类法,对比经典算法验证有效性。
温度缩放攻击:破坏联邦学习中的模型置信度
温度缩放攻击保持精度但破坏校准,显著增大校准误差而精度几乎不变,揭示校准是联邦学习关键攻击面。
F-GRPO:勿让策略只学常见、遗忘稀有
提出F-GRPO,用焦点损失式难度感知系数,缓解小组采样中稀有正确轨迹被忽略,提升数学推理性能。
FADTI:傅里叶与注意力驱动的多变量时间序列插补扩散
提出傅里叶与注意力驱动的扩散插补模型,通过频率偏置投影到多尺度频谱,提升时序插补精度与采样效率。
基于预训练扩散先验的成像逆问题后验动力学框架
提出后验动态框架,用预训练扩散先验求解成像逆问题,构建显式后验路径及高效采样器。
超越可复现性:迈向安全感知的研究工件评估
分析1388个安全会议工件提出SAFE框架准确率94.4%补充可复现性评估促进安全共享
基于LLM的测试预言:权威来源分类法——一项系统性文献综述
系统综述发现,过半大语言模型测试预言无规范依据;权威来源定可信度,质量多凭相似性非查错率评判。
使用金丝雀令牌识别AI网络爬虫
用金丝雀令牌识别AI爬虫:向爬虫发唯一令牌,再让大模型输出,含令牌即证来源。实验识别多个未公开爬虫。
生成式AI在信息系统中的全景:二级综述综合与研究议程
综述28篇论文,分析生成式AI在信息系统中的效益与挑战,提出人机协同、适应性治理等研究议程,强调技术与社会的协调优化。
中文标题
受控企业分析:语言模型解释问题,策略选择预批准程序。330次运行规划未达完整契约,策略执行110次全部达标。
用于加速工具使用智能体的推测性宏提交
提出推测性宏提交(SMC),以快速草稿模型预执行动作链并提交,较基线降低延迟10.23%~44.9%,保持准确率。
新鲜记忆,陈旧计划:面向分布式LLM智能体的依赖范围校验
PlanFence协议按依赖范围校验动作合法性:仅验证影响待执行动作的记录,必要时重规划或阻止。30例验证中,传统只查新鲜度全部执行旧计划,PlanFence零无效动作。
人工智能驱动的新型实用英语教材的结构与实现
提出人工智能驱动的实用英语教材五层架构;经186名本科生试验,完成准确率升至84.9%,口语提10.8分,教师批改时间减31.6%
GPS-Bench:自动化政策分析的治理政策基准
GPS基准是基于证据的治理模拟基准,连接政策、行为者与后果,用于比较多智能体等方法,发现微调预测最强,分解补充机制。
GrowPage:面向高效LLM推理服务的按需KV预算管理
GrowPage按需动态分配KV缓存,利用双时间尺度摘要估计需求,压缩或增页,显著优化推理性能与吞吐量。
让每一次工具调用都算数:为智能体视觉语言模型设置必要工具证据路径奖励
提出NTEP奖励机制,监督智能体视觉语言模型的工具调用,确保每次调用获取必要证据,减少冗余,提升准确率和工具效率。
NeoRed:面向新生儿呼吸疾病诊断的知识-逻辑-对齐多模态大语言模型
提出新生儿呼吸疾病多模态大模型NeoRed,用知识-逻辑-对齐框架提升诊断报告生成准确率,性能优于现有模型。
Dalek:一种构造性智能体机器
Dalek是封闭智能体机器,基于原语与义务,融合自繁殖核心,以大语言模型和编译器实现自维护、进化、繁殖与组织。
文化菜单基准:探究多模态烹饪推理中的知识应用差距
提出文化菜单基准,揭示多模态模型视觉识别强但菜品文化归因弱,知识无法通过视觉激活。
PPO-STGNN:云边端计算中基于近端策略优化与时空图神经网络的DAG任务调度方法
提出将PPO与时空图神经网络结合的DAG调度算法,优化完工时间和负载均衡,多教师预训练加速收敛。
HalluPeer:基于分类法的科学同行评审幻觉检测基准
提出检测科学评审幻觉的基准HalluPeer,含论文、评审及注入幻觉数据,现有检测器难以区分幻觉与真实批评。
KC-Bench:面向LLM智能体知识冲突评估的动态交互基准
提出KC-Bench多轮基准,含238个筛选任务,评测9模型处理知识冲突、输入矛盾及时间冲突能力,发现无模型全面可靠。
音视频模型中的注意力三角
音视频扩散模型跨模态注意力导致语义泄漏,注意力三角揭示偏置驱动的双向路由,可用于诊断干预,提升一致性。
小型Transformer中对比代码表示学习的合成语义监督:实证研究
用合成自然语言监督训练小型代码编码器,5/8任务优于同规模基线,微调后可匹敌大模型。
物理实验室的可计算表示实现可验证工作流
物理实验室可计算表示通过类型化对象能力绑定操作和组合工作流代数实现可验证流程为端到端自主科学发现奠基
重新思考面向安全关键具身系统的世界模型
世界模型需从预测转向风险导向,整合反事实推理与安全记忆,识别关键后果,决定何时行动或弃权。
STAIR(结构感知信息检索器):用于文档结构增强的新型数据集与基于LLM的检索器
提出STAIR系统,利用目录结构增强检索,减少幻觉(<0.05%),构建SearchTome基准,Recall@1达82.6%,显著优于现有方法。
治理模型,而非仅治理数据:创意AI中的存储、流通与学习
联邦学习非隐私万能药;需治理模型而非仅数据,让创作者在存储、流通、学习中拥有主权。
Transfiver:通过共享可编辑状态实现人机协同推理
提出共享可编辑状态架构,模型与人共同更新同一状态,实现透明可核查的人机协同推理。
SVG-Score:文本到SVG生成的人类对齐评估
提出SVG-Score人类对齐评估框架,构建语义对齐数据集与双评估器(CLIP和VLM),用于评测文本生成SVG的忠实度。
语义贝叶斯世界模型
针对知识图谱与概率推理的割裂,提出以本体约束先验、贝叶斯更新信念的共享演化世界模型。
适应不断变化的需求:面向零售供应链运营的智能体AI
提出图约束智能体框架,联合选择干预路径与模块改动,提升零售供应链需求适配正确性,端到端成功率由72-76%升至79-83%。
DNative-Twin:面向可重构智能体决策的决策图与数字孪生
提出DNative-Twin:决策图与数字孪生重放智能体决策;重放上下文和验证证据可解未观测状态歧义,召回升至1.0。
CauseCollab:用于异构协同感知的因果统一与模态无关网络
提出因果统一模态无关网络,解耦语义与模态混杂因素,保证跨模态一致;新增模态只需小适配器,性能领先。
Bioinfoysis技术报告
提出持久化工件驱动的多智能体系统,通过计划重规划与证据绑定,在生物信息学任务上大幅提升准确率。
小米-TabLDM:表格基础模型技术报告
小米表格基础模型基于结构因果模型合成数据预训练,通过上下文学习实现分类回归,无需微调且计算高效。
面向反事实图像审计的共同见证证书与最紧特征界
提出共同见证度与见证复形,形式化反事实图像编辑的局部全局失效,分离审计与因果识别,得到特征紧界与修复计数。
面向智能体AI系统的价值保持架构
探讨智能体及多智能体系统的架构设计如何维护隐私、公平、安全等人类价值,提出三类模式及用例,奠定可信设计基础。