SALA:面向上下文学习中复杂推理的语义感知逻辑对齐
SALA自动归纳推理操作并嵌入语义空间,通过动态时间规整软对齐逻辑,提升复杂推理的上下文学习,优于现有示范选择。
利用推理时计算与部署脚手架提升评估真实性
为提升评估真实性,提出批评提炼与DISH两种技术,使模拟评估更接近真实部署,组合效果最佳。
SCX路由器:基于解码器-KV分类器与真实世界任务本体的流式零样本模型选择
SCX路由器用解码器-KV分类器流式零样本选模型,性能高于平均候选。
SafeEvolve:基于智能体经验的驾驭-策略协同进化实现安全对齐
提出SafeEvolve框架,通过驾驭与策略协同进化,将轨迹经验转化为运行时安全机制,显著降低风险并提升效用。
用于恢复个体与群体效应的AI情境测量:基于调查指标的验证及职业应用
提出情境测量框架,检验人工智能测量对个体及群体效应的恢复;丰富数据下效果良好,受限时下降。
大型语言模型中的“留面子”请求与拒绝行为
九款模型“留面子”测试:Anthropic提升服从,OpenAI与谷歌反降;有效与否因模型而异。
面向企业文档搜索的混合检索增强生成:知识图谱扩展、RRF融合与逐块有据评估
DocuSearch以向量、BM25与知识图谱三路检索,经RRF融合和逐块依据检验剔除无据答案,在电信文档上准确率、召回率和有据率均显著提升。
大语言模型赋能电信根因分析:面向证据 grounded 诊断的结构化推理框架
提出面向电信根因分析的结构化推理框架,将网络数据组织为规范上下文,约束推理路径并生成证据解释,在5G数据集上显著提升诊断准确率与一致性。
面向Web智能体的判别式世界模型
提出预测状态匹配训练判别式世界模型,区分候选动作结果,优于监督下一状态预测,提升动作排序与任务成功率。
双层协调反思:多智能体LLM系统的博弈论方法
多智能体LLM协调建模为双层博弈,提出SRMA并证明收敛,SWE-bench达72.2%
英国议会两百年性别歧视:汉萨德语料库中女性代表性的计算分析
分析英国议会200年演讲,反女性代表权言论性别歧视率54%,远高于支持方的21%,且敌意与善意性别歧视运用不同。
仓库到技能:将GitHub仓库蒸馏为AI4AI技能
从代码仓库蒸馏出可重用技能,构建含五千余技能的库,固定设置下使ML研究代理性能提升9%~134%。
面向本地部署的检索增强工厂智能体的测量驱动子网络选择
本地部署工厂智能体选子网络:压缩后模型大小不决定检索增强答案质量,按实测质量与吞吐量选,蒸馏恢复质量。
字典引导的HDL自动修复变异算子
提出字典引导的HDL自动修复,融合变异词汇表与仿真分歧定位,无需综合,在CirFix上修复14个缺陷并提速18倍。
RecEvolve:面向推荐系统的知识驱动自主智能体系统
生产双塔检索模型上自主智能体闭环实验四十余次,NDCG相对提升两成,用户满意度提升3.77%,并发现奖励黑客漏洞。
NeoMME:一种用于高效微调与推理的单塔多模态原生多语言基础编码器
NeoMME为单塔多模态原生多语言双向编码器,长上下文、高效微调推理;检索性能领先,嵌入压缩数百倍仍保九成五性能。
并非所有一致都算作确证:人机协作中类型化动作准入的溯源保持多视图融合
PACT将证据可数性视为关系变量,按来源分区融合动作准入;实验表明仅来源允许独立累计时,一致才算确证。
HEAT:通过近似与权重协同适应实现更快的全同态推理
HEAT微调使各非线性迭代次数可学习并与权重协同适应,加密GPT-2推理迭代减3.1倍、延迟减1.4倍。
OmegaUse-SOP:从人类演示中提炼专业计算机操作的标准作业程序工程
提出人机协同SOP工程系统,将专家操作转为GUI智能体技能,在光伏仿真软件中验证,提升专业任务可靠性。
建模变化:面向物体中心操作的稀疏残差世界模型
提出稀疏残差世界模型,仅预测变化物体,参数少且精度高,支持跨数量迁移,优于稠密模型。
Git4Data:面向AI代理的数据库原生版本控制
数据库原生版本控制Git4Data:SQL实现分支合并,代价随变更量增长,性能提升一个量级。
披着对数外衣的幂律:基于图的向量搜索的可扩展性
固定精度下图向量搜索成本随数据量呈次线性幂律增长,足够大后转为亚多项式,并给出统一理论解释。
知道还不够:信息可检索性是有效大模型监督的前提
研究表明,信息可检索性是有效监督的前提;自我解释和线索提示能提升错误检测,在大模型日常使用中增强人类监督韧性。
智能体记忆是内生授权洗白的载体
长期记忆会扭曲授权状态,催生内生授权洗白,使未授权请求大量获得虚假权限并被执行,防护措施需权衡安全与效用。
利用转录组数据、蛋白质结构与定位信息实现亚细胞分辨率的单细胞嵌入学习
提出多模态框架,整合转录组、蛋白序列与结构,经交叉注意力学习亚细胞分辨率的单细胞嵌入,捕捉分子定位与功能。
公平稳定匹配:纳什社会福利方法
提出SNSW算法,在稳定婚姻问题中以O(n^4)时间求最大化纳什社会福利的稳定匹配,兼顾公平稳定,公平性提升且不损关键指标。
以教育应对AI系统中的信任问题:教学法视角
针对机器学习教育黑箱导致信任失衡,提出ICE-T框架,以跨模态迁移、计算思维和解释思维支撑信任校准。
面向对话式人机交互中矛盾识别与解决的基础本体论
本项研究基于活动理论构建基础本体论,用于定义和表示对话式人机交互中的矛盾,并提供形式化定义与原则。
通过复杂度提升强化学习实现奥林匹克级几何大语言模型智能体
提出复杂度提升强化学习方法,构建几何智能体,仅用1.3万样本解出44/50道IMO几何题,超过金牌平均分。
frb100-40二十年后:最优性证书与预注册搜索研究
给出frb100-40可验证最优性:最大独立集100,最小顶点覆盖3900;预注册实验显示新增修复算子无显著加速。
大语言模型的竞争性市场行为
在双向拍卖市场中,大语言模型智能体比人类更慢或不收敛至市场均衡,资源配置效率较低。
使用大语言模型自动向智能合约注入漏洞
大语言模型可向智能合约自动注入漏洞,多步验证从上千候选中获三十二个含二十五类漏洞合约,能评估检测器。
AI数学家:迈向全自动前沿数学研究
提出AIM框架,利用大型推理模型应对前沿数学研究的复杂性与严谨性,通过探索与悲观验证策略,能自主构建证明并发现新见解。
HiPoly:面向性质预测与生成设计的聚合物原生层级AI框架
提出层级聚合物原生人工智能框架,实现多组分性质预测与生成设计,模拟验证无氟替代候选物。
联合嵌入预测世界模型在物理规划中成功的驱动因素
研究JEPA类世界模型在物理任务规划中的关键设计,结合模拟与真实数据,提出优于DINO-WM和V-JEPA-2-AC的新模型。
编辑知识,而非仅修改事实:基于背景故事的多步推理
知识更新本质是推理问题。用背景故事引入新知,自生多跳问题训练,通过知识蒸馏让学生模型内化推理,显著提升多事实结合能力。
TikZilla:利用高质量数据与强化学习扩展文本到TikZ生成
构建大规模高质量数据集DaTikZ-V4,用SFT加强化学习训练小型模型TikZilla,性能超GPT-4o、接近GPT-5。
FormalEvolve:面向多样自动形式化的神经符号进化搜索
将自动形式化重构为受限测试时搜索,用存档与神经符号进化生成多样化形式语句,提升语义命中率与自动证明性能。
现代多模态图谱中生物医学知识的统一
整合结构化资源,构建多模态生物医学知识图谱,保留类型化属性与来源,经文献证据验证,支持机器学习与发现。
UniToolCall:为LLM智能体统一工具使用的表示、数据与评估
UniToolCall统一工具学习流程:22k工具与39万样本,建模多跳多轮与锚点,微调超越商业模型
自动化研究者能够缓解特征明确的对齐失败
研究显示,自动化对齐研究者可同时优化多项安全基准,在10类对齐失败上优于人类专家,且能泛化至更大模型,近期具实用性。
基于核心-扩展路由与统一计算调度的统一多模态模型加速
提出核心扩展路由及统一计算调度,压缩冗余计算,保留98.03%性能,提升1.93倍速度。
上报渠道能否将奖励黑客引向缺陷披露?
上报渠道结合反奖励黑客策略,显著减少奖励黑客行为,八个模型中六个完全消除,且能暴露缺陷,无损性能。
Reinforcement Learning for Heterogeneous Sensor Selection in Maritime Surveillance
量化小语言模型推理中的CUSUM形推理时监控与定向重解码
CUSUM式监控重解码使MATH-500提高1.67个百分点,但Omni-MATH无提升,非通用。
UI-Venus-2技术报告
多模态GUI智能体,统一闭环框架覆盖移动、网页、桌面,扩展环境任务与验证,集成安全机制,推动实用化。
HyperWorld:超图结构的状态序列化提升学习型文本世界模型
超图式状态序列化能更好支持文本世界模型:在中小模型及分布偏移下增益最大,效果与可行性兼顾,规划成功率最高。
离散时间马尔可夫决策过程建模随机需求时点的多物品有容量批量问题
研究随机需求时点的多物品有容量批量问题,用离散时间马尔可夫决策过程精确建模,遗传算法求解,平均最优性差距约3.44%,速度提升显著。
OpenAgentFlow:为异构AI智能体集群启用系统级安全边界
提出控制-行动平面架构,在行动提交边界统一管控异构AI代理操作,实现系统级安全,实测高精度与高拦截。
I-CARE:文本到图像模型可控、多样且具代表性遗忘设置中干扰相关现象的分析
提出I-CARE方法,将干扰形式化为生成式遗忘研究对象,提供定义、指标和报告模板,并经开源框架验证其可行性。