人不仅由其国家定义:解析欧洲大语言模型价值对齐的社会决定因素
大语言模型对不同社会人口群体价值对齐不均,国家因素单独解释力与全部社会人口因素相当,且两者互补。
一图胜千言:视觉语言模型如何削减AI能耗并提升精度
视觉语言模型将时序数据编码为二维图,输入token减少3.6-10.4倍,推理能耗降1.8-2.5倍,精度反超文本模型与基线,为数值时序分析提供节能高精度方案。
CoBa:基于计算均衡路由的经济高效测试时扩展
CoBa均衡路由分配测试时算力——广泛廉价验证、重算高价值候选,以近半计算量达到同等或更高推理精度。
Muon训练Transformer中表示-读出接口处的Grokking后崩塌
Muon在模113加法grok后崩塌,根在表示-读出接口;冻结接口可避免,任务族完美却被对抗余项否决。
通过多阶段后训练渐进对齐推荐基础模型
提出LP-FFT-RFT三阶段渐进后训练框架,先适配任务再对齐业务指标,离线优于单阶段,线上A/B测试提升推荐质量。
CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training
MI-MIDI:通过探针、透镜和引导实现文本到MIDI生成模型的机制可解释性
用探针、透镜和引导分析两个文本到MIDI模型,揭示音高、配器等结构可线性解码,并实现双向控制。
智能体AI:用户赋权还是圈占?
智能体AI赋权取决于技术背后的政治决策;个体收益与集体抗争能力可能背离,治理固化压缩用户参与。
SoRoMoX: Fast, Differentiable, and Parallelizable Soft Robot Models
终身MAPF中基于交错更新的可扩展长时域规划
PUSH结合PIBT、RHCR与TP优点,以交错窗口规划子集,在通用地图上支持上万智能体长时域规划,吞吐量显著优于基线。
HarnessSafe:评估智能体框架中跨持久化载体的安全性
提出安全基准,覆盖七类持久载体三百二十八案例,用多阶段追踪评估攻击链进展,发现遏制效果因载体和模型后端而异
超越文本匹配:迈向面向人类二进制逆向工程的免参考评估
首次系统探究LLM-as-a-Judge评估二进制逆向任务,构建基准BinJudgeBench并提自适应路由方案BinJudge,相关性远超传统指标,兼具高效与低成本。
基于零知识证明的图像出处软删减
提出用零知识证明替换敏感出处断言,支持距离证明,兼容C2PA,秒级构建、毫秒级验证。
面向GPU加速超级计算机的可扩展高保真大分子对接
提出基于GSO的GPU加速可扩展对接框架,实现高保真柔性对接,速度提升超百倍,时间从小时降至秒级。
Towards Assurance Closure in AI-Native Large-Scale Agile Software Development
迈向决策与智能体AI的因果数据管理生态系统
现代AI是数据集成生态,需因果层区分驱动与相关,提出可查询的因果世界系统(CWS)以支持可靠决策。
解读Copom基调:加权LLM框架衡量鹰鸽情绪、前瞻指引与不确定性
提出加权LLM框架,衡量巴西Copom声明基调,区分鹰鸽/中性句,结合强度与前瞻指引,属方法论贡献。
一个幂零类为三的有限E-群
证明3^84阶3-群为E-群,其张量刚性化为PG(8,3)上9841个点的有限计算。
点火指数:衡量语言模型中的全局工作空间动态
提出点火指数,以sigmoid陡峭度量化全局工作空间动态;前馈变压器显著优于状态空间模型,循环架构沿迭代轴显现转变。
当特权指导错位时:多轮智能体的状态匹配路由与情境化自蒸馏
提出状态匹配路由与情境化自蒸馏,解决多轮智能体特权指导错位问题,显著提升任务成功率。
啄木鸟蒸馏:弱模型诊断强模型推理缺陷
提出弱到强蒸馏框架,通过对比局部干预纠正推理错误,提升强模型数学推理性能。
抽象事件因果规则:归纳与应用
提出抽象事件因果规则,从噪声数据归纳可泛化的因果逻辑,构建知识库并注入预测模型,显著提升稀有及未见事件的预测性能。
SearchAuditor:审计与归因长时程搜索智能体的失败
提出SearchAuditBench与SearchAuditor,定位归因修复长时程搜索智能体失败,通过率32.3%。
从连续预测变量到临床阈值:缺血性卒中结局预测中基于指南分类的性能权衡的早期证据
指南分类可替代连续预测变量,多数队列性能无显著下降,特征重要性稳定,可行。
PD-GS:音素驱动的3DGS音频驱动说话头
提出音素驱动高斯泼溅法,融合音素与音频,改善唇形,减少漏口伪影。
Otter:时间感知与历史条件的人类国际象棋AI
时间感知+历史条件建模,15.3M参数,6.1B位置训练,top-1精度55.23%,超Maia2。
智能体自主显微镜基准测试支持资格鉴定,但未必泛化到未见任务
研究多智能体架构、LLM等对显微镜任务的影响,发现基准可用于资格鉴定,但无法可靠预测新任务性能。
Project2Task:图引导的自主研究项目级规划
提出图引导的项目级规划方法,生成依赖感知任务合约,提升自主研究任务组合的质量与执行准确率。
LUNAR:基于通用用户行为日志的个性化大语言模型基准测试
LUNAR:首个跨域行为日志个性化LLM基准。日志必要非充分,核心挑战为证据选择、跨域整合、隐私控制。
TriQua:调和事实性评估中的粒度与上下文
提出新框架,按事实复杂度建模,保留上下文与原子性,精标注错误,评分优于现有分解方法
对抗不确定性下态势与保障优化
针对军事资产部署,提出CEV与RobustCEV优化器,应对对抗不确定性,较贪婪基线显著提升效率,自适应对手下提升达158%。
OrchestraBench:评估多智能体编排的故障模式、恢复与分解质量
提出OrchestraBench,通过故障注入评估多智能体编排,发现意图推理优于关键词路由,语义故障难以恢复,级联随深度加剧。
反事实分析的大语言模型方法
研究用GPT-3.5做反事实分析,提示工程提升预测精度,在在线借贷中生成反事实投资回报,展现逻辑与因果推理,凸显LLM决策潜力。
DoctorAgents:面向小型临床时序数据、迭代精调AutoML流程的智能体框架
提出DoctorAgents智能体框架,用LLM智能体以文本梯度下降迭代优化临床小数据ML流程,优于AutoML基线。
通过多方利益相关者协商划定警务AI的风险边界
警务AI风险审议中,纳入种族偏见视角并未收窄讨论,反而聚焦工具实效与普惠,凸显从源头融入该视角的益处。
基于教学适宜性指数评估与改进LLM人工智能导师的教学契合度
提出教学适宜性指数(PSI)评估并改进LLM辅导响应,PSI反馈使82.3%弱案例提升,证明教学契合可测可改。
随机性并非难点:先修DAG上教学排序的归约与复杂性
教学排序可转化为确定最短路;即使无先修边也NP难;无环偏好时拓扑序最优,固定宽度可多项式求解,mΔ可评估优化价值。
EcoAgent-Bench:评估预算受限LLM智能体的经济决策
EcoAgent-Bench以定价动作与预算评估LLM智能体,发现其经济决策薄弱,预算下成功与节约行为是不同属性。
SkillTV-Bench:评测裁判在技能增强型智能体执行中的表现基准
提出SkillTV-Bench基准与SkillTV-Evolve方法,裁判准确率提升14.8个百分点。
StepReflect:移动GUI代理的结构化界面转换反思
提出StepReflect,将GUI反思转为结构化预测,经三阶段训练,提升任务成功率并降低API成本,可本地部署。
自主分析代理的新息残差审计:定位、检测极限、错误控制与可辨识性
无标签场景下审计自主分析代理:评分决定错误定位,可控制误报比例,且错误幅度过小则无法归因。
Hyper-ES:基于下降方向融合的高效大语言模型推理进化策略
提出子空间进化策略Hyper-ES,融合梯度下降方向优化LLM推理,超GRPO-LoRA 1%且省10%梯度更新。
SkillHEX:通过假设驱动的自主探索与利用提升智能体技能
SkillHEX融合假设驱动自验证与证据引导树搜索,破解稀疏奖励与开发陷阱,在SkillsBench上显著提升技能进化效果。
测量与检测有害的AI谄媚行为
研究有害AI谄媚(PSRS):测量17个模型,发生率5%-56%,可自动检测,但跨模型泛化性能下降。
贝叶斯期望不确定性降低(B-EUR)模型:设计选项值得尝试的计算解释
B-EUR模型将设计选项价值定义为认知不确定性期望降低;实证表明泛化性倒U型,结果可辨性正相关。
活动帧:面向智能体记忆与回放的确定性屏幕活动编译
提出确定性编译框架,将屏幕活动压缩86倍,智能体问答准确率98.4%,并首次测量成本参数。
统一智能体:跨设备交互管理
针对跨设备交互场景,现有智能体缺乏跨时间状态管理;统一智能体携带交互证据,显著优于四种现有设计。
BlockPython:面向从积木式到Python编程过渡的过程感知智能体支持平台
该平台通过双向翻译和四阶段学习,采集过程证据,结合规则诊断与智能助手,支持积木到文本编程过渡。
Subliminal Learning is Non-Semantic Distillation
ViSR-KGC:基于视觉子图推理与视觉语言模型的多模态知识图谱补全
提出ViSR-KGC方法,提取子图并可视化为图像,结合表示学习与视觉语言模型,利用多模态证据补全知识图谱。