Gricea:面向对话式AI研究的开放科学平台
Gricea将对话式AI研究转化为可配置、可部署、可复用的研究制品,支持复现、共享与扩展,促进开放科学下的知识累积。
面向个性化睡眠支持的智能体式即时自适应干预系统:基于单被试(N=1)数据的概念验证研究
智能体睡眠即时自适应干预系统概念验证:自动审查30天数据并调整提醒,每日限三条,展示技术可行性。
Touvigation:面向盲人与低视力用户在陌生室内环境的具身自适应物体获取
Touvigation融合视觉语言理解与持久空间建模,为盲人提供低延迟具身导航,12人测试成功率100%,优于多模态助手与无辅助搜索。
CIPL:面向 LLM 智能体中可恢复隐私泄露的通道感知框架
CIPL:通道感知黑盒框架,评估 LLM 智能体隐私泄露,发现存储标签不等于可恢复,泄露受观察面与检索深度影响。
失败的机器人何时该求助?基于审计传感器证据发起纠正性人机对话
机器人失败时应自诊断、换传感器还是问人?决策应依据实测传感器证据与成本,而非模型自信。
面向LLM智能体可控观点动力学的贝叶斯信念层
提出BCA信念层,分离信念与表达,以κ编码固执度,可复现共识、分歧与少数派影响,并支持审计。
Collab-Solver:面向混合整数线性规划的协同求解策略学习
提出多智能体协同策略学习框架,将割选择与分支建模为斯塔克尔伯格博弈,提升混合整数规划求解效率与泛化性。
事实锚定注意力:通过注意力层知识集成消除大语言模型幻觉
提出事实锚定注意力,将可验证知识注入注意力机制,彻底消除大模型幻觉,准确率达99.7%,秒级更新且无需重训。
超越最终答案:面向透明多模态推理评估的 CRYSTAL 基准
提出CRYSTAL基准与匹配F1指标,揭示多模态模型推理过程的系统性缺陷,并以因果过程奖励与课程训练提升推理。
论大语言模型在概念数据库建模中的局限性
分析大语言模型自动生成ER图,发现需求越复杂,其可靠性越低,当前尚不成熟,验证成本或抵消收益。
面向算法设计的带可执行学习算子的可迁移知识图谱
提出GEAKG,将算法设计知识表示为可执行可迁移图;权重族内迁移、结构跨域迁移,离线复用,无需运行时模型调用。
深度学习增强的基于单收发对的实时Wi-Fi感知
单对收发器实现实时Wi-Fi感知,深度学习借先验与时序信息提升精度,姿态误差0.22米,定位0.61米,实时42帧。
BEAT-Net:注入仿生时空先验的可解释心电图诊断
提出BEAT-Net,以QRS生物分词和仿生分层架构模拟医生流程,参数减95%,仅用35%数据达CNN性能,可解释且泛化强。
大型语言模型是香农有损压缩器,而非所罗门诺夫归纳估计器:没有符号模型合成,奇点不会临近
大模型为香农有损压缩器,非所罗门诺夫归纳;增算力难改原则,唯符号模型合成方近奇点。
理解聚合物基础模型中的结构表示
提出含架构与连接信息的SMILES聚合物图表示CPG,在30项性质基准表现优异,并揭示表示扰动鲁棒性与盲点。
HERMES:面向长尾自动驾驶的 holistic 端到端风险感知多模态具身系统与视觉语言模型
提出HERMES风险感知端到端多模态驾驶框架,融合长尾语义与三模态信息优化轨迹规划,在长尾场景中显著提升安全性。
从对比视角重新审视带可验证奖励的强化学习
从对比视角重构GRPO,提出ConSPO,以序列对数概率对比正负轨迹,提升推理基准表现。
训练前的表示:生成式医疗事件模型标记化的实用基准
基准测试生成式医疗事件分词:码值融合提升预测,CLIF更短且多数更优。
约束衰减:LLM智能体在后端代码生成中的脆弱性
LLM智能体后端生成中,结构约束累积会致性能大幅下降(约束衰减),重约定框架更差,数据层缺陷为主因。
扩散模型训练中的临界慢化
研究揭示扩散模型训练存在临界慢化,两层架构可将训练时间由二次降为对数增长。
目标的句法与语义
本文把目标视为可组合的表征,借句法—语义接口刻画其表达力、设计与效率,勾勒目标表征的设计空间。
我们对大语言模型有何期待?LLM基准设计的全景映射
梳理14767篇LLM评测论文:基准转向行动、交互与专业应用,LLM参与评分渐增,引发评测独立性质疑。
BioPhys-Bridge:面向以物理为基础的生物学研究的跨学科科学推理基准
提出生物物理文献跨学科推理基准,含500案例、1517任务,评测证据溯源与多步科学推理。
立场:是时候用自进化的操作系统层来虚拟化基础模型了
主张构建基础模型操作系统FMOS,虚拟化模型交互,统管记忆、调度与安全校验,并自进化学习干预时机。
对会话式LLM智能体网络搜索的刻画:从搜索决策与策略到结果与响应
首个跨四大平台研究智能体搜索:决策与查询策略各异,频繁搜索未必提质,结果有平台偏好,部分结论缺引用。
AI 智能体理解计算机体系结构吗?
将同一加速器空间以命名架构参数与匿名变量分别交给同一智能体,前者性能高12.3%、调用少70.1%。
闭世界解析:对抗LLM智能体中的工具幻觉
提出工具幻觉分类与免训练闭世界解析器,证明防御须先于门控;实测322例幻觉,MCP再曝154例,规模无益。
MAGS:多智能体自动形式化保障智能体输出安全
MAGS多智能体框架借Dafny形式化验证,自动生成带安全保证的可执行程序,220个任务全部成功。
超越接口的安全:通过大语言模型潜在状态检测有害内容
提取LLaMA-3.1-8B激活训练轻量MLP探针检测有害提示,F1达99%/83%/84%,媲美千倍大模型且降低成本。
LLM 作为改进者:将验证转化为更优候选
提出VRR框架,用验证反馈修复并重选候选,突破固定候选池限制,提升代码生成与推理表现。
长时程智能体架构:层级、时钟节拍与级联智能
长时程智能体需持续运行而不遗忘;架构含时间尺度分层、时钟节拍与级联智能,十日内自主复现强化学习结果
QVAC Genesis III:面向高效语言模型预训练的大规模、高质量开放合成STEM语料库
发布191.43B token STEM合成语料库,覆盖19领域,1.7B模型基准最高提升28.57%
面向可信大语言模型、智能体AI与多模态系统的统一评估框架
提出覆盖八大可信维度的统一评估框架,贯通输出、轨迹与跨模态评估,并加入元评估与安全覆盖机制。
EconSkills:面向实时经济数据的Web智能体技能迁移与检索研究
提出EconSkills技能库,将已验证轨迹提炼为参数化流程,验证经济数据Web技能可跨任务迁移与检索。
当招聘走向智能体中介:双智能体简历筛选中的准入与复现性评估
双智能体筛选提高通过率,但决策双向变化,且其独选案例的复现性较低。
通过快速树搜索实现自我改进
提出SIFT,用大模型裁判和快速树搜索实现样本高效自我改进,低资源超越现有编码自进化方法。
动态系统中的持续企业世界模型发现
智能体在动态企业系统中通过交互持续发现并修正业务规则,构建世界模型以预测动作效果。
SimLife:面向长时程人机协作的模式理解
SimLife模拟长期家庭生活,推出长上下文行为模式理解基准,发现现有模型缺乏规则推理,是具身智能体的瓶颈。
从意图到行动:车辆语音指令授权中的LLM安全性基准测试
构建202场景七类决策基准,评估车载语音LLM授权,最高对齐89.1%仍有误执行,需独立执行层。
抵达还是求解?用检查点交接归因智能体强化学习增益
提出检查点交接评估,无需重训,将RL终点收益拆为REACH与SOLVE,跨基准交互为正。
AutoData:面向预训练数据选择的智能体搜索
AutoData 以智能体搜索可执行算法选择预训练数据,自动发现特征交互,方案优于人工流程并可迁移提升 CORE。
FINSKILLOPS:面向SEC申报文件问答的自演化多智能体系统
FINSKILLOPS多智能体系统将SEC问答部署后改进转为受控技能维护;失败变限定补丁并经回归校验准入。六基准领先,正确率3.70→4.55,未纠错率20.0%→12.5%。
TorchCraft:通过逆向全原子结构预测器实现统一结合剂设计
TorchCraft 逆向全原子预测器优化序列,统一设计微蛋白、VHH、环肽及配体结合蛋白,多靶点验证成功。
整合病例报告中的知识:一种基于医学本体、带结构化摘要的多模态信息系统
构建基于医学本体的多模态病例报告系统,整合5万余篇病例的结构化摘要、图像与实体,辅助罕见病诊疗。
面向LLM智能体的双轴策略优化:贝叶斯反馈归因与轨迹质量归一化
提出BATON双轴策略优化框架,含贝叶斯反馈归因与轨迹质量归一化,在ALFWorld等任务上性能最优。
历史数据中的物理知识比在预测中施加物理约束更重要
提出物理信息循环神经网络,可预测不可观测物理变量,在12个真实数据集中5个上优于对比模型
从“这位用户是谁?”到“这笔消费意味着什么?”:面向银行规模的语义用户画像落地流水线
改为按消费模式而非按用户推理的三阶段流水线,在银行千万级用户规模部署,推理量降三个数量级。
并非所有AI智能体都平等:资源与性能动态刻画
分析三类AI智能体资源动态,揭示任务瓶颈,提出CPU与任务感知优化,延迟提升5.4倍、均降32%。
E-AVI:面向自动化视频面试的基于证据的多模态评估
E-AVI提取带时间戳的多模态证据,结合维度条件注意力评分,性能超越基线,并支持反馈与问答。
WiCleanData:通过分类体系精炼与约束执行保障Wikidata的类型一致性
Wikidata因协作易出现不一致和类型违规。WiCleanData用语言模型精炼分类、聚合简化约束并过滤事实,构建一致且无违规的知识图谱并公开。