从对齐到访问控制:生成式AI策略执行框架
生成式AI安全机制滞后致事故频发,本文系统剖析策略执行现状,提出分析方法并呼吁改进。
基于影像组学条件调制的 RenalCLIP 特征用于透明细胞肾细胞癌分类
以影像组学经 FiLM 调制 RenalCLIP 特征并保留直接残差,提升透明细胞肾细胞癌 CT 分类的内外部 AUC。
TraceVIC:基于代码演化因果推理识别漏洞引入提交
TraceVIC用时间图因果推理代码演化,追踪根因代码历史并排序漏洞引入提交;F2最多提升28.7%,79个漏洞中识别78个有效VIC。
塞壬之歌:当近端背景语境盖过远处证据
近邻陷阱:远端证据被近端无关背景淹没;LYRA重分配注意力提升长上下文表现,发布ProxBench。
基于LLM的代码漏洞修复中的指标失效:实证研究与变更感知筛选
编译率不可靠,多由评测环境与数据假象决定,与修复质量脱钩;提出变更感知筛选diff_F1,主张基于执行的评估。
AI 能否为产品设计节省时间?一项针对 AI“提示词到设计”工作流的随机对照实验
随机对照实验显示,Figma Make 使设计任务完成时间缩短约20%,产品经理受益更大。
Glucose-ML:用于开发鲁棒AI解决方案的纵向糖尿病数据集合集
发布Glucose-ML合集,含10个公开纵向糖尿病CGM数据集,覆盖多国多类人群,建立血糖预测基准,助力稳健AI开发。
SAGE:面向结构感知联想记忆的自演化智能体图记忆引擎
图记忆作为动态长期记忆,写者构建、读者检索反馈,自演化提升多跳问答与检索效率。
BixBench3:在科研级计算生物学任务上评测AI智能体
BixBench3评测AI智能体端到端完成计算生物学研究的能力:20项任务中前沿模型得分仅0.00–0.48,数据量越大、步骤越多,表现越差。
ScholarStack:面向科学智能体的分层研究资产编排与跨任务复用
该系统将论文集编译为分层可溯源研究资产,支持科学智能体跨任务复用,提升跨论文任务质量并降低查询开销。
多智能体大语言模型辩论究竟改变了什么?对分歧与答案质量的分层分析
多智能体辩论易改变智能体的表态,但缺乏持久立场变化与最终答案质量提升的证据。
重写而非仅蒸馏:面向持续视觉语言模型后训练的参考驱动修订
让模型以专家答案为参考修订自身错误轨迹,校验通过后微调,新任务提升56.9分且遗忘降低11.3倍。
知识库驱动的实体集分类扩展导航
知识库驱动的实体集分类扩展中,提出扩展图并形式化节点可比性推理,揭示复杂度边界,支持局部增量导航。
基于纠缠引导与代理约束缓解大语言模型遗忘中的过度遗忘
提出EGUP框架,用样本间/内纠缠动态调整遗忘强度,并以代理约束软正则化,缓解过度遗忘,改善遗忘-效用权衡。
ELEMENT:基于最大熵的分幕式与终身探索
提出 ELEMENT,融合终身与分幕熵最大化,用 kNN 图估计熵,提升状态覆盖与无监督预训练。
FedNIA:面向联邦学习数据投毒缓解的噪声诱导激活分析
提出FedNIA,无需中心测试集,注入噪声分析客户端激活,检测排除恶意客户端,抵御多种联邦学习投毒攻击。
激励与切割层选择如何影响拆分联邦学习中的数据贡献?
用Stackelberg博弈分析拆分联邦学习中激励与切割层选择对数据贡献的影响,均衡可最大化双方效用。
OV-MAP:面向机器人的开放词汇零样本3D实例分割地图
提出OV-MAP,融合开放特征与2D掩码投影,实现机器人零样本3D实例分割。
基于偏好向量的自适应有用性-无害性对齐
提出偏好向量框架,训练单项偏好模型,提取行为偏移并在测试时动态合并,实现可控可扩展的有用-无害对齐。
WebArxiv:面向arXiv任务的多模态网页智能体可复现评估基准
提出WebArxiv基准,含510个静态可复现任务,评估发现现有网页智能体在学术检索与推理上仍具挑战。
基于文本保持技术的微调大语言模型数据溯源审计
以不可见Unicode字符构建"线索—回复"标记,黑盒审计微调数据使用,0假阳性下真阳性率达96.7%。
动态生物相关环境中的实时自主磁性微型机器人导航
提出长程规划与短程反应控制闭环框架,实现磁性微型机器人在动态生物环境中实时自主导航。
基于分层约束的元模型引导模型生成
提出元模型引导的分层约束模型生成方法,协同生成时约束与生成后验证,在汽车电子实验中通过验收与校验。
STAR-VAE:面向可控分子生成的可扩展隐变量Transformer
STAR-VAE融合双向编码器与自回归解码器,经性质条件化与轻量微调,实现有效、新颖且可控的分子生成。
多模态大语言模型驱动的上下文感知无人机应急着陆点选择框架
提出融合遥感与多模态大模型的无人机应急着陆点评估框架,粗到细识别语义风险,构建ELSS基准。
辐射场引导预训练:利用无标签无线信号规模化定位模型
RFRP自监督预训练耦合定位大模型与射频辐射场,用无标签信号,定位误差降超40%。
用博弈论强化学习寻找接吻数
将接吻数问题转为合作矩阵补全博弈,用强化学习改进15个保持数十年的强界并发现新几何结构。
迈向教师与生成式人工智能的协同互动
提出教师—AI协作五层级框架,分析生成式AI对教师能力的替代、补充与增强,并展望二者协同决策。
迈向 AI×DB 工作负载的高效编排
将AI操作融入数据库引擎,统一编排关系与AI算子,协同优化、调度与缓存复用,NeurEngine原型验证性能优势。
通过几何性质发现数据流形几何
反向直接学习交换性、时间一致性与共同参考等几何性质,用无监督目标恢复数据流形切空间和全局结构。
预训练表征噪声线性探测中的谱过拟合
冻结预训练特征线性探测仍会谱过拟合噪声标签,中间PCA秩可恢复干净精度,宜作诊断。
模型作为AI原生MBSE的受治理接口:读侧充分性与写侧可准入性
论文以阿波罗11号模型为例,指出模型可读不足,提出读侧充分性、写侧可准入性的认知充分性架构与受治理查询框架。
参数化稠密-稀疏融合的混合检索:在 BEIR SciFact 上用 Qdrant 调优排序-分数混合
在SciFact上网格调优稠密-稀疏混合排序参数,最优配置nDCG@10达0.753,优于稠密BGE与等权RRF,系数需按数据集重调。
天王星:构建面向具身智能的下一代仿真基础设施
以关节轨迹为条件的自回归扩散仿真器,支持流式无限推演、24FPS生成与多本体多视角统一控制。
当LLM智能体读不懂“气氛”:面向关系型社交推理的ReAdapt
ReAdapt为LLM智能体引入显式社交状态与Adapt修正步骤,使其依据关系证据调整决策,显著提升社交推理表现。
Ovis-Embedding:推动通用全模态嵌入的前沿
提出Ovis-Embedding全模态嵌入模型,统一文本、图像、视频与音频,在多项基准上达到最优。
现有预条件器能否提升生物医学表格基础模型学习?——基于 TabPFN 优化的实证研究
在59个生物医学数据集上评测五种AdamW预条件策略微调TabPFN v2.5,发现原始AdamW表现最优,现有曲率感知预条件器无稳定提升。
4DGS-JEPA:面向动态高斯泼溅的时序组合式联合嵌入预测
提出4DGS-JEPA,以时序组合联合嵌入预测动态高斯泼溅,支持多视野因果预测与递归推演。
Lean Pool:一个由 AI 维护的形式化数学档案库
Lean Pool 是形式化数学资源库,由 AI 智能体自主扩充、维护与优化。
面向胶质母细胞瘤(GBM)生存预测的准确且可解释超图神经网络
提出融合层超图、概念瓶颈与EST正则的多模态框架,用于GBM生存预测,兼顾准确与可解释。
MedGate-Fusion:融合首诊语义叙述与生理生物标志物的前瞻性卒中风险分层
多模态门控模型融合首诊叙事与10项生理标志物,基于CPCSSN十万余患者,实现五年卒中风险分层。
X-Planner:面向具身智能的事件结构化任务规划
提出X-Planner规划前端,统一具身推理监督与表示,支持离散事件与潜在思维链,实机执行优于基线。
注意力作为路由图:单次前向传播的实时电路提取
将注意力视为单次前向的路由图,保留通向答案的少量路由;消融这些边比随机消融更伤模型,成本极低。
ZeroGate:面向受治理 AI 智能体运行时的信任保持快速路径
ZeroGate分离审批与本地准入,用短时通行证和原子nonce实现可审计快速路径,但非净加速。
让智能体更一致:技能应为重复任务形成习惯
智能体重复任务不一致;提出技能习惯化:挖掘确定性技能门控复用,提升一致性、省词元,但错误亦稳定复现。
使用 Wiki LLM 索引提升机器学习课堂学习效果的潜力
对比同一课程语料,LLM 编译的维基索引在跨单元概念关联上明显优于向量 RAG,且可溯源引用。
从装饰性到承重性:任务难度塑造思维链的因果作用
思维链的承重性随任务难度变化:简单任务被绕过,困难任务中错误逐步传播,为思维链监督带来结构性挑战。
鲁棒失败,保守修复:从跨模型失败中进行文本知识蒸馏
提出RFCR蒸馏法,从跨模型失败中提取规则并收紧适用边界,在BBH上准确率提升2.75个百分点。
异构批处理的高效迭代检索
Orthrus在统一推理循环中异构批处理嵌入与生成,吞吐提升1.28–4.52倍,p99延迟降55.8%。
从离线代理到在线决策:对话式AI的分层参与度评估框架
提出分层离线代理框架,可实验前预测对话AI在线参与度;冻结后113组F1达81.1%,原始仅34.3%,无误判。