基于攻击链建模的邮件智能体提示注入检测
攻击链建模检测邮件智能体提示注入:融合文本检测、阶段验证与意图一致性;无害仿攻击邮件降误报,性能优于强基线。
DIAL:位置去偏且具备自适应人类偏好校准的LLM评审器
DIAL融合大量LLM比较与有限人类比较,分离位置效应、去偏并自适应校准至人类偏好,实现稳健对齐。
面向多缺失数据的鲁棒图聚类网络
提出RGCN,应对属性与结构同时缺失,借双分支插补、多超球混合先验与边界感知对比学习提升聚类。
ClearGS:面向手持视频的可靠性感知高斯泼溅
提出ClearGS,用可靠性感知视图分配与渲染引导视频内修复,无需清晰参考即从手持视频重建高质量3D高斯泼溅。
G2MAF:面向多智能体流策略的测试时梯度引导
G2MAF以全局归一化投影评论家梯度在测试时协调修正多智能体联合动作,保持可行且贴近冻结策略,多数任务提升。
分段级智能体主题建模:提升数据探索与资源效率
提出SeLATM,用分段级主题生成与智能体反馈精炼主题,在多数据集上性能更优且显著降低LLM资源消耗。
MA-WAM:面向测试时规划的多智能体世界-动作模型
首个多智能体流策略的测试时世界模型规划器,建模动作依赖并高效评估联合动作,离线MARL平均提升22%,仅增12.1毫秒。
PORL:面向作业车间调度问题的预训练离线强化学习
PORL先在线预训练,再以KL约束离线微调,用于作业车间调度,优于离线RL且更抗数据质量下降。
JevAdvBench:面向校准决策强化学习模型的基准与黑盒攻击
首个RLCD对抗基准,以自身干净决策为参照;未验证观点可翻转12.1%决策,使38%高置信答案跌破审查阈值。
面向编程智能体的紧凑文档:基准、优化器及其为何无法迁移
提出往返基准与优化器:保真度靠完整性而非长度;但跨模型十仓库显示,更好文档无法提升智能体解决真实问题的效果。
开放词汇域遗忘
提出开放词汇域遗忘(OVDU),用Fisher掩码与目标流形散射实现类无关遗忘,4样本超8样本基线。
迈向理解河谷型损失景观中的动量加速
河谷景观中,动量靠稳定大学习率、防偏离河道加速;极平坦慢旋河谷下,加速主要源于更大可允许学习率,而非动量本身。
可变对话记录:通过可编辑的会话状态缓解上下文污染
可变对话记录让用户用自然语言修订先前轮次,缓解上下文污染;用户研究显示其更清晰、更易用,减少重启对话。
Intent2Tc:基于语言模型的意图到流量控制自动转换
提出 Intent2Tc,用语言模型将业务意图转为可执行 Linux tc 配置,语义与配置精度高,RAG 降本提速。
正确的信息抽取流水线取决于文档类型:小型本地模型的精度—能耗权衡
批处理可降能耗38%—85%且不损精度;版式丰富文档宜用视觉语言模型,近纯文本宜用小型文本模型加廉价解析器。
学习气候模型中强迫对温度影响的分层因果表征
提出分层因果表征学习框架,分离内部变率与温室气体、气溶胶强迫响应,准确预测全球及区域温度演变。
高光谱视频压缩的隐式神经表示
隐式神经表示用于高光谱视频压缩,逐帧传统法PSNR增4.99dB、码率降88.88%,提升目标跟踪。
为何阿尔茨海默病语音筛查难以泛化:通过跨语料库证据锚定弥合部署鸿沟
四语料留一评估显示语音特征跨语料方向冲突,提出证据锚定融合,最差域AUC由0.504升至0.615。
从皮层区域视角看大语言模型中的层程序
复现PoLar:层块跳过与重复提升性能,但学得路由器单次推理退化为标准前向,通用程序少而脆弱。
物理信息神经网络的梯度手术
提出物理感知梯度手术PAM-GS,按冲突类型自适应缓解PINN任务干扰,提升精度与平衡性。
完成配对掩盖了封顶失败:选择性上下文投影的 ReVerPi 案例研究
仅看完成配对会掩盖失败:上下文投影省 25% 逻辑 token,却增加请求与开销,须保留所有边界并独立执行两臂。
Purin:一种受生物学启发的人工神经网络机制
提出生物启发且兼容ANN的Purin,以时间间隔抽象实现突触效能调制,无需离散时间步,提升CNN分类精度。
压缩所见而非所言:面向潜在观测软件工程智能体的锚定上下文蒸馏
LOHA分离压缩历史与精确文本,ACD蒸馏潜在读取并约束行为漂移,降低上下文、提升软件工程智能体效率。
从奖励信号到视觉效用:医学视觉语言模型后训练的受控审计
审计医学VLM后训练:准确率提升有限,视觉获益和图像敏感性反降,优化目标与有用视觉行为存在差距。
面向缓解虚假共识:多智能体辩论综合的主动溯源门控
提出主动溯源门控,事后核验并阻断无据主张,困难场景溯源保真度提升逾一倍,超75%用户偏好明确失败报告。
鲁棒后继特征
提出鲁棒后继特征,统一奖励与转移核泛化,给出GPI性能界并在网格基准验证。
诊断视觉-语言模型组合性失败的来源:一项受控分析
COMPASS受控分析发现:VLM组合失败中整合成本仅部分,各技能受自身负载拖累,交叉负载多有益,属多因素。
夸父:在十亿规模下将长用户行为压缩为理解
夸父在十亿规模逐条压用户行为至2-4 token,提吞吐、省GPU,线上GMV增1.37%。
KneePreM:面向三维膝关节MRI基础模型的大规模无标注预训练与标签高效微调
KneePreM为膝MRI三维自监督模型,经1.9万例无标注预训练,分类与分割的迁移性能及标签效率显著提升。
SatNav:基于卫星影像的可扩展长时程无人机视觉语言导航基准
提出基于卫星影像的可扩展长时程无人机视觉语言导航基准,涵盖18城11.8万回合,验证卫星到无人机迁移可行。
Google Play 用户评论情感指数的统计基础:信号融合、收缩、分布验证与动态平滑
构建Google Play评论统计情感指数:融合星级与文本,结合收缩、分布检验与卡尔曼滤波去噪,并给出数学证明。
PriceBench:面向LLM预订代理中价格、质量与品牌偏好的诊断基准
PriceBench用酒店预订任务诊断大模型的价格、质量与品牌偏好:能力只决定偏好一致性,须逐模型测量。
混合语言模型中的低比特循环状态
无需校准,格拉姆矩阵加权混合精度量化;4比特混合语言模型循环状态降低负对数似然差距,6比特逼近浮点基线。
ContraFM-S2O:基于流匹配与对比学习的一步式SAR到光学图像翻译模型
提出ContraFM-S2O,以流匹配和对比学习实现一步SAR到光学图像翻译,细节更优、推理更快,达SOTA。
视觉-语言-动作模型的线性表示假设
VLA中QoI随动力学演化,提出签名式线性表示假设,统一表示与策略,实现线性探测与引导。
OpenVAM:基于视觉语言模型的开放世界视觉注意力建模
提出OpenVAM框架,解耦视觉定位与VLM语义解释,跨域预测显著图并生成what/why解释。
两种用于自适应文档内 AI 文本筛查的共形构造
提出两种共形构造,用于自适应文档内 AI 文本筛查,控制误报并支持提前停止,效能待实证。
AxonSynth:面向光片显微镜零样本三维轴突分割的域随机化合成数据
AxonSynth以域随机化合成数据实现光片显微镜轴突零样本3D分割,无需真实标注。
LipSSM:基于相邻SSM层间度量传递的结构化Lipschitz有界级联状态空间模型
提出LipSSM:在级联状态空间层间迁移度量,获更紧Lipschitz界并建模长程依赖,理论实验验证
面向移动系统的元认知选择性集成
MetaSE利用模型可靠性短期持续性维护小活跃集,按需路由,精度媲美全集,速度快2.7倍、省69%内存。
DeepEdu-v1:面向越南教育的高效可扩展智能体大语言模型
DeepEdu-v1面向越南教育,长上下文推理提速近2倍,智能体准确率由70.0%升至79.5%。
基于信念自蒸馏的用户模型提取
BSD框架通过自蒸馏学习可读写的用户信念表示,揭示拒绝取决于模型推断的用户意图,且跨模型几何一致。
不学停止而学会停止:自监督置信度训练提升推理效率
自监督置信度微调无需优化长度或早停,即可在保持精度下减少最多25%推理token。
游戏竞技场:竞争环境中的大语言模型战略评估
推出Kaggle游戏竞技场,以象棋、扑克、狼人杀等对抗游戏动态评估大模型的战略规划与不确定性适应能力。
针对CLIP中隐蔽嵌入空间后门的区域级黑盒防御
CLIPGuard通过分段嵌入扰动检测并语义修复可疑区域,黑盒防御CLIP嵌入空间后门。
软件架构中什么仍将属于人类?一项焦点小组报告
焦点小组探讨AI辅助软件架构,认为架构决策、问责与护栏制定仍属人类,提出治理工程与认知债务概念。
域偏移下以教师为锚的训练后量化模型选择
研究域偏移下标签缺失或稀少时的量化模型选择,教师锚定可降低小标签预算下的选择遗憾,标签增多后优势消失。
编码智能体还不够!面向智能体化云调查的企业安全大脑评估
Sola安全大脑在28项云安全调查任务中覆盖率达0.693,远超通用编码智能体的0.387,成本更低。
多智能体在析取型与补偿型任务上的规模化扩展
任务结构决定多智能体扩展:析取型任务中投票难兑现潜力,补偿型任务平均仅减误差6%。
"AI 是(不是)新的……":生成式 AI 文化影响的诊断性类比框架
提出诊断框架,从认知场域、治理逻辑、技术机制三坐标分析生成式AI文化影响,区分结构与偶然后果。