项目分组的参与式预算
研究带分组预算限制的参与式预算模型,分析计算复杂度并提出高效精确与近似算法。
基于本体的几何问题集优化方法,用于技能培养
提出基于本体的几何问题集注释与优化框架,通过“解图”编码解题路径与技能依赖,经三十年实践验证,解决动态复杂数学知识表示问题。
GPU加速近似最近邻搜索:量化提速,适应变化
Jasper系统利用GPU批并行构建、RaBitQ量化和优化搜索内核,实现高吞吐和快速更新,查询性能比CAGRA提升1.84倍。
基于SMOTETomek和FedProx的不平衡临床数据差分隐私联邦学习鲁棒管道
提出结合SMOTETomek与FedProx的联邦学习管道,在不平衡医疗数据中实现高隐私(ε=9)与高召回(>77%)的平衡。
瓦瑟斯坦梯度流:可扩展且正则化的重心计算
提出基于梯度流的可扩展瓦瑟斯坦重心算法,通过小批量最优传输与标签信息,在多个领域实现最优性能。
面向神经网络和算子的向量值再生核巴拿赫空间
提出向量值再生核巴拿赫空间对偶对,证明神经网络和算子属于该空间并建立表示定理。
CrypTorch:基于PyTorch的多方计算机器学习自动调优编译器
CrypTorch是模块化编译器,自动调优MPC变换平衡性能与精度,相比CrypTen加速3.74-8.32倍。
标记错误的症状:评估医学文本中的LLM水印
LLM水印在医学文本中诱发词汇错误、幻觉和误归因,通用基准掩盖问题,需领域特定评估。
ClickGuard:利用信息量度量和大型语言模型检测并揭穿点击诱饵新闻
ClickGuard浏览器扩展,融合Transformer与语言学特征,XGBoost模型F1达91%,提前警告并生成文章摘要。
随机采样在认识论上是浅薄的:LLMs中温度变化与模型多样性之间的维度差距
同一模型多次采样仅一维信号,多样集成多维结构,自一致性缺跨问题信息,集成揭示模型未知。
PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试
提出PersonaTrail基准和PACMem框架,利用浏览历史推断用户偏好,提升个性化网络代理性能。
大型语言模型中的不完整提示越狱
研究不完整提示越狱,揭示LLM延迟拒绝、参数调优失效,提出神经元级防御。
半监督文本属性图蒸馏
提出Wasserstein距离引导的半监督图文本蒸馏框架,协同编码与可读摘要合成,实现SOTA性能-压缩权衡。
通过约束多源推理实现配电系统可扩展拓扑推断
提出约束推理方法,融合电气、空间与运行数据,精准修正基础拓扑,准确率超95%,计算高效。
无需训练的路由:通过可靠性门控实现可控比例的大语言模型卸载
提出CARGO无训练路由框架,利用本地模型采样一致性决定卸载,支持可控协作比,性能超越监督学习路由器。
OPTScientist:面向Transformer预训练的带类型优化器程序的多智能体发现
提出理论引导的多智能体框架,在类型化语言中进化搜索优化器,发现改进Transformer预训练的RS-MR。
CRAWO:自适应工作负载编排的自定义资源
提出CRAWO框架,基于控制循环和硬件感知分配器,实现边缘AI管道的自适应编排,减少延迟与云依赖。
面向真实用户的语言模型期望对齐
研究发现LLM难以满足真实用户期望,提出ExpectBench基准和LENS框架以改善对齐。
EvoSQL:面向文本到SQL的记忆增强评判器-生成器协同进化
EvoSQL通过生成器与评判器迭代交互及记忆机制,结合SDPO微调,显著提升复杂SQL查询准确率。
方向性幻觉:基于新闻的LLM问答中的意识形态漂移
LLM在新闻问答中产生左倾幻觉漂移,源于高熵环境下的不确定性猜测。
DFAH-Bench:金融决策中可观测代理不稳定性基准测试
前沿模型95%结果一致但仅77%工具路径相同,揭示三种行为模式。
ExecuGraph: 一个基于执行验证的多智能体框架,用于大语言模型可靠后端代码生成
多智能体框架通过执行验证提升代码可靠性,实验表明模型能力越强,分解策略优势越显著。
面向多智能体系统的工作负载感知缓存
提出工作负载感知缓存策略,结合重计算成本、DAG依赖和调用频率,延迟降低达64.7%,与其他优化互补。
优化基于超图的RAG:迈向更好的事实提取和分块检索
用自一致性提示优化事实提取,超图个性化PageRank增强分块检索,提升HyperGraphRAG性能。
MKEvolve:面向内核代码生成的模块化多智能体框架
提出模块化多智能体框架MKEvolve,迭代分解优化内核,正确性与速度提升,LLM token用量减少35%。
将LLM对齐与正则表达式分离:对抗性变异下的零覆盖和度量依赖分歧
LLM对齐贡献依赖度量:自然语言有害请求零覆盖,对抗性请求下LLM裁判可检测拒绝。
LeanFlow:工作流驱动的Lean自动形式化案例研究
通过两种模型和两篇论文的案例实验,全工作流变体在预算内完成项目,且输入令牌成本最低。
评估与守护智能科学综述中的引文忠实性
现有引文验证不可靠,提出金标准评估协议,确保引文真实可测有界。
可执行推理约束下的大型语言模型数学问题求解的表示鲁棒性
LLM数学解题对表面表示敏感,代码推理未能消除脆弱性,需将表示作为接口设计变量。
Telco-GAIA:面向电信领域的双语多模态智能体基准
Telco-GAIA含100个双语多跳推理任务,评估发现最强模型仅解71%,视觉理解尤待提升。
ConfidenceBench:评估大型语言模型的置信度校准
提出ConfidenceBench基准,用Brier分数评估15种LLM的置信度校准,发现准确率与校准度分离,最准确模型并非最校准。
PromptPack:规模化在线推荐系统的LLM标注代理
PromptPack通过上下文批处理,降低89%成本,提升2.5倍吞吐量,保持AUC不变。
ArbiGraph:用于评估上下文管理的任意可扩展可验证任务图
ArbiGraph基准生成器评估AI代理上下文管理,复杂依赖任务准确率下降33.3%,暴露单任务评估盲点。
CMI-Mem:基于CMI增强强化学习的可泛化长期记忆管理
提出CMI-Mem,利用RL与条件互信息混合奖励,实现无需查询依赖的可泛化长期记忆管理。
StrideDiffusion:加速时间序列生成的扩散模型
StrideDiffusion通过频谱感知自适应步长,实现18.9倍加速并保持生成质量。
KeySI:一种基于人类反馈调整文本嵌入的交互框架
提出KeySI框架,通过关键词概念实现特征级反馈,减少人工标注,有效提升嵌入对齐。
WaveformQA:评测大语言模型在数字波形上的时序推理
提出WaveformQA基准,含360题评估LLM数字波形时序推理,发现复杂问题性能下降,事件时间JSON表示优于VCD。
NVIDIA-labs OO Agents:原生Python面向对象智能体
NOOA框架将智能体设计为Python对象,方法即动作,字段即状态,文档即提示,类型注解即契约,LLM驱动运行时循环。
利用指南锚定的多模态大语言模型增强可解释性心脏诊断
提出指南锚定多模态框架,注入结构化心电图指南,提升诊断报告语义一致性,BERTScore达0.953。
人机替代原则:组织中你何时会被AI取代?
基于技能与AI扩展不对称性,提出人机替代原则,揭示替代条件及中层管理脆弱性。
轻量级大型语言模型的性能剖析
提出PTME框架测量轻量级LLM的精度、时间、内存和能耗,发现静态指标无法预测精度,资源约束增成本不降精度,需综合评估。
AI系统能否具有创造力?来自艺术与工程的批判视角
论文论证AI系统缺乏真正创造力(仅组合创新),因缺少意外与主体性,并提出人机协作模型。
从标量到时序:重新思考时变体数据的隐式神经表示
用序列级监督取代坐标级采样,降低训练成本并提升重建质量,结合混合专家模型进一步优化。
AI知识系统中实体重要性的表示:受众评价与结构权威的双信号框架
提出受众评价与结构权威双信号框架,验证两者非冗余,支持任务感知系统保留不同重要性信号。
超越独立优化:多模态边缘智能中的压缩、MoE路由与量化交互
多模态边缘智能中压缩、MoE路由与量化相互依赖,需协同设计以应对延迟、内存和能量约束。
交付而非存储:线索锚定的工作记忆作为编码代理的框架属性
代理记忆应由框架自动递送而非自主存储,实验显示自愿记忆近零,线索注入可靠,交付比存储更重要。
SciExplore:从科学导航到信息集成的自主智能体评估
SciExplore基准评估科学信息检索与推理,揭示任务复杂度增加时性能显著下降,结构化合成任务准确率极低。
集群边缘智能:超越边缘计算与人工智能的简单融合
提出集群边缘智能(CEI)框架,将智能视为可共享重用的独立实体,在边缘-云间实现描述、发现、观察、交换与管理。
重新审视零样本摘要:LLM摘要器可信度的实证研究
提出双层次稳定性诊断协议,实证发现LLM摘要器在不同指标下存在显著生成变异性,影响可信度。
生成式推荐能否触达冷启动物品?基于时间视角的语义ID生成研究
语义ID生成推荐在时间视角下能触及部分冷物品,但受限于未见token和路径,需改进语义空间与评分接口。