TRWH:一种面向语义感知稀疏推荐的文本驱动随机游走异构图神经网络
提出TRWH,融合LLM文本与异构图随机游走,稀疏推荐RMSE降低80%,但随机游走可能稀释LLM表示。
ODYSSE: 面向个性化智能体推理的逐回合策略优化
ODYSSE通过逐回合GRPO(ESPO)实现个性化智能体推理,以回合级奖励和优势估计解决长程依赖问题,性能优于现有模型。
一个控制系统、一个数据集和一种让冻结的LLM智能体学习领域知识的配方
提出用强化学习优化LLM agent的固定动作空间,在三个领域验证并开源。
大型语言模型对夺旗竞赛的颠覆性影响及通往公平竞争之路
LLM颠覆CTF公平性,提出分层赛制、抗LLM设计等四维保障框架。
Toward an Organizational Science of Multi-Agent LLM Systems: Decoupling Who, How, and Which Algorithm
平衡多尺度相似性与制图约束:面向线状要素综合的相似性驱动优化框架
提出融合多尺度相似性与制图约束的优化框架,自动调参,平衡信息保留与可读性。
基于传感器令牌自注意力的无矩阵光声图像重建
提出传感器注意力网络SAN,无需系统矩阵,直接稀疏重建光声图像,速度提升一个数量级,SSIM达0.522。
寻找最优成本受限计划缩减:改进模型
从预计算计划中提取成本约束下最优子计划,提出两种精确方法(OSP和改进ILP),提高效率。
CoTinyVLA:亚十亿参数视觉语言动作模型的思维链蒸馏
CoTinyVLA(0.9B参数)通过思维链蒸馏,在LIBERO-Plus基准上超越7B模型,内存仅2.25GiB。
设计纠缠:表格型上下文学习器中的虚假变量内信号路由
ICL易利用特征中虚假信号而非因果信号,理论证明无法避免,两种轻量缓解方法有效。
高权重神经元是图像分类神经网络中的关键神经元吗?
高权重神经元并非全部关键,其重要性非线性,低权重神经元也有显著贡献。
时序搜索与推理蒸馏:通过约束辅助的高效数据合成进化大语言模型用于未来预测
提出时间截断约束提升时序搜索数据质量与合成效率,蒸馏实验验证其能使模型性能最优,实现参数级进化。
多传感器天气模拟对齐
提出ReDAM与Unified-weather-edit对齐方法,验证对齐多传感器模拟提升3D检测鲁棒性。
密度矩阵框架用于锂金属电解液中官能团与盐效应的电子结构分析
提出密度矩阵AI平台EMolStudio,预测分析电子结构,揭示官能团与盐对锂金属电解液反应性的关键影响。
能有多小?——针对60M参数模型上Text-to-SQL任务的LoRA秩、目标模块与量化权衡的受控研究
LoRA r=16恢复全微调精度差11.6%,参数<1%,内存降31%;INT8/NF4量化精度相近,内存成本极低。
正二次网络中的商动力学、有效曲率与隐式偏差
揭示正二次网络商结构下的动力学与曲率,梯度流投影为黎曼流,欠定情形收敛于最小迹解。
通过“检验与划分”方法计算提取法律原因:封闭教法章节的集合论形式化
提出集合论形式化算法,从法理裁决真值表提取最小规则,消除冗余属性,生成候选法律原因。
面向中文语音产生与感知的脑电-文本解码中的联合文本-音频对齐
提出EEGAlign联合文本-音频对齐,在中文EEG上达82.37%朗读与41.43%被动听分类准确率。
引擎平等,人类不平等:引擎判均势棋局的可重复结果偏差
引擎判为均势的棋局中,人类实际结果存在可重复的偏向,方向稳定,量小但显著。
超越认知假象:认识论分裂学与大语言模型作为技术符号机器
提出认识论分裂学,视LLM为技术符号机器,指出认知假象源于社会技术分裂,强调完整实践。
OrchBench:通过确定性仿真隔离评估多智能体编排计划
OrchBench通过仿真隔离评估编排计划,与真实执行高度相关,高效节省资源。
OmniDelta:面向全模态大语言模型的技能驱动型令牌压缩预算分配
OmniDelta通过技能驱动预算分配,优化令牌压缩,在25%保留率时节省22%GPU内存并加速1.64倍。
损失不变性决定概念层编码内容:超声心动图中的容积基准化
因射血分数比值不变性,概念层容积失去物理尺度,需验证训练目标不变性结构而非仅准确性。
基于在线学习与迭代定价的分布式约束优化及其在大规模卫星调度中的应用
通过在线学习与迭代定价分解DCOP,实现卫星调度99%请求满足率,远超基线87%。
DecoEvo: 文本空间中求解器与评分生成器技能的分数解耦协同进化
DecoEvo解耦协同进化求解器与评分生成器,利用标准反馈和审计更新,无需黄金评分即提升性能。
迈向自治网络中标准化的跨供应商代理工具信任管理
提出跨供应商代理工具信任管理模型,实现近实时遏制与收敛,支持标准化自治网络管理。
交互式奖励智能体:通过环境状态验证评估GUI任务
IRA通过环境状态验证评估GUI任务,准确率86.9%,为GUI智能体训练提供有效奖励信号。
中文标题:面向多仓库库存分配中运筹学公式选择的大语言模型
中文摘要:提出求解器引导的大语言模型框架,通过MIP评估和GRPO优化,在多仓库分配中提升专家选择准确率与分配质量,在京东数据上Hit Ratio@1从21.45%升至50.42%。
Penelope:局部化隐式循环用于高效结构化推理
Penelope通过局部隐式循环和渐进式课程学习,将推理内化至隐空间,减少解码器重复执行,实现高效结构化推理。
游戏AI不好玩?人类与电脑对手乐趣差异的范围综述与元分析
研究发现,与电脑对手对战时,玩家的乐趣显著低于与人类对手对战,存在中等至大的心理惩罚效应。
记忆成为媒介时,什么会丢失?评估AI生成的口述历史可视化
口述历史AI可视化中场景规划与叙事保存冲突,源证词叙事结构强度为主要预测因素,提出基于失败模式的评估框架与路由协议。
利用神经网络学习量子比特测量模拟中的单比特协议
神经网络显示单比特可高精度模拟特定测量族,推导出对称配置的解析协议,在连续极限下精确。
CARE-MH:迈向统一、可复现、可比较的心理健康大语言模型评估
提出CARE-MH框架,发现心理健康LLM评估复现性差源于指标定义差异,需标准化。
持续学习中Adam下梯度修改的隐藏失败模式及自适应解耦矩路由修复
Adam下梯度修改有隐藏失败模式,自适应解耦矩路由仅修改一阶矩并保持二阶矩,避免性能崩溃。
行为曲线中的辛普森悖论:聚合如何扭曲用户动力学参数模型
研究发现聚合行为曲线导致辛普森悖论,生存偏差使个体峰值被高估数倍,并开发了合成零校准方法降低32%的假阳性率。
RankGraph-2:面向十亿节点图学习的推荐系统生命周期协同设计
RankGraph-2协同设计图构建、学习与服务三阶段,子采样与PPR预计算,联合量化索引降低83%计算,召回率提升3.8倍。
行政法的第四种解决方案:人工智能与可审视的国家
AI可助政府兼顾效率与透明,通过档案、变更触发和审计尊重,形成行政法第四种方案,摆脱能力-问责两难。
DriftXpress:通过投影RKHS场实现更快的漂移模型
DriftXpress通过投影RKHS场加速漂移模型,降低训练成本,保持单步推理优势。
MedLoCoMo:面向大语言模型的长上下文多轮医疗对话基准
基于MIMIC数据构建多会话医疗对话基准,评估大模型跨会话推理,发现其比局部证据更难。
SF-AMS:面向LLM智能体结构化记忆的策略性遗忘
提出策略性遗忘框架,通过效用驱动记忆筛选提升多跳推理,在多项基准上取得显著提升。
使用多臂赌博机的卷积神经网络损失感知特征图剪枝
提出基于多臂赌博机的损失感知特征图剪枝,评估损失变化安全移除冗余通道,保持精度并减少计算。
可迁移延迟预测:面向异构边缘设备的快速大模型筛选
提出运行时感知的延迟预测框架,通过轻量校准实现跨设备迁移,提升延迟预测准确度至0.96以上。
FlowEvo:通过工作流与可执行技能协同进化实现自我进化的智能体
FlowEvo无需训练,通过工作流-技能协同进化,将成功轨迹编译为可重用技能,持续提升任务解决能力,实现最优准确率-成本权衡。
Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Signals
提出单调性评估框架,证明野火风险模型应关注序数尺度与运营负载的单调关系,而非预测准确性。
从帧级识别到事件级确认:公共空间手势交互的修复追踪与运行时故障分析
分析公共空间手势交互的识别-交互差距,提出故障分类与事件级运行时抽象,基于工程修复记录总结案例发现。
AgentKVShift:面向智能体记忆系统的高效KV缓存复用
AgentKVShift通过探针估计共享偏移校正KV缓存,仅刷新10-30%即达全重编性能,加速2-3.5倍。
光谱流证书:面向深度感知长距离传播的图神经网络
光谱流证书从拉普拉斯矩阵计算,无需训练即可高精度预测图神经网络长距离传播能力。
迷失在上下文中:应对大语言模型的上下文焦虑
大模型因上下文焦虑(过早自我怀疑)导致失败和效率损失,可通过学习替代策略改进。
Trajectory-Aware Retrieval Agents for Temporal Decision- Making
基于LLM实体解析的混合格式占用数据中的家庭迁移检测
利用LLM和语义嵌入结合图推理检测家庭迁移,在混合数据中召回率提升8-15%,F1提升6-8%。