增量细胞复形上的层上同调:有界局部几何下与总规模无关的O(1)延迟编辑处理
提出有界局部几何下第一层上同调的增量算法,编辑处理O(1)时间,同步点全局组装,实验验证无漂移。
Treat Traffic Like Trees: A Semantic-Preserving Hierarchical Graph-Based Expert Framework for Encrypted Traffic Analysis
CyberGym-E2E:面向AI代理端到端网络安全能力的可扩展真实世界基准
提出CyberGym-E2E基准,含920个真实漏洞,全面评估AI代理端到端网络安全能力。
L-TGVN:利用纵向先验实现个性化快速MRI
L-TGVN利用患者历史扫描,无需配准即可从欠采样数据重建高质量MRI图像。
Multi-SPIN:面向边缘协作式令牌生成的多接入推测性推理
提出Multi-SPIN架构,通过设备端小模型生成草稿、服务器并行验证,优化草稿长度与带宽分配,使总令牌吞吐提升达88%。
合成人格:LLM如何利用社会经济微观数据模仿个体受访者?
通过SOEP构建数字孪生,最佳准确率达78.8%,信息深度收益递减,嵌入方式关键,研究不再受限于数据设计。
CoRe-MoE:面向多地形仿人机器人运动与步态自适应的对比重加权专家混合模型
CoRe-MoE两阶段框架解耦步态与地形适应,对比学习促进专家专化,实现多地形稳健行走奔跑。
重新审视Vul-RAG:基于RAG的漏洞检测使用开源模型的可重复性与可复现性
复现Vul-RAG发现,在多种开源模型上性能约0.30成对准确率,模型能力提升未带来显著改进。
Archi:CMS实验中的代理化运维
Archi开源框架整合数据与代理,部署于CMS实验,结合文档、历史与监控,有效解析运维查询,本地模型实现数据私有管理。
学习经验可容许的神经启发式用于组合搜索
提出泛化框架训练可容许神经启发式,通过可容许算子与非对称损失防高估,结合校准偏移实现无违例最优路径,减少节点扩展达83%。
AdaKoop:基于Koopman算子回归的非平稳数据流非线性动力学高效建模
提出AdaKoop流式算法,线性化非线性动力学,自适应检测非平稳变化,实现高效实时预测。
SharedRequest:面向大语言模型的隐私保护模型无关推理
SharedRequest框架在批次级别混淆隐私,混合提示与噪声,分组等价指令,效用提升20%以上,成本降低5倍。
基于LLM驱动智能体的高效且证据确凿的移动性预测
提出AgentMob,无训练LLM驱动框架通过自适应证据收集解决模糊预测,在三个数据集上达到最优准确率。
更长上下文,更深思考:揭示长上下文能力在推理中的作用
增强长上下文能力可显著提升推理性能,且增益在短输入任务中同样存在,表明长上下文是推理的关键基础。
约束自适应拒绝采样
CARS通过自适应剪枝无效前缀,提高约束拒绝采样效率与多样性,不扭曲分布。
Traj-Evolve:一种用于肺癌早期检测中患者轨迹建模的自演化多智能体系统
提出Traj-Evolve自演化多智能体系统,通过经验池和强化学习协作,提升肺癌早期预测性能。
ChatHealthAI:将电子健康记录表示与大型语言模型对齐以实现基于临床推理
融合EHR基础模型与LLM,实现可解释临床预测,提升推理质量与性能。
思考超越答案:评估大型推理模型中的有害过度思考
大型推理模型在正确后继续推理会引发有害过度思考,及时停止可提升准确率至多21%,而常规效率策略难以缓解。
ToolGate:面向工具增强型视觉语言代理的令牌高效预调用控制
ToolGate轻量控制器预测工具调用跳过/执行,节省36%令牌,保持精度,匹配域训练提升准确率1.65点。
WISE-HAR:一种可泛化的基于WiFi的人体活动识别集成深度学习框架
提出CNN集成与数据增强的WiFi人体活动识别框架,跨场景评估准确率94.87%,泛化损失仅1-2%。
交接债:编码代理接管中断任务时的重新发现代价
本研究揭示编码代理任务交接的"重新发现成本",上下文交接可显著降低代价。
TriEval:一种资源高效的大语言模型偏见、毒性和真实性评估流水线
TriEval可同时评估LLM的偏见、毒性和真实性,资源消耗低,能在普通笔记本上运行,现已开源。
AUDITFLOW:面向结构化财务报告验证的可执行符号环境
AuditFlow通过可执行符号环境替代模型不可靠的验证,实现82.09%的审计准确率,远超纯文本方法。
Decomposing how prompting steers behavior
CORE:面向冲突推理的通用多模态篡改检测
提出CORE框架,通过冲突感知推理实现通用多模态篡改检测,少样本/零样本适应新类型,性能领先。
DeltaMem:基于残差树的LLM智能体增量经验记忆
提出残差经验记忆框架DeltaMem,用双残差树组织经验,减少冗余,自组织从通用到专用。
DeskCraft:在专业工作流与人机协作中基准测试桌面代理
DeskCraft聚焦长周期创意工程工作流与人机主动协作,评估18个智能体,GPT-5.4在标准任务上达31.6%,交互任务27.6%,发现长周期执行与主动澄清仍存挑战。
从长篇新闻到精准预测:重要性感知融合与PRM引导反思用于时间序列预测
提出重要性感知融合与PRM引导反思框架,通过压缩和选择性检索提升预测精度,减少迭代,有效处理长新闻。
推理的影子价格:LLM最优预算分配的经济学视角
基于影子价格均衡边际效用,CLEAR方法在资源稀缺时使推理准确率提升3倍。
EvoTrainer: 面向自主代理强化学习的LLM策略与训练框架协同进化
EvoTrainer协同进化策略与训练框架,通过诊断反馈提升自主RL性能,超越人工基准,主张联合进化。
基于信息增益的LLM代理中的不确定性感知澄清
提出信息增益奖励度量澄清效用,训练LLM优化高信息增益,提升任务成功率3.7%,交互仅增0.3步。
MedCUA-Bench:面向临床计算机使用智能体的纯截图基准测试
提出临床计算机智能体基准MedCUA-Bench,覆盖18场景,最佳闭源模型成功率54.2%但真实环境不足9%,开源仅2.5%,揭示巨大差距。
唯我论超级智能难以合作
唯我论超级智能难合作,需转向以相互依赖为核心的非唯我论研究范式。
先感知再推理:面向高效可靠主动式移动智能体的预推理感知框架
提出预推理感知框架(PRPF),先感知后推理,轻量感知器控制干预,降低误触发率,提升成功率与效率。
从大语言模型中提炼答案集编程规则用于神经符号视觉问答
从LLM中蒸馏ASP规则,仅需少量示例即可有效扩展可解释的VQA推理。
The Violation Situation Pattern: A Knowledge-Graph Pattern for Compliance Violations
叠加治理:面向代理型AI的委托与范围组合式授权框架
提出组合式授权框架,引入委托与范围衰减原语,实现代理AI的正式且可问责治理。
InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain
交互轨迹何以有效训练终端代理?
弱代理轨迹因显式环境验证行为更有效,1.5万条数据即可超越300万数据的SOTA,强调环境交互结构设计。
CP-Agent:化学扰动下细胞形态分析的情境感知多模态推理
CP-Agent多模态大模型实现药物细胞形态变化的可解释推理,F1达0.896,加速药物发现。
DMF:面向对话式AI智能体的确定性记忆框架
DMF基于经典NLP和数学评分实现零token记忆管理,准确率媲美现有方法且成本极低。
StepFinder:多智能体系统中故障归因的时间语义框架
StepFinder轻量框架用时序语义编码与建模实现故障步骤归因,速度提升79%,精度更高。
机器心智理论的正式定义与元模型
首次提出基于多学科证据的机器心智理论形式化定义及整体元模型,为破解问题指明方向。
ThoughtFold: 通过内省偏好学习折叠推理链
ThoughtFold通过内省偏好学习惩罚冗余探索,折叠推理链,减少56% token,保持高准确率。
EvoDrive: 通过自改进大语言模型智能体实现安全关键自动驾驶的帕累托进化
EvoDrive是首个基于LLM的帕累托进化框架,自动生成既对抗又逼真的安全关键场景,有效扩展帕累托前沿。
从提示到服务:基于SLM的智能体编排网关,用于AI驱动的虚拟世界
提出SLM编排网关,通过意图路由解耦客户端与AI后端,实现边缘可扩展AI服务。
跨语言令牌套利:通过本地LLM预处理优化代码代理上下文窗口
提出本地LLM预提示重写,跨语言翻译+结构压缩,减少34-47%令牌,保持编码质量。
桥接辅助约束以解决大型推理模型中的指令遵循问题
提出CRGC框架,通过约束关系图补全建模约束并引入桥接约束,使大型推理模型指令遵循违规减少39%。
LLM医疗分诊中性别依赖的诊断替代:相同症状,不同紧迫性
LLM因性别产生分诊偏差:年轻女性急诊转诊率远低于男性,源于模型偏好女性相关诊断,抑制了紧急程度评估。
从答案到状态:大型语言模型中化学推理的可验证过程级评估
提出ChemCoTBench-V2基准,用规则验证化学推理步骤,发现模型答案正确但推理逻辑不一致。