混合分词与串并行解码赋能跨域序列推荐
提出GenCDSR框架,采用跨域混合分词与串并行解码,准确率提升1.5%,延迟降低85.1%。
面向异构文档知识图谱构建的本体引导去重感知抽取层
提出本体引导去重抽取层,基于Qwen模型两遍抽取和五阶段精炼,搜索召回率从70%提升至95%,无错误合并。
AI能评估AI科学家吗?基于自动多模型评审的自主研究生成系统基准测试研究
提出多模型评审基准,评估AI科研系统;FARS显著领先,Gemini与Claude评审一致可靠。
它思考有多难?分析LLM思维链轨迹中的步级推理能量
提出SARE按步度量推理能量:非均匀分布,错误轨迹关键步能量更低,其特征超越输出置信度。
真实世界临床诊疗中的推理:大语言模型为何尚不能安全用于自主临床决策支持
大模型虽通过医学考试,但缺乏临床评估保真度,自主分诊难以在不确定性下收集信息,漏诊高危,不安全。
基于STL-GO的具有时空与拓扑约束的多智能体规划
针对时空与拓扑约束的多智能体规划,提出STL-GO的MIP与SMT编码,并在多无人机搜救中验证。
EarlyDx:以入院锚定的急诊诊断证据支持开放式生成基准
提出急诊早期诊断基准EarlyDx,基于MIMIC-IV超15万病例,仅用入院时证据,评估表明现有模型推断能力不足。
模型还是框架?面向交互的智能体失败定位分类法
现有评估归因于系统整体,掩盖故障源头。提出交互中心分类法,按交互边界与责任方定位41种失败模式,明确模型或框架修复归属,跨架构适用。
不完美对齐下价值的脆弱性
研究表明,过度优化不完美代理会导致灾难性后果,需限制优化压力而非仅依赖训练。
最好的朋友,并非永恒:评估AI伴侣的长期人格坍缩与行为漂移
审计2008段对话发现:所有模型无法保持人格与记忆,轨迹准确率44.4%,用户状态回忆接近随机。
通过贝叶斯实验设计识别用于认知参数推断的信息性环境
将认知实验设计建模为贝叶斯实验设计,摊销框架以更低成本匹配精确方法,并揭示信息目标权衡。
MerchantBench:评测电商运营中 LLM 智能体长期一致性的基准
电商长期运营基准,模拟365天订单与26种工具,测试LLM智能体一致性;最优模型仅达人类最终净资产的27.3%。
论思维链忠实性中转向向量的泛化
转向向量能提升思维链忠实性,泛化广泛,构建方法影响小,不增加提示使用但减少隐藏使用。
基于证据的建筑文档约束检查
证据管道归一化事实并执行规则,重分配图像至局部瓦片使准确率提升10.6个百分点,但广度测试中无显著优势,存在分辨率-广度权衡。
MMShopBench:面向多模态多轮购物代理的真实日志基准
首个真实日志多模态多轮购物基准,标注购买意图与需求,训练集微调缩小开源与专有模型差距。
通过互补驱动的迭代协作发挥LLM群体智慧
提出WILC框架,以迭代反思与互补驱动选择协调多LLM,超越现有方法,性能媲美GPT-5.2且成本降低约7倍。
CAGE:工具使用智能体在类型化返回不确定性下的认证授权
针对类型化工具返回的绑定错误与数值漂移,逐项枚举离散分支并认证连续扰动,消除误放行,保留部分自主决策。
MirrorCraft:Minecraft中隐藏规则变化下的配对评估
MirrorCraft用隐藏规则变化评测Minecraft智能体,以成对世界对比和规则干预效应度量表现,补充固定机制基准的不足。
地城基准:龙与地下城战斗中规则丰富的战术推理基准
提出地城基准,评估龙与地下城战斗的规则丰富战术推理,分遭遇与日程两轨,暴露资源预算和休息时机缺陷。
超越检索:多模态智能体的分析记忆
提出分析记忆概念及相应框架,联合支持检索与分析,显著提升多模态长期记忆基准性能。
看似正确,运行正确:多屏移动应用生成的项目级基准
现有设计转代码基准仅评测单页,缺乏导航与可维护性。提出MobileForge项目级多屏基准,六轴评测及新测试法,发现前沿模型可编译但交互导航不可靠。
支架式培养对生成式AI的批判性参与:转变少数民族预科学生在提示工程任务中的协作话语
支架式教学促使少数民族预科生从被动使用GenAI转向批判共创,提升提示自我效能。
ConnectED:面向越南教学计划与学生学习、对齐课程标准的AI系统
提出越南教育AI系统ConnectED,基于VietEduQwen模型,支持教案生成与学习反馈,准确率87%,备课时间从3-4小时降至45分钟内。
COSI-Lab:会议生活实验室——建模多视角多模态社交意图
COSI-Lab发布国际会议中32位学者的多模态数据集,通过弱脚本社交环节研究意图推断,提出将主观感知多样性视为可解释的视角推理过程,并贡献新标注法、分析及基准任务。
为何痛苦:识别情感支持对话中消极思维的驱动因素
提出新基准与PRISM框架,基于贝叶斯逆规划,提升大模型识别情感支持对话中关键认知评价维度的能力。
HenTwin:面向蛋鸡纵向生物状态监测的多模态数字孪生框架
HenTwin多模态数字孪生框架形式化蛋鸡群体生物状态,扰动分析显示THI致声学熵长期升高。
WitCert:面向KV缓存量化的可靠运行时风险观测与门控
提出可证明可靠的运行时仪表,逐层/头/步上界监测KV量化偏差,门控修复质量,认证INT8缓存同内存多服务1.88倍。
设计概念:在科技工作者中搭建地缘政治反思
提出AI交互叙事系统,通过推测场景和反思活动,促使科技工作者批判审视自身假设,引入地缘政治反思。
一致性与质量不可等同:当人类共识非金标准时,人类与LLM定性编码的盲审专家验证
人类共识非金标准;盲审验证显示LLM与人类编码质量相当,基于一致性的评估有缺陷。
Auto-JEPA:面向端到端自动驾驶的连续意图隐式世界模型
提出无需重建完整未来世界的动作导向隐式世界模型,预测驾驶意图并检索轨迹,在NAVSIM上取得高分数,聚焦规划相关视觉特征。
metasignal:用于全面元认知分析与决策的Python包
metasignal是开源Python包,实现17种元认知测量及SDT指标,支持二元辨别任务,提供置信区间与检验,统一平台促进元认知研究。
从代码审查到代码批判:面向大规模AI生成差异的意图、漂移与聚焦
提出智能代码批判系统,结合意图预测、漂移检测与代码聚焦,提升审查质量,性能显著且零缺陷。
M3MAD-Bench:跨领域与模态的多智能体辩论多维评估
M3MAD-Bench统一多领域多模态多指标评估多智能体辩论,协作法更稳健但成本高。
结合大语言模型与符号推理,通过可解释知识库实现多机器人时序规划
提出PLANTOR框架,用大语言模型构建Prolog知识库,经一致性检查、符号规划与调度生成可执行行为树,减少人工建模但需人工修正。
嵌入式通用预测智能:多智能体学习的连贯框架
基于AIXI提出嵌入式预测框架,代理自我预测以处理多智能体非平稳性,实现高阶合作与无限阶心智。
基于角色条件化强化学习塑造符合专家视角的科学解释
提出视角条件化解释框架,用角色对齐奖励的强化学习生成科学解释,专家更偏好且反馈时间大幅降低。
双维一致性:自适应推理时扩展中预算与质量的平衡
提出双维一致性框架,融合置信度贝叶斯与趋势感知剪枝,保持精度同时将推理开销降低十倍以上。
面向对话智能体渐进式BDI/E轨迹评估的认知世界模型
提出CogWM认知世界模型,联合建模用户BDI/E状态与响应,实现对话代理认知轨迹的渐进评估,优于现有基线。
PAIR:面向多轮智能体优化的前缀感知内部奖励模型
PAIR用冻结隐状态探针加注意力头提供密集步骤级奖励,抗前缀污染,低成本。
PEMAND:人格增强的多智能体家庭决策协商
提出PEMAND,用行为理论增强人格建模,经多智能体协商模拟家庭决策,在出行和居住迁移数据上优于基准。
DynaResize:面向分离式LLM后训练的运行时GPU重分配
动态重分配GPU,平衡推演与训练,吞吐提升66.5%,耗时降低33%,隐藏27%切换开销。
代理歧义下基于因子化转移效应的潜在动作
针对多物体干扰场景中动作歧义,提出两阶段框架:先分解转移原语,再聚合为潜在动作,提升动作对齐与策略性能。
双力:模仿约束下的增强离线多样性最大化
双力算法利用范德瓦尔斯力目标与功能奖励编码,在模仿约束下稳定提升离线多样性,无需技能判别器。
通过不可约表示视角重新审视多重排列等变性
用不可约表示与舒尔引理刻画置换等变线性层,推广至未对齐对称集,发现大量非孪生层并提升任务性能。
面向同调稳定性与全局结构保持的降维方法
DiRe力导向降维框架,兼顾全局结构与同调特征,可用Betti曲线和持久图量化。
稀疏几何消息传递神经网络的表达能力
稀疏几何消息传递网络在连通图上用旋转等变特征可区分一般非同构图;不变特征需全局刚性。新架构验证。
Patch-Based 3D Variational Autoencoder for Super-Resolution of Turbulent Channel Flow
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
Adaptive Policy Backbone via Shared Network
ELISA:用于单细胞基因组学中基于表达的可解释混合生成式AI智能体
ELISA结合表达嵌入与语义检索,实现可解释的单细胞发现,超越基线并生成生物学假设。