CourseGraph:发现各大学计算机科学课程的重叠与差异
提出CourseGraph方法,利用BERT和随机森林自动识别跨校课程重叠,辅助课程等效评估与学分互认。
层次分析法中排序依赖成对比较模式的稳定性
比较三种不完整排序依赖成对比较法,确定稳定性条件,实验表明可减少比较次数且不失可信度。
ECG-LENS: 导联感知的临床上下文增强心电图报告生成与评估
提出ECG-LENS框架,融合多导联信号与临床提示生成心电图报告,并引入专用指标F1-ECGBERT,在基准数据集上超越现有方法。
时间桥梁助力空间分辨率:双向对齐增强气候数据超分辨率
针对气候数据超分辨率忽略时间关联且对齐难的问题,提出双向时间对齐框架,利用潜空间映射降噪并捕捉时序相关性,提升超分性能。
GSBF:基于三维高斯溅射的环境感知波束成形
用三维高斯溅射表征环境散射,由接入点姿态与用户位置直接合成波束,免在线信道信息,低时延且优于穷举波束对齐。
AgentOPSD:面向智能体强化学习的递归自蒸馏
提出无批评器的递归自蒸馏法,将词元级信号聚为回合级信用,递归更新贝叶斯信念,超越GRPO等基线。
训练基于VLM标注数据集的视频游戏条件智能体
提出用视觉语言模型标注游戏数据集,结合离线强化学习训练条件智能体,并讨论难点。
GAUGE:基于实测的仿真引擎与视频世界模型物理保真度基准
新基准基于真实轨迹,评估数值仿真与视频世界模型的物理一致性,发现两者在碰撞、织物运动等场景存在显著偏差。
放牧型生产系统中牛群生长模式与增重预测的混合机器学习框架
基于澳大利亚东南部传感数据,构建混合机器学习框架预测牛群增重,级联模型最优(R²=0.889),优于循环模型,支持放牧管理决策。
HERALD:检索证明奖励的反事实审计与最小修复
提出离线审计HERALD,发现免标签引文清洗攻击;最小修复强化惩罚L,攻击成功率降至零,但严格训练下MuSiQue未达标。
FinEvo-Bench:面向专业金融工作流中自进化智能体的纵向基准
提出FinEvo-Bench纵向基准,含120任务覆盖6金融域,评估自进化智能体;结果显示进化提升得分并降低合规问题。
从经济主体到主体性经济:经济世界模型的系统蓝图
提出经济世界模型系统蓝图,分六级能力阶梯,指出现有研究多处于低层,旨在推动高保真经济模拟环境发展。
信号还是虚假线索?LLM社会推断中调查国家元数据的随机审计
随机审计显示,披露随机来源不减弱国家线索影响;真实国家元数据提升预测,随机标签无益。
搜索代理的上下文信息策略优化
提出CIPO框架,通过密集回合级奖励促使推理基于检索证据,减少先验驱动推理,提升搜索代理性能。
视觉工具使用的幻觉:对图像思维的因果审计
视觉工具使用常无因果效果,收益仅集中于少数校准案例,存在幻觉现象。
iARCS:面向可控三维场景生成的迭代式智能体强化学习
提出iARCS迭代智能体强化学习框架,两阶段训练适配文本任务,提升约束满足度,生成数据可用。
CogVis:开放词汇变化检测必须为每个查询重新感知场景吗?
提出认知记忆框架,将开放词汇变化检测重构为感知-记忆-验证范式,解耦时间与语义,性能最优,吞吐量提升28.5%。
Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints
DASH:面向推理模型同策略自蒸馏的散度自适应监督视野
DASH依据散度演变自适应调节令牌级监督权重,三规模三基准均优于基线,且无额外前向计算。
谁获得访问权?AI生成学术把关场景中的全球区域与学术身份偏见
AI学术把关模拟显示:LLM存在学术身份和区域偏见,前沿模型偏向全球南方,开源模型偏向北方,反映安全对齐和预训练数据不公。
基于概念激活向量的二语口语评估系统偏见分析
概念激活向量分析口语评分:概念可恢复性依赖架构,稀疏自编码器提升可恢复但降低敏感性,需区分编码与影响。
TRAJDEBUG:追踪错误生命周期以识别长时程智能体轨迹中的关键失败
提出TrajDebug错误生命周期追踪框架,构建TrajErrBench基准,性能最优。
QuanTiMedAI:智能体AI引导的量子增强时间序列模型用于心脏骤停死亡率预测
提出智能体AI引导的量子增强时序模型,仅605个参数预测心脏骤停死亡率,AUROC达0.852,优于基线
低频陷阱:视频语言模型在简单事件记录上的失败
轨迹归因剖析显示事件表征决定初始证据访问;高频高计数下正确率仅0.2%,增帧只提分不代表忠实恢复。
追踪心脏:心力衰竭特征工程的证据关联流程
提出基于证据的nMAS多智能体流程用于心力衰竭特征工程,提升表型AUROC,可审计,需外部验证。
估算工作任务所花时间
提出基于任务频率和单次完成时间的耗时占比估计法,用于近1.8万工作任务,重新加权后AI暴露排序变化显著。
社交媒体网站用户死亡自动检测
分析用户生前与死后社交媒体内容差异,用机器学习自动识别死亡,BERT效果最佳,死亡推文负面情绪和特定词汇更多。
Vibe Compiler:一种无需提示工程的研究逻辑综合工具——在生成式AI时代通过增强元认知维持能动性
提出综合-分析互惠模型,开发Vibe Compiler,用反思性问题激发元认知,让研究者主导而非盲从AI推理。
基于LLM的模块化安全智能体的事后轨迹风险认证
针对模块化LLM安全智能体,提出跨度树替代Bonferroni,区分依赖与样本量,轨迹覆盖92.7%
BALANCE:无线边缘网络中的混合自回归-推测式大语言模型推理
提出BALANCE框架,混合自回归与推测解码,联合优化调度与资源分配,最大化边缘LLM推理吞吐量。
研究人以研究AI:专家视角下人类研究在AI安全与伦理中的认知适配与障碍
专家调查显示,人类研究在AI安全与伦理中虽受认可,却因效度疑虑、资源不足、方法偏好和基础设施受限而受阻,技术研究者尤其轻视。
F²Agent:面向多模态交易的智能体金融融合
提出F²Agent多模态交易智能体,融合模态自适应与噪声鲁棒,年化收益提升超20%,优于16基线。
用一张纸劫持机器人:VLM控制机器人物理提示注入的系统研究
VLM控制机器人物理提示注入系统研究:提出四类攻击,20种提示,最高成功率29.4%,简单防御有效。
CodeGrep:面向LLM编码智能体的RL训练检索智能体
训练14B检索智能体CodeGrep,用GRPO多轮检索候选文件;在SWE-Bench上保持解决率,轮次减15%、令牌减19%。
神经符号AI的RAIL原则:推理、保证、交互与学习
神经符号AI结合机器学习与符号推理,RAIL四原则助设计可靠可信系统,统一分析多种AI技术,指导工程实践。
AI系统在冗余调整人工年龄评分下的长期持久性理论
提出长期持久框架,证明AI系统可无限循环而结构年龄有界,边际老化可消失,负担收敛为零。
用于表格到多模态报告生成的蒙特卡洛树搜索
提出MCTS-Report,用蒙特卡洛树搜索将表格生成多模态报告分解为原子动作,联合优化事实、视觉与叙事,评测得分77.9。
FinPerMA:理论指导的事件驱动的LLM智能体个性化记忆基准
提出事件驱动基准FinPerMA,测LLM智能体长期记忆;全上下文准确率仅47%,摘要记忆丢失偏好。
FinProBench:基于专业交付成果的角色扎根评分标准评估金融AI智能体
提出金融智能体基准与角色扎根评分法,由专业交付成果提炼标准,显著改善专业角色评估。
LLM提议,执行者定夺:一种自我验证的智能体工具,将长时程智能体中的承诺漂移与绑定漂移分离开来
提出自我验证的智能体工具,将承诺漂移与绑定漂移解耦;消融承诺机制使目标放弃率从0到1,验证方法为关键贡献。
NeuMoSync:面向持续学习中可塑性与适应性的端到端神经调节控制
提出神经调节同步架构,动态调控神经元活性与突触可塑性,在多个持续学习基准上提升前后向适应,增强模型长期适应性。
用领域专用语言改进神经PDE求解器的自动设计
用领域专用语言重构搜索空间,聚焦有效设计决策,使神经PDE求解器自动设计效率提升52%以上。
智能体AI工作流的架构影响
研究发现智能体工作流碎片化异构、CPU成为关键路径,现有服务器架构不匹配,原型Agora通过动态资源调度提升利用率并保障延迟。
享有特权,却有偏:PI条件教师如何破坏自蒸馏
自蒸馏在困难任务中失效:教师受特权答案偏差影响,学生拟合低信息词,损失降而精度不升,目标与成败脱钩。
用金丝雀工具诊断LLM智能体的工具选择推理
金丝雀工具诊断工具选择推理,六类弱点分类,能力越强越不易受骗,但安全性不与等级挂钩,且测量推理而非关键词。
思维链监控在隐式影响场景下可能不可靠
显式影响下思维链监控检测率60-94%,隐式影响下大幅下降,系统提示进一步降低至5%,显式评估或高估可监控性。
当提示成为像素:多模态推理中的提示区域锚定
将问题嵌入图像使MLLM性能大降,提出提示区域锚定法,对齐区域与语义,VTS准确率从58.0提至66.3。
EviGraph:证据引导的自主研究智能体
提出证据图框架EviGraph,维护研究全程证据链,主张支持率提升40.19%,数据一致性达87.73%。
更少词元,更小缓存:奖励协调的高效推理
ReCo用过程奖励协调缓存压缩与生成,词元减少37%-65%,延迟降2倍以上,精度几乎不变。
NSF-HRPT:神经语义场与分层风险感知树用于安全关键场景评估
提出神经语义场与分层风险感知树融合框架,用于单目视觉定量风险评估,仿真达最优,实车接近最优。