SEFORA:学生论文与反馈语料库及大语言模型反馈评估框架
SEFORA包含564篇论文和8240条教师反馈,UniMatch评估框架显示LLM生成反馈F1低于0.4,难以匹配教师重点。
基于大语言模型的意图驱动网络拓扑设计框架
提出LLM框架,通过约束管道从自然语言生成合规且弹性的网络拓扑,评估结构与弹性,为AI网络设计提供基准。
统一引导框架增强流匹配,实现高效鲁棒语音合成
统一引导框架通过数据增强与模型优化,加速流匹配推理近3倍,提升语音合成效率与鲁棒性。
隐藏因素至关重要:利用视觉语言模型识别规划关键的被遮挡对象
引入PKL度量,VLM识别关键遮挡,微调小模型性能提升30%,实现高效风险评估。
当AI遇见量子信息:综合评述
AI与量子信息双向赋能:AI助力量子系统学习与设计,量子信息提升AI性能,但面临可重现性、可扩展性等挑战。
DiscoLoop:循环离散嵌入与连续隐状态实现多跳推理
混合离散与连续通道的循环架构,解决多跳推理中表示对齐问题,实现近完美准确率。
SoK:移动端侧AI系统的攻击与防御全景
首部系统化梳理移动端侧AI安全,涵盖攻击与防御全景,指出研究空白与未来方向。
NeuroCogMap揭示大型语言模型的认知组织架构
NeuroCogMap将LLM内部特征组织为功能分区,揭示其认知架构及与人类认知的关联。
全息量子变换器:一种通过生成注意力解决受挫系统的通用神经符号架构
提出全息量子变换器,利用全局自注意力求解受挫量子系统,并通过零-shot大小外推协议快速转移至更大晶格。
基于搜索的时空与多机器人运动规划:在时空凸集图上
提出时空凸集图搜索框架,结合凸分解与窗口协调,高效规划多机器人运动,在狭小瞬态区域显著加速。
Predicting Lethal Outcome (Cause) And Understanding Key Biomarkers Linked With Acute Myocardial Infarction Using Deep Artificial Neural Network And Ensemble Of Machine Learning Methodologies
基于LLM聚类的实时困难负采样用于大规模双塔检索
提出基于LLM聚类的实时困难负采样,从同类生成挑战性负样本,降低计算量,打破反馈循环并减少流行偏置。
从世界模型到世界行动模型:机器人学简明教程
世界模型用于具身智能,分为观察/状态空间;世界行动模型连接预测与行动,含四种范式。
LeVLJEPA:无需负样本的端到端视觉-语言预训练
LeVLJEPA提出非对比式端到端视觉-语言预训练,无需负样本,通过跨模态预测生成更强密集语义特征。
LRAT-Catcher:通过反射将SAT求解器证书导入Lean4
LRAT-Catcher通过反射在Lean4中验证LRAT证书,处理内存极限,支持立方征服求解组合。
从隐藏状态恢复输入文本:基于梯度的解码器-仅语言模型反演研究
连续优化可检测失败,高频功能词致错,扩大候选窗口精确匹配率升至97.5%,隐藏状态敏感等同原始文本。
从角色到情节:基于人物驱动的多智能体长篇故事生成
提出人物驱动的多智能体框架MAGNET与幻觉检测ATLAS,显著提升长篇故事连贯性。
扩散Transformer的训练后剪枝
提出DiT-Pruning,用能量平衡指标和聚类感知剪枝,50%稀疏度CLIP仅降0.001。
FAR:故障感知重试实现测试时恢复与持续策略改进
FAR框架使机器人在测试时从失败中学习,自主恢复并持续改进策略,成功率分别提升17.6%和11.7%。
EchoRisk:一个用于心脏肿瘤学的多中心超声心动图数据集与基准
EchoRisk是首个多中心纵向超声心动图数据集,定义三大临床任务,基线显示LV功能评估有效,早期心脏毒性预测仍是开放难题。
对比反思:迭代提示优化的对比分析方法
通过对比错误与成功行为,迭代优化提示,显著提升检索增强QA准确率。
AgRefactor:面向HLS兼容与性能的自演进智能体工作流
AgRefactor自演进多智能体重构软件为HLS,集成记忆与工具,性能提升6.5倍。
反馈驱动交互式改进的动因是什么?
多轮交互改进常源于重复尝试而非反馈本身,学生利用反馈的能力是交互改进的关键瓶颈。
BayesBench:评估多轮证据积累下大语言模型的信念轨迹
BayesBench评估LLM多轮信念更新,发现扩展模型提升推断但预测存在差距。
AI如何找到我的模型?一项考虑数据格式、嵌入和检索策略的模型查找实验研究
实验研究数据格式、嵌入模型与检索策略对仿真模型发现的影响,结果表明表示重要、开源嵌入高效、重排序关键。
神经-贝叶斯-符号残差注意力浅层网络:面向网络安全风险评估的可解释深度学习
提出NBS-RASN浅层混合网络,用80个神经元和五条认知公理,实现可分解、设计保证的可解释网络安全风险评估。
OpenLife:迈向基于自主LLM代理的开放世界人工生命
将LLM代理置于开放世界,展现自发活动、个体化、社会结构和自创收入等生命特征。
中文标题:LabGuard:将自然语言实验室规则具象化为具身实验室代理的运行时守护
中文摘要:提出LabGuard套件,将自然语言规则转为可执行监视器,任务F1达79.4%,不安全事件从39.5%降至23.8%,干预低于0.5%。
MultiUAV-Plat:面向大语言模型的多无人机协同任务规划平台、基准测试与框架
构建面向LLM的多无人机协同任务规划平台与基准,Agent4Drone框架任务通过率57.9%,显著优于ReAct基线。
通过知识图谱注入的表格医疗数据跨域特征扩展
MedKGTab利用知识图谱与双注意力机制跨域扩展表格医疗特征,数据保真且优于现有模型。
HealthAgentBench:面向前沿AI挑战的统一真实医疗智能体环境基准套件
HealthAgentBench基准含54个医疗任务,最强AI代理成功率仅42%,凸显真实医疗场景的挑战性。
基于双智能体的凸松弛的AI辅助发现
AI双智能体自动发现凸松弛,验证并改进优化常数下界,分别提升至1.2937和0.37912。
具身CAD:基于求解器的LLM智能体用于参数化B-Rep装配建模
利用求解器反馈驱动LLM智能体迭代执行动作,实现高可执行率的参数化B-Rep装配建模。
大语言模型浮点错误分类基准测试
提出InterFLOPBench基准,测试14个模型在6类浮点错误上的分类性能,最新模型F1>0.88,不同类型误差表现差异显著。
HistoriQA-第三共和国:面向历史研究的多跳问答语料库——法国第三共和国(1870-1940)议会辩论
基于法国第三共和国议会辩论和报纸构建的多跳历史问答数据集(1782题),支持跨源综合与时序推理,用于评估检索增强与大语言模型。
小米GUI-0技术报告
提出真实设备闭环多模态GUI代理,混合架构与三阶段训练,显著提升执行稳定性与异常识别。
谁来决定情绪的意义?情感主权作为测量局限性的认知后果
情绪感知AI存在认知差距,个体情绪意义的最终解释权应归于体验主体,即情感主权规范。
大型电动汽车车队的智能充电:独立多智能体强化学习方法
比较上下文组合臂与策略梯度两种独立多智能体强化学习方法,在动态电价下优化电动汽车分散充电性能。
BP-TTA:动态场景下的平衡与原型引导测试时自适应
针对动态场景中类别不平衡与持续域偏移,提出平衡采样与原型约束的测试时自适应方法,有效提升在线更新稳定性。
CDR-Bench:评估组合式、顺序敏感数据精炼配方的忠实执行
新基准CDR-Bench测试LLM对组合式顺序敏感数据精炼的忠实执行,发现模型在复杂设置中性能显著下降。
CLOUDADV:漂移环境下基于零样本基础模型的决策对齐实例规格选择
CLOUDADV系统结合零样本预测与推荐,在非平稳云环境下节省52.9%成本,超标率仅1.5%,减少重训练负担。
惊讶:可塑性与元认知的信号
预测误差(惊讶)同时充当可塑性门控和元认知载体,两个系统验证其在持续学习(恢复旧类达51.3分)与VLM主动学习(AUROC 0.966)中的高效性。
FARS:一个大规模部署的全自动研究系统
FARS全自动AI研究系统大规模部署产出166篇论文,评审显示可产出有价值但存在局限的研究成果。
用英语思考,用韩语回答:多语言工具使用代理的高效适配
提出LuckyStar 111B模型,通过微调、强化学习和4位量化实现多语言工具代理高效适配,提升数学推理和函数调用。
Arena-T2I Hard: 基于依赖感知检查清单的忠实度基准测试与提升
提出含310提示、分解约束的Arena-T2I Hard基准及依赖感知检查清单奖励,优化忠实度与美学权衡。
自演化智能体系统:自动化生物实验方案生成与执行
ProtoPilot自演化多智能体系统实现生物实验方案自动生成与执行,通过基准测试和湿实验验证,达到高成功率。
Evo-PI:通过演化原则引导的监督对齐医学推理
提出Evo-PI框架,用可演化原则引导监督,动态对齐模型推理,医学VQA准确率提升最高24.6%。
The Consistency Dilemma in LLMs: Generator-Evaluator Agreement and Vulnerability to Mistakes
利用文本拒绝方向实现多模态安全
发现LLM文本拒绝方向可跨模态泛化,提出免训练MARS方法,无需多模态数据即可提升安全性。
PolicyGuard:从组织政策到神经符号合规审查引擎
PolicyGuard将组织政策转化为可执行的合规审查引擎,分离形式化、解释与评估,提升可维护性与可测试性。