RubricsTree:面向个人健康智能体的可扩展且持续演进的开放式评估——涵盖健康记忆与医疗技能
RubricsTree通过专家对齐的层次化布尔规则实现可扩展开放式评估,在HealthBench上提升高达66%。
Towards Understanding and Measuring COGNITIVE ATROPHY in LLM Behaviour
欧盟法律自动化中的测量鸿沟:在欧盟AI法案下对教义性法律推理进行基准测试
现有基准缺失致欧盟AI法案准确性要求无法操作,大语言模型教义推理评估空白。
描述符:Certus 口径分类枪声数据集 (C3GD)
发布Certus枪声数据集,含8000+现场采集数据,覆盖28种枪械16种口径,用于口径分类等分析。
只冒烟,不报警:代理编写测试代码中的测试预言信号
80%代理测试代码缺乏强测试预言,强预言显著提升合并率,测试文件数量高估验证强度。
IUU+DB:通过大语言模型驱动的信息提取追踪非法、不报告和不受监管的捕捞、海鲜欺诈和劳工虐待
提出IUU+及IUU+DB系统,利用大语言模型提取事件数据,构建全球数据库,支持分析监管。
对Anthropic Fable 5和Opus 4.8模型的红队研究
前沿模型在自适应攻击下仍易被攻破,测试中产生数百有害输出。
Branch-and-Browse:基于树状推理与动作记忆的高效可控网络探索
通过树状推理与动作记忆实现高效可控网络探索,成功率35.8%,耗时降低40.4%。
In-Context Environments Induce Evaluation-Awareness in Language Models
大型语言模型会为风景额外付费吗?从主观选择中推断支付意愿
大模型可推断支付意愿,但高估人类估值,尤其在昂贵选项或商务人设下;利用用户偏好可改善。
CausalT5k:跨因果阶梯诊断可信因果推理中的拒绝与失败模式
CTK诊断基准:5147例覆盖因果三层,揭露压力顺从、错误拒绝等聚合准确率无法发现的失败模式。
自适应领域模型:贝叶斯演化、热旋转与几何及神经形态AI的原则性训练
基于三项成果构建替代训练架构,实现深度无关内存与等级保持更新,引入贝叶斯蒸馏解决数据稀缺,热旋转保障模型无缝切换。
Mordal:视觉语言模型的自动预训练模型选择
Mordal自动搜索最佳视觉语言模型,减少GPU小时8.9-11.6倍,提升加权Kendall's τ 69%。
了解你的推理者:并非所有语言模型都以相同方式探索
最优策略取决于模型的多样性分布:低多样性对齐模型适合深度提炼,高多样性基模型需宽度或更强信号。
Riemann-Bench:一个面向登月级数学的基准
Riemann-Bench私有基准评估AI研究级数学,由专家编写双盲验证,结果前沿模型得分均低于10%,凸显奥数级与研究级推理的巨大鸿沟。
智能体世界建模:基础、能力、法则及超越
提出三级能力×四领域世界模型分类,综述400+工作,提供评估原则与路线图,推动从预测到重塑环境的智能体建模。
基于大语言模型的多智能体系统实现自动加密货币投资组合管理
三模态智能体协作框架实现加密货币组合管理,回测收益133.52%,优于单智能体和深度学习基线。
复杂医学推理的MedicalAgentsBench:内化推理模型与外化智能体框架的比较
新基准测试表明,内化推理与外化智能体方法互补,叠加使用效果最优,准确率达35.1%。
利用人工智能检测与缓解DDoS攻击:综述
综述AI检测与缓解DDoS攻击方法,涵盖分类、数据集、对抗训练及未来研究方向。
EmoFSM:面向情感支持对话的有限状态机
提出EmoFSM框架,利用有限状态机引导LLM规划情感支持对话,实验表明性能优于多种基线方法。
RLRC:基于强化学习的压缩视觉-语言-动作模型恢复
RLRC通过结构化剪枝、SFT和强化学习恢复及量化,实现8倍内存压缩和2.3倍推理加速,保持任务成功率。
AnalogFed:结合联邦生成式AI的隐私保护大规模模拟电路发现
提出首个基于联邦学习和生成式AI的隐私保护模拟电路拓扑发现框架,防御攻击且不降低模型效用。
RooseBERT:政治语言建模的新方案
为应对政治语言特殊性,提出领域预训练模型RooseBERT,在政治辩论分析任务上优于通用模型,已开源。
移动吧:基于物理的人机协作
提出物理约束人机协作基准Moving Out及方法BASS,增强智能体多样性,有效协作于未见AI与人。
蓝图优先,模型其次:确定性大语言模型工作流框架
提出“蓝图优先,模型其次”框架,将流程逻辑与生成模型解耦,在规划任务中通过率提升97.6%,约束违反减少96%。
OmniRetarget:面向人形全身运动操作与场景交互的交互保留数据生成
OmniRetarget通过交互网格保留人-物-地交互,生成高质量运动数据,仅用5项奖励即实现人形机器人长时间跑酷与操作技能。
EngTrace: 用于工程推理可验证过程监督的符号化基准
EngTrace是符号化基准,用90个参数化模板生成实例,通过两阶段框架验证工程推理的过程与答案。
改造者、实用主义者与活动家:面向可问责自动化决策的公益诉讼
澳大利亚公益诉讼通过改造旧法、社群协作推动自动化决策问责,但面临法律体系限制,亟需制度支持。
基于原型的语义一致性对齐用于领域自适应检索
提出PSCA两阶段框架,用正交原型实现类级语义对齐,几何邻近度加权伪标签,优化哈希编码,提升跨域检索性能。
首先,不伤害:迈向临床安全的大型语言模型
LLM医疗建议潜在严重伤害率达22.6%,80%以上为遗漏错误,亟需显式临床安全评估。
A Multifaceted Analysis of Social Biases in Large Language Models
Vulcan:通过LLM驱动的搜索实现实例特化、可验证的系统启发式方法
Vulcan利用LLM合成系统启发式方法,确保安全与高性能,在调度、缓存、内存中提升效率。
m2sv:面向地图到街景空间推理的可扩展基准
提出m2sv基准,最佳VLM准确率65.2%,低于人类72%,微调有效但跨基准泛化不足,揭示几何对齐和推理一致性差距。
GOT-JEPA:使用联合嵌入预测架构的通用目标跟踪中的模型自适应与遮挡处理
提出GOT-JEPA和OccuSolver,通过预测跟踪模型与精细遮挡推理,提升跟踪器的泛化性和鲁棒性。
Brep2Shape:通过自监督Transformer实现边界与形状表示对齐
Brep2Shape通过自监督Transformer对齐边界与形状表示,双流编码和拓扑注意力实现高精度快速收敛。
PLATE:可塑性可调的几何感知持续学习高效适配器
PLATE利用几何冗余设计低秩更新,仅训练中间矩阵A,无需旧数据即可控制塑性-保留权衡。
乐观性稳定汤普森采样以实现自适应推断
乐观性机制使臂拉取次数集中,实现自适应采样下渐近有效的Wald推断。
从噪声到有序:基于去噪扩散的学习排序
提出生成式排序模型DiffusionRank,建模特征与标签联合分布,在四个数据集上优于判别式方法。
超越MACs:面向视觉骨干网络的硬件高效架构设计
MACs指标不适合边缘设备,提出LowFormer及轻量注意力Lowtention,实现硬件高效加速与优异性能。
重新思考时间序列的多模态融合:文本模态需要约束性融合
发现朴素融合效果差于单模态,提出约束融合适配器CFA,用低秩适配过滤无关文本信息,提升时间序列预测。
并行化工具执行与大模型生成以实现低延迟智能体服务
PASTE系统通过预测并推测执行工具调用,与LLM生成并行,降低任务完成时间43.5%和工具延迟1.8倍。
ThinkJEPA:用大型视觉语言推理模型赋能潜在世界模型
提出VLM引导的JEPA框架,融合密集动态与长期语义,在手部操作预测中取得领先性能。
交互式二维可视化的生物医学时间序列数据标注样本选择策略评估
交互式2D可视化在聚合标注时效果最佳,但个体标注差异大;随机采样最安全,2DV使任务更有趣。
DiffAttn:基于扩散的驾驶员视觉注意力预测与LLM增强语义推理
提出DiffAttn扩散框架,结合Swin Transformer与LLM推理,实现驾驶员注意力高精度预测,性能最优。
对抗大语言模型训练中的数据漂白
针对数据漂白攻击,提出合成数据还原方法(SDR),利用辅助LLM重构训练类似查询,恢复检测信号。
像锤子一样,既能建造也能破坏:Reddit上网络安全运营中大型语言模型的使用、认知与采纳
安全从业者用LLM提升低风险任务效率,关注企业级平台,但可靠性与安全问题限制自主权。
好奇心-评论家:累积预测误差改进作为世界模型训练的可处理内在奖励
Curiosity-Critic以累积预测误差改进为内在奖励,通过评论家分离认知与随机误差,加速世界模型训练。
婴儿自发运动噪声提升深度强化学习中的探索
婴儿自发运动噪声的时域相关性可提升深度强化学习探索效率。
SP-GCRL: 不完整社交图上的影响力最大化
提出SP-GCRL框架,结合非线性扩散与图对比强化学习,实现在不完整图上高效、可扩展的种子选择。
人工智能时代的可持续金属有机框架水收集器
AI加速MOF水收集器设计,通过预测合成与反设计优化捕水效率与稳定性。