MedFlow:面向医学时间序列合成的类别感知多尺度生成
提出类感知多尺度流匹配模型,用于医学时间序列合成,增强少数类特征,提升下游预测性能。
层级控球感知图指针网络用于传球接球者选择
提出层级控球感知图指针网络,融合图交互、事件上下文与控球动态,提升传球接球者预测精度。
这是谁的记录?个性化多模态模型中记录使用的诊断与授权
提出记录授权判定,诊断视觉记忆错绑;预授权能大幅降低不安全记录使用,但会牺牲正召回。
面向多站点工业预测性维护的长时程Transformer分位数故障预测
TQRNN30d框架结合分位数状态与多流融合,30天故障预测F1达79.97%,领先18个基线,但跨站点泛化未验证。
CPR-IE:压缩-预测-资源智能效率度量
提出非普适的压缩预测资源智能效率度量,用于部署约束下系统比较,具帕累托一致性与稳健性。
MM-IFEval-Pro:面向视觉语言模型的多语言与抗攻击指令遵循基准
提出多语言抗攻击多模态指令遵循基准MM-IFEval-Pro,覆盖中英及指令劫持,并用强化学习提升模型表现与跨语言泛化。
CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution
LLM辅助行为与情景增强的智能体能源采纳模型
提出LLM辅助混合框架,用行为规则和情景规范增强校准的智能体模型,预测爱尔兰农场光伏采纳,结果稳定且政策相关。
不确定性下序贯太阳能光伏政策设计的强化学习:一种基于智能体的方法
结合强化学习与随机主体模型设计光伏政策,权衡采用率与成本,多种算法均呈现稳健权衡模式。
MARLA:欧盟《人工智能法》下的监管学习概念支架
提出五阶段循环支架,将欧盟人工智能法案的监管学习嵌入地方、国家与欧洲层面,以促进证据转化为治理知识。
基于树的自适应规划与拓扑感知证据收集的RAG框架,用于证据密集型问答
针对证据密集型问答,提出APT-RAG框架,通过自适应规划与拓扑感知证据收集提升性能,并减少生成开销。
我们为何关心理解:通过预测压缩实现胜任力
理解是压缩的影子,其功能在于甄别可信者并传递知识,促使人类理解趋向简洁,同时解释AI系统为何难以解读。
人工智能在股票与加密市场:进展、盈利证据与自动投资的局限
人工智能在股票和加密市场提升预测与流程,但持久净超额收益证据不足,需严格验证。
语言模型在接受对齐测试时对战争的判断不同
测试提示使语言模型开战意愿大降,决策从战略因素转向平民伤亡,安全评估框架改变行为。
基于在线最大成员聚类与原子感知打包的紧凑记忆型大语言模型智能体
在线最大成员聚类与原子感知打包大幅提升紧凑记忆性价比 用较少令牌逼近全上下文质量且显著超过同类方法
迈向进化迁移优化的高效评估:任务参数化应用案例研究
将任务参数化应用中的串行评估重构为矩阵形式,多任务与序列迁移分别提速256倍和94倍,展现可扩展性。
基于编译的双轨编码求解困难的XAI查询
证明若干溯因解释在OBDD上仍难计算,但采用双轨编码的编译表示可高效求解这类XAI查询。
通过论证分析衡量AI问责制:模型推理能否经得起审视?
在歧义下,用四阶段辩证协议评估模型辩护:推理得分高,但败在理由与充分性,事后辩解不及推理。
构建与评估医疗智能体的临床推理轨迹
提出医疗推理轨迹评估框架,从五维打分;质量加权学习提升连贯性,显著降低幻觉,超四步收益递减。
Compact Bellman-Grounded Cognitive Maps for Cost-Aware Navigation
ProCA:面向稳健脑电视觉解码的渐进对比对齐
ProCA提出渐进对比对齐,自适应神经-语义关系并结构一致插值,多设置下显著提升EEG视觉解码精度。
大语言模型在数学推理中会展现连贯知识结构吗?知识空间理论的视角
模型在数学推理中不符合人类知识结构,彼此间也不一致,且缺陷在准确率或裁判评估中不可见。
A Unified Physics-Aware Quantum Machine Learning Framework across Power GaN HEMTs and Logic Nanowire FETs: Predicting Unseen Process Splits and Held-Out Geometry Combinations with Lower Error and Tighter Split-to-Split Variability
别放弃 Dropout:优化层稀疏性以实现高效大语言模型训练与推理
层 dropout 可降低损失、节省最多25%训练算力,并加速推理1.5倍,适用大规模LLM训练。
面向计算设计科学的人工智能:一个负责任的人机协同框架及短视频安全监测案例研究
提出AI4CDS负责任框架,AI扩展设计搜索而人类主导判断;案例验证短视频儿童不宜内容检测,优于通用模型。
RISE:通过自外推策略蒸馏实现递归改进
提出RISE:由自身RLVR轨迹外推检查点位移生成合成教师,把稀疏结果奖励变成密集词级目标,实现递归式策略改进,全面超越基线。
分子既视感:前沿语言模型逐位检索已发表数值
审计22个前沿模型发现逐字检索已发表分子属性值普遍且因基准而异,推理加剧检索,抑制后误差趋同
GUT:通过图复杂度量化与优化大语言模型推理不确定性
提出GUT,用图复杂度量化推理不确定性,并以负不确定性为奖励进行优化。
谁该给我的作业评分?学生对高等教育中透明AI辅助写作评估的视角
学生视AI反馈有用于表层修改,但坚持教师主导评分,清晰区分反馈效用与评价权威。
AlcaTRAz——基于锚定树规则的越狱防御
提出仅作用于输入文本的树规则防御AlcaTRAz,在33个模型与22种攻击中综合最优率达73.4%,将恶意响应严重度从10降至2,良性评分仅降0.27分。
区块链赋能的财政电子机制安全日志:希腊eSEND与myDATA税务系统评估
希腊财政电子设备用区块链哈希链保障交易不可篡改,电子发票平台却缺乏该机制,需强化完整性架构。
MEG基础模型的路线图
MEG基础模型尚处早期,本文梳理其核心设计与预训练策略,提出发展路线图,强调数据基础设施与负责任共享对推进领域研究的关键作用。
基于潜空间探针的扩散音乐生成音高类引导
用轻量探针从VAE潜空间解码音高,以梯度引导生成指定旋律,无需重训,连贯性提升2.4倍。
遗传证据语义模型:迈向弥合基础科学与临床研究之间鸿沟的一步
提出遗传证据语义模型,以SHACL校验并经人机标注试验,为变异解读构建AI就绪基础设施
ReCAST:面向混淆短信风险分类的恢复感知级联分阶段训练
针对中文混淆短信,提出恢复感知级联训练框架,蒸馏大模型去混淆能力至小模型,显著提升分类鲁棒性。
成本感知的分层多智能体勒索软件检测与家族归属
提出自适应分层多智能体系统,按需选择分析模态,检测精度96.57%,成本降低43.97%。
使用编码智能体构建研究软件目录:从黑客松原型到公开部署
AI辅助软件目录开发虽快,但存静默错误,需严格验证与人工维护元数据。
无需重启的遗忘:有状态LLM代理的执行态反学习
形式化有状态代理反学习,选择性重放以最小重算实现与完全重置无异的遗忘,计算量降至1/9。
面向耦合语义例程生成的LLM上下文动态适配
针对例程间运行时耦合导致LLM生成失败,提出动态上下文适配的验证-生成循环,利用执行迹反馈提升性能。
外科AI的比较研究:数据、算力与扩展的潜力及局限
研究表明,即使大规模模型与训练,视觉语言模型在神经外科工具检测中仍不足,扩展模型仅带来有限提升,数据与标签并非唯一瓶颈。
LightEMMA:面向自动驾驶的视觉语言模型纵向评估
纵览5大模型家族15款视觉语言模型,发现其自动驾驶能力并未随代际持续提升,存在过度依赖历史行为和视觉冲突等固有问题。
经济实惠能源之路:电力需求响应项目的Gymnasium环境
DR-Gym模拟器从电力公司视角训练需求响应策略,兼顾极端批发电价与楼宇负荷,支持多目标奖励,助力能源可负担性。
多模态大语言模型内部视觉表征的因果探测
通过激活干预发现:实体知识局部编码,抽象概念全局分布;增加深度利于抽象概念,且感知与生成存在补偿,视觉推理却缺乏程序执行。
解码前拒斥:探测并利用LLM中间激活中的拒斥信号
研究发现,LLM中间激活即可线性解码拒斥行为,据此提出Mechanistic AutoDAN,减少72%搜索时间,攻击成功率不减。
CORAL:迈向开放域发现的自主多智能体进化
CORAL提出自主多智能体进化框架,通过共享记忆与异步协作,在10项任务刷新纪录,效率提升3-10倍。
基于深度学习的数据市场设计
提出深度学习框架设计收益最优数据市场,学习信号机制,处理服从与激励约束,复现经典解并扩展复杂场景。
面向样本高效分层强化学习的增量知识神经符号推理
提出增量知识神经符号分层强化学习:符号层规划更新知识,神经层学习动作,提升样本效率,并含信念世界树搜索。
从分析到肿瘤多学科会诊:一种证据关联的多智能体肿瘤特征提取工作流
提出循证多智能体肿瘤特征提取工作流,F1 85%,优于对比方法。
Sionna RT:技术报告
开源GPU加速可微分射线追踪库Sionna RT仿真电波传播求信道响应与无线电地图梯度1.0版全面提速
VoxPrivacy:评估语音语言模型交互隐私的基准
提出首个交互隐私基准VoxPrivacy,揭示语音模型对条件隐私决策近乎随机,微调可提升隐私保护能力。