监管社交媒体平台下的语言演化模拟:大语言模型与遗传算法的协同方法
基于LLM和遗传算法的多智能体框架模拟社交平台监管下语言策略演化,实验表明对话连续性和信息传递准确性提升。
RTSGameBench:面向视觉语言模型策略推理的即时战略基准
基于RTS游戏评估VLM战略推理,含诊断小游戏与自进化生成框架,揭示VLM复杂对战局限。
全球宜居指数:主要经济体纵向分析的机器学习框架
提出基于机器学习的全球宜居指数,结合PCA和因子分析法量化主要经济体生活水平,为政策改进提供工具。
超越推理增益:缓解大型推理模型通用能力遗忘
提出RECAP方法,通过动态重调目标权重,在保持推理能力的同时防止RLVR训练导致的通用能力遗忘。
用AI规划学术知识的未来:社区视角
针对学术知识结构化需求,本文促进跨学科协作,共塑AI未来研究方向。
论射线追踪在城市环境中基于学习的射频任务中的局限性
天线位置和方向是射线追踪模拟关键,优化后相关性提升但定位误差仍为真实数据两倍,城市噪声模拟仍是挑战。
利用离线奖励评估与策略搜索增强生成式自动出价
提出AIGB-Pearl方法,通过轨迹评估器与KL-Lipschitz约束实现安全高效探索,提升生成式自动出价性能。
RoboSSM: 基于状态空间模型的可扩展上下文模仿学习
提出RoboSSM,用状态空间模型Longhorn替代Transformer实现上下文模仿学习,线性推理且强外推,在长任务上泛化更好。
LoRDO:具有低频率通信的分布式低秩优化
LoRDO统一低秩优化与低频同步,引入全秩拟双曲更新,在125M-720M模型上近乎DDP性能,通信减少约10倍。
告别跷跷板:通过混合意图的双重约束实现精准长尾会话推荐
提出HID框架,以混合意图双重约束化解长尾推荐中精度与多样性的跷跷板矛盾,实现双赢并达到新SOTA。
使用可解释人工智能建模全天心电图预测心力衰竭风险
AI分析24小时单导联心电图可预测5年内心衰风险,模型AUC 0.80,优于短时片段,高风险者住院死亡风险加倍。
AI增强的量子点哈密顿量调谐实现马约拉纳模式
基于无监督学习的神经网络自动调谐量子点,通过导电图驱动系统至拓扑相,产生马约拉纳零模式。
机器人学中的运动基元:一项全面综述
运动基元是机器人从人类示范中学习运动的基本模块,本文系统综述其框架、应用与挑战。
PiDR:面向自主平台的物理信息惯性航位推算
PiDR将物理原理融入惯性航位推算训练,在纯惯性导航下减少漂移,测试中定位提升超29%,实现轻量级实时导航。
闪烁型多臂老虎机
提出闪烁型多臂老虎机模型,用随机图约束动作局部性,设计两阶段惰性随机游走算法实现亚线性遗憾。
潜在高斯点云渲染用于4D全景占用跟踪
提出LaGS,以稀疏特征高斯体实现动态场景的4D全景占用跟踪与多尺度推理,在Occ3D上达到SOTA。
MAMA-MIA挑战:推动乳腺MRI肿瘤分割和治疗反应预测的泛化性与公平性
MAMA-MIA挑战提供标准化基准,评估乳腺MRI肿瘤分割与疗效预测,发现准确性与亚组公平性之间的权衡。
ZeSTA:基于域条件训练的零样本文本转语音增强,用于数据高效的个性化语音合成
提出ZeSTA框架,通过域嵌入区分真实与合成语音,结合数据过采样,在低资源下提升说话人相似度。
通过物体共现分析缓解OOD检测中的简单性偏差
提出物体共现分析框架,利用解耦表示和分治策略,有效检测近OOD,缓解简单性偏差。
合成共振:面向成长的人机关系框架
提出“合成共振”概念,描述人机间无需共享感受即可产生有意义关系的结构化动态交互模式,并探讨其价值与伦理。
CADBench:面向AI辅助CAD程序生成的多模态基准测试
CADBench统一多模态基准,含1.8万样本评测CAD生成,揭示专用模型优于VLM但存在模式脆弱性。
Agentra:一种可监督的多智能体企业入侵响应框架
Agentra可监督多智能体框架,将告警转为响应计划,F1提升至0.84,有害动作率降至0%,提高覆盖率与可审计性。
面向LLM代理澄清请求的不确定性分解
提出基于提示的不确定性分解法,在模糊任务中主动请求澄清,多基准上澄清F1提升达73%。
DeXposure-Claw:面向DeFi风险监管的智能系统
基于图时间序列预测与门控机制的监管系统,减少误报并生成可追溯监管报告,经多轴基准验证
面向智能体AI系统运行时治理的道义策略
提出AgenticRei框架,利用道义策略语言实现智能体系统运行时治理,涵盖义务、豁免与冲突解决。
涌现对齐
通过自我审查和DPO训练,LLM能自发纠正不伦理输出,实现在线对齐。
大语言模型不知道它不知道什么:通过临床表格数据上的跨模型归因分歧检测认知盲点
LLM在结构化数据上存在认知盲点,跨模型归因分歧可检测并校准,将校准误差从0.254降至0.080。
REVEAL++: 用于阿尔茨海默病风险视网建模的可微分表型分组
提出可微分表型分组,以连续加权定义软多正关系,端到端学习跨模态对齐与表型结构,优于离散方法。
ITNet:一种包含卷积、注意力和循环的可学习积分变换
ITNet提出统一的核函数为MLP的可学习积分变换,涵盖卷积、注意力和循环,高效且性能超越专门架构。
AI4SE与SE4AI探索:回顾与展望的十年
回顾AI与系统工程十年三阶段进展,指出五项关键研究空白,并推出协作评估工具。
冷启动推荐中的隐式反馈去噪
提出DIF方法,基于内容相似性推断伪标签并估计不确定性,实现冷启动隐式反馈去噪。
基于Agentic RAG的可配置临床信息提取:可行之处、断裂之处及其原因
在埃森大学医学中心部署ACIE,用Agentic RAG处理完整患者数据,经7326项判断,医生接受率达96.5%。
分析LLM-求解器循环中的叙述差距
LLM与求解器交互存在叙述差距,求解器正确输出经LLM叙述后可能失真,难以保证用户最终答案的鲁棒性。
LLM后训练中应比较哪些对?
通过采样设计优化比较对选择,提升偏好学习的数据效率。
基于知识本体的巴西葡萄牙语物理量和技术符号标记化
提出基于知识本体的标记化框架,以声明式分类取代统计方法,在巴西葡萄牙语物理量上实现高原子性和数值重建,超越基线。
中文标题:重思或长思?预算感知推理的选择性验证
中文摘要:提出SEVRA方法,选择性验证可提升准确率并减少有害翻转,但优化初始推理预算效率更高。
知识工作者问答论坛中的最优调度
研究知识工作者论坛中基于专长的请求调度,计算系统容量并设计最优策略,探讨协作提升容量。
通过演化程序化瓶颈解释神经组合优化
提出EPB框架,将黑盒神经组合优化蒸馏成可读程序组合,揭示其行为近似经典启发式变体。
基础推理:确定性封装生成模型的原则
本文定义AI混合架构的四个基元实现概率模型确定性封装,识别两大反模式,为AI安全融入传统系统奠定基础。
AgentFinVQA:一种可部署的多智能体流水线,用于可审计的金融图表问答
AgentFinVQA多智能体流水线实现可审计金融图表问答,精度提升7.68个百分点,验证器提供置信信号,主要错误为误解与提取。
超越熵:从令牌级分布偏差学习大语言模型推理
ICT框架通过令牌级JS散度偏差选择性更新,平衡熵崩溃与爆炸,提升LLM推理,平均pass@4提升4.58%。
CombEval:评估大型语言模型中组合计数能力的框架
提出CombEval基准评估LLM组合计数,发现模型在有序对象等场景脆弱,提供诊断测试平台。
多智能体交互记忆
提出多智能体交互记忆框架,通过共享和检索智能体轨迹,提升任务执行效率,减少交互步骤。
eCNNTO:一种高度泛化的卷积神经网络,用于加速拓扑优化
提出eCNNTO,利用残差CNN预测元素密度,跳过大量迭代,小数据集训练即可泛化,2D/3D迭代减少90%/97%。
ENPIRE:现实世界中智能体机器人策略的自我改进
ENPIRE框架使编码智能体在现实世界中自主改进机器人策略,实现99%成功率的灵巧操作任务。
奖励即代理:面向具身世界模型
提出奖励代理与动态探索框架,以可靠验证支撑广泛探索,缓解奖励破解,提升世界模型精度。
面向广义PINNs的去模块化冲突规避训练
针对过参数化PINN因功能模块化导致训练失效,ModSync通过惩罚专用连接、保留交互路径实现鲁棒耦合,达到最先进精度。
基于流的生成模型的残差空间进化优化
提出残差空间进化优化,融合流生成编辑与进化算法,通过自授粉和交叉授粉平衡目标对齐与多样性。
基于多头注意力的特征提取器与软演员-评论家集成用于增材制造孔隙率预测及工艺参数优化
提出多头注意力与SAC集成架构,实现增材制造孔隙率预测与参数优化,14回合收敛值322.79,优于标准RL方法。
学习提示:通过自适应LLM的高中辅导提高学生参与度
基于14个教学特征的自适应提示路由系统,模拟优于基线,实际应用减少交互,随机策略提高转化率至28.1%。