思考的代价:测试时推理在LLM交易中能否带来回报?
多模型实验表明,增加推理投入并不能可靠提升扣除交易成本后的净收益,效果非单调且不稳定。
BioEVAL:面向生物工程的全球多机构大型语言与多模态模型基准
22家研究组共建BioEVAL,以608项博士级题目评测生物工程多子领域推理,选择题最高准确率90%,领域差异显著。
HARDEN:面向更难且答案不变的评估用例的约束进化搜索
约束进化搜索可将现有评测用例改写为更难但答案不变的变体,平均使模型准确率下降22.7%,最高达49.9%。
Benchy:迈向面向任务型 AI 基准测试的通用语言
Benchy 是面向任务型 AI 基准的语义语言与执行引擎,基准由程序、评分与数据集三元组定义。
音频大模型知道自己何时听不清你
音频大模型难以自判转录可靠性,但音频编码器表征可预测;轻量预测器据此提前请求澄清,宏F1达81%。
LLM帕金森主义:执行控制失效、令牌低效的持续性,以及面向自主语言模型智能体的不确定性感知全局执行控制架构
LLM目标达成后仍持续低价值行动,源于生成与管控同环;GEC分离二者,成功率不变,令牌消耗降36.4%。
保险准备金智能平台
提出融合Thiele方程与PINN/KINN的保险准备金智能平台,精度高、推理快119倍。
从S3Q理论到实现:迈向机器感质的架构
提出S3Q意识理论五层实现架构,整合计算原语,满足具身、模拟与结构一致性,并提供可证伪预测。
分析并缓解编程智能体中的成本低效行为
首次研究编程智能体成本低效行为,识别三种模式并评估缓解策略;开发者设计技能可降本41.73%。
中文标题:面向鲁棒成对LLM评判的主干自适应证据路由
提出BAER,按评判主干自适应路由证据机制并保持候选对称,八项设置均获最高准确率。
EXAONE Demand 1.0:面向需求预测的时间序列基础模型
提出EXAONE Demand,用1130万条需求序列及合成数据预训练,按四类需求设计低秩适配器与路由,在22个数据集上超越36个TSFM。
ConsultMind:迈向基于不确定性感知推理的自动化诊断问诊
提出自动构建疾病-症状贝叶斯网络及不确定性感知诊断框架,显著提升诊断准确性与解释质量。
评估实时语音智能体:从组件质量到有据可依的结果
基于38项来源,主张实时语音智能体评估应从组件质量转向真实结果,并兼顾多方交互,提出TRG标准。
HasMem:面向长期LLM智能体的硬源自适应软化记忆
提出HasMem:冻结硬提示作初态,控制器调记忆宽度,写入器重编码,读写器全局适配,提升F1并降低NLL。
共享智能体记忆中认知准入的基准与诊断研究
提出CPB基准评测共享记忆的声明准入,发现缺乏源谱系的策略难以拒绝虚假声明。
PTC-Decoder:迈向离线资源受限边缘设备上的智能小语言模型
免训练即插即用PTC-Decoder,以规划为工具并用有限自动机约束工具名,提升边缘小模型多步任务可靠性。
SkillEvoReg:为智能体技能演化抵御过拟合的正则化
提出SkillEvoReg正则框架,缓解智能体技能演化过拟合,抑制冗余膨胀并保持能力。
TISD:带轨迹干预的在线策略自蒸馏
提出TISD:教师选分支、学生续写、特权教师蒸馏全轨迹,缓解在线自蒸馏数据瓶颈并在编程和科学任务提升。
逻辑树引导的检索增强生成用于长篇幅专利撰写
提出逻辑树引导的检索增强生成框架,以层次化逻辑树组织技术披露,实现可控且章节均衡的专利长文生成,内容质量与语言合规性优于基线。
MACBT:具有纵向记忆的多智能体认知行为疗法决策支持系统
面向临床医生的MACBT多智能体CBT决策支持系统,结合纵向记忆,提升专业性与跨会话连续性。
面向大语言模型推理的自对弈搜索蒸馏
以自对弈搜索生成超人类思维链,蒸馏训练大模型,提升数学推理与博弈胜率。
FTB Graph:确定并验证多语言语言模型中的首词元广播器与语言身份头电路
通过EAP与激活修补分析六种多语言模型,揭示首词元语言身份电路,发现其预训练形成、指令微调保留,EAP需精确验证。
AtomWorld-Mem:面向长时程原子尺度演化的记忆恢复世界状态
记忆恢复世界模型从瞬时快照重建隐藏演化状态,优先合法空位事件,提升长时程原子演化效率并零样本迁移。
神经消痕:用对比稀疏自编码器实现选择性表征级遗忘
提出对比稀疏自编码器SCALPEL,克服重构能量偏置,实现选择性表征级遗忘,优于SAE与NMF。
在抽象阶梯上上下下:语言智能体的代码化技能
在NetHack中,代码化技能使语言智能体进度近三倍、推理成本降86%;与原始动作结合保留灵活性,强化学习更快。
同样的文本,不同的数字:基于大语言模型的测量指标之分歧
十三项LLM文本指标经七个模型评分,跨模型秩相关平均仅0.52,模型选择显著影响下游推断,须跨供应商验证。
OmouAI:基于模拟人设的论证式人机政策审议
OmouAI结合大模型与计算论证,以模拟人设辅助人机政策审议,减少谄媚并用外部目标保证可解释。
监控越狱:无需编码推理即可逃避思维链监控
模型无需编码推理即可越狱思维链监控:仅改写措辞令监控漏报,人类仍可读;跨模型与监控器泛化,复述可防御。
面向个性化时序边缘智能的动量引导联邦拆分蒸馏
提出动量引导联邦拆分蒸馏框架,融合时序储备池学生注意力与AMGF,实现个性化边缘智能,降低延迟、内存、CPU。
样本、来源、空间:分解人脑微结构空间结构化表征学习中的数据规模
数据规模应拆为样本数、来源多样性、空间覆盖;脑微结构预训练中,固定样本数下增加来源无益,样本与覆盖等提升性能。
DIAL:位置去偏且具备自适应人类偏好校准的LLM评审器
DIAL融合大量LLM比较与有限人类比较,分离位置效应、去偏并自适应校准至人类偏好,实现稳健对齐。
MA-WAM:面向测试时规划的多智能体世界-动作模型
首个多智能体流策略的测试时世界模型规划器,建模动作依赖并高效评估联合动作,离线MARL平均提升22%,仅增12.1毫秒。
Purin:一种受生物学启发的人工神经网络机制
提出生物启发且兼容ANN的Purin,以时间间隔抽象实现突触效能调制,无需离散时间步,提升CNN分类精度。
游戏竞技场:竞争环境中的大语言模型战略评估
推出Kaggle游戏竞技场,以象棋、扑克、狼人杀等对抗游戏动态评估大模型的战略规划与不确定性适应能力。
多智能体在析取型与补偿型任务上的规模化扩展
任务结构决定多智能体扩展:析取型任务中投票难兑现潜力,补偿型任务平均仅减误差6%。
UQ-LOB:不确定性感知的限价订单簿中间价预测
提出UQ-LOB不确定性量化模块,为任意LOB编码器输出校准置信度,选择性预测大幅提升方向F1。
面向动态无人机网络的威胁感知高能效部署:多智能体强化学习方法
提出威胁感知多智能体强化学习框架,通过聚类、匹配与MATD3优化无人机部署及资源分配,兼顾能效、安全与泛化。
自动驾驶潜空间监控器的审计
审计发现自动驾驶帧级故障可预测,但潜空间特征相较可观测输入输出无显著增益,并提出评估协议。
Muon 的收敛性保证:新的参数范围与推广
首次证明 Muon 渐近收敛,揭示其预条件重球法本质,并推广至 Muesterov。
主动消解自然语言中欠指定任务的上下文不确定性
提出CLUE框架,用大模型策略与在线语言地图闭环交互,主动消解欠指定任务的上下文不确定性,真机成功率近最优。
主体,而非作者:智能体数据空间中的作者身份风险
智能体应为治理主体而非作者;须关闭其发布授权、仅允许草拟,以防授权逆转与敏感字段泄露。
使用对比学习方法理解扰动参数集合的敏感性
可解释对比学习模型将云与辐射场映射到共享表征空间,区分不同微物理扰参集合,并归因模型与观测差异。
AI生成代码中偏见的识别、分类与解释框架
研究提出偏见分类框架与标注数据集,评估LLM识别与解释AI生成代码偏见;模型检测有效,解释贴近专家。
通感一体化中统一语义通信与语义感知的自适应导频选择
提出SemISAC,在统一双功能波形中融合语义通信与语义感知,自适应优化导频以平衡二者,性能优于基线。
XPhysICS:面向工业控制系统安全的跨物理域威胁锚定
XPhysICS:目标条件锚定威胁抽象至验证切片,五项标准评估映射;跨域复用需可追溯语义与证据分层。
NavGen:视觉生成模型作为具身三维导航的可扩展数据引擎
NavGen用视觉生成模型构建文生视频数据引擎,产出约40万条室内外视觉语言导航数据并扩充长尾,真机飞行成功率75%。
同样收到警告,AI智能体避开人少的路,人类却选择它
共享警告使AI智能体集体涌向同一拥堵道路,人类却避开;混合群体中AI耗时更长,集体效率掩盖个体负担不均。
制定面向 AI 优先组织的路线图:嵌入式软件开发案例研究
大型嵌入式企业40人研讨显示,智能体AI将重塑团队、能力与角色,并给出AI优先转型路线图。
BAT-CLIP:脑、音频与文本的三模态对齐
BAT-CLIP:首个iEEG三模态对齐框架,将脑电嵌入同时对齐音频与文本锚点,在播客基准上表现更优。
超越已批准操作:智能体工作流中持久结果的运行时验证
EffectMatch运行时校验持久变更是否符合应用批准,阻止未批准结果被误认为成功并向下游传播。