五角大楼一位意见领袖称自由派女性是“瘟疫”,将终结西方文明
库尔特·施利希特参与军校清除所谓“觉醒”意识形态的工作组,并呼吁禁止无子女成年人投票。
再谈智能体、Meta Connect 与 Meta 企业平台
Meta有机会主导消费级智能体市场,进军企业市场是重大失误。
Protego Ventures完成首支1.25亿美元基金,专注以色列国防科技
以色列首家、最大国防科技风投Protego Ventures完成1.25亿美元首期基金最终关账。
Beats 360 评测:可定制、时尚又有趣
Beats新旗舰耳机可定制、时尚、有趣,适合运动,但日常使用有更好选择。
DevDay 2026 回顾
DevDay 2026 发布20余项更新:GPT-6 Astra、ChatGPT、Codex、API 及安全与开发者新工具。
推出 GPT-6.1 Sol
Sol智能接近Astra,擅长编程、电脑操作与专业工作,API输入输出token价仅为其五分之一。
未来属于每个人:面向小微企业的 Muse
推出面向小微企业的 Muse 个人 AI 智能体,在后台自动运作,助其达成目标。
塑料正在熔化并附着到珊瑚上
科学家发现一种新型污染:塑料与珊瑚碎片不可逆地交织在一起。
Meta与政府机构、执法部门及安全组织合作,启动区域性反诈骗教育宣传活动
Meta携手政府、执法与安全组织,在亚太18国推出反诈骗教育,触达超3亿人。
2026年送给植物爱好者和园丁的19件最佳礼物
从智能应用、花盆到独特工具,这些礼物能让园艺小白进阶为养植达人。
前特斯拉团队融资1250万美元,让供应链实现“自动驾驶”
Atomic的代理式供应链软件已被DoorDash、HelloFresh等公司采用。
@gdb:保障前沿强化学习训练的实用指南,基于我们当前的经验总结
保障前沿RL训练安全的实用指南,基于现有经验总结。
@OpenAI:我们对前沿强化学习训练运行安全保障的思考:https://t.co/yrvjpfa7Pd
OpenAI 阐述其对前沿强化学习训练运行安全防护的思考。
Anthropic招股书披露亏损、增长,还有——没错——其AI可能终结人类的警告
Anthropic招股书显示年亏损数百亿美元但增长迅猛,并警告其AI或构成人类生存风险。
@emollick:嘿,Claude:“我曾让早先的Claude从《西线无战事》中移除鱿鱼。现在你都能拍电影之类的了。我需要你展示一下你进步了多少”;我把下面这条推文粘贴了进来
作者让Claude展示进步,称帖中内容巧妙、模型如今已有幽默感。
与AI共事:人机协作设计框架
提出人机协作设计框架,统筹人、AI系统、任务、组织与社会环境,并以协作机器人装配案例演示其落地应用。
LLM引导的本体驱动非结构化文本知识图谱构建
以7B–32B开源大模型结合可复用提示,从法文电网事故报告构建OWL本体与知识图谱;模式引导提示可显著提升抽取质量。
SMARtCARE:面向有限自主临床决策支持的隐私保护智能体AI系统
四态架构融合六通道有损指纹,触发医生审查与授权检索,经MIMIC数据验证决策可追溯。
OMP-MoE:基于正交匹配追踪的混合专家大语言模型高效专家剪枝
OMP-MoE免训练框架,用正交匹配追踪把专家剪枝转为稀疏信号重建,25-50%剪枝率下性能领先。
基于LLM生成的ACSL契约与确定性驱动生成,用CIVL验证PETSc
用LLM生成ACSL契约、确定性驱动,经CIVL验证PETSc三函数,发现MatAYPX的缺陷。
域适应何时有助于物理振动传感器?基于留出轴承的神经算子与卷积模型研究
留出轴承协议下迁移仅0.36;傅里叶神经算子在阶次域达0.95,表明输入表征而非对齐方法决定域适应成效。
COUNTERMEM:面向语言智能体的世界模型验证式反事实记忆
用可执行世界模型验证失败后的反事实记忆,12项基准平均提升12.6个百分点,token降7.7%-42%。
见证重叠:开放权重模型家族内的方向性溯源
见证重叠法免训练免提示,以同族第三检查点为见证判断父子方向,176个模型上准确率95.3%。
什么驱动了方言越狱?表面形式、文化框架与策略库的消融研究
方言表面形式非高攻击成功率必要条件,优化器控制的策略库才是主因,文化中性策略库同样达近满分。
稀疏重叠下的LLM评审验证:从推断到设计
重叠稀疏致LLM评审验证错判:5%重叠时错判率达25%。提出最小重叠量ρ≥0.25及零成本分层分配,可使错误拒绝率减半。
不平衡SAR船舶分类中的跨数据集迁移与未知类检测
六模型在两SAR船舶数据集上评估域内、跨集迁移与未知类检测;跨集泛化差,任务不确定性常优于MC-dropout方差。
CP-Agent:面向晶体塑性仿真工作流的框架工程化智能体
基于LLM的CP-Agent自主完成晶体塑性建模全流程,四案例验证参数校准与织构复现。
ChestPheNoT:可部署、可审计的放射学报告标签-状态-证据抽取
提出0.5–3B模型,从放射报告联合抽取标签、三分类状态和原文证据,可本地部署审计,跨机构表现优。
EEGAgentBench:面向短时程与长时程脑电分析的LLM智能体基准测试
提出EEGAgentBench基准,含6类脑电任务、2秒至23小时信号与10种工具,评测29个LLM,发现其长时程证据累积与多步推理不足。
基于共享表示与领域特定头的IMU数字笔年龄自适应手写重建
提出共享表示与领域特定头的跨域网络,提升IMU数字笔跨年龄手写重建,无需用户适配。
对称商平坦性与泛化
建立对称商平坦性理论,关联商线性稳定性、输入平滑性与泛化。
时间拔河:通过轨迹方差可视化与检测扩散模型中的RAG冲突
提出轨迹方差分数TVS,以多条去噪轨迹答案嵌入的余弦距离检测RAG与参数知识冲突,轻量且跨架构有效。
ConflictVLA-Bench:评测视觉-语言-动作模型对前提冲突的行为响应
提出ConflictVLA-Bench,发现VLA面对前提冲突常现“失败坚持”,仅看结果不足以评估。
DriveHierarchy:从开环理解到闭环执行诊断VLM驾驶能力的基准
提出分层基准DriveHierarchy,覆盖感知、记忆、推理与闭环执行,评估15个VLM,贯通开环理解与闭环驾驶,助力诊断优化。
将视觉语言模型锚定于驾驶语义:面向可解释推理的多数据集谓词框架
提出跨数据集谓词框架,从可测证据推导驾驶语义并构建谓词知识图谱,F1达0.94/0.93,提升九项问答中七项准确率。
PalmLeaf-VQA:面向多地区历史贝叶手稿理解的多文种视觉问答基准
多文种贝叶手稿视觉问答基准,覆盖南亚东南亚八类藏品;最强多模态模型准确率仅58%,罕见文字与退化版面理解仍难。
AI支持的循证学习对公共演讲技能发展的评估
AI结合演讲情境提供针对性反馈与示范演讲;学生练习后表现提升,填充词减少,焦虑降低15%–34%。
静默自由度中的回放:无需离线阶段的持续学习
无需离线阶段,靠静默自由度回放巩固;旋转增益最大,隔离保不变,类增量MNIST达91.6%。
面向消费者投诉评估的情感分布建模与异常检测
将投诉负面情感视为有界连续变量,用贝塔分布建模并结合金额与回复做异常检测。
IndustryLLM:面向工业采购的失败驱动大语言模型训练
提出失败驱动训练的工业大模型IndustryLLM,融合国标与真实交易语料,线上GMV增4.25%,延迟由6-7秒降至1.5秒。
Metro-WM:基于可实现子目标的长时程潜空间规划
Metro-WM用经验真实状态构图,生成可实现子目标,完成长时程潜规划,成功率更高、速度更快。
文献引导的描述符组分搜索空间过滤框架
文献引导描述符过滤框架:词嵌入选描述符构建帕累托过滤,平均剔除74%候选组分,最优值误差1.9%。
下一事件准确率无法揭示的问题:急诊科轨迹模拟器的闭环评估
急诊轨迹模拟器仅靠下一事件准确率不足;闭环评估揭示误差累积、模型分歧及下游任务排名反转。
一步最优:无条件整流流是 Noise2Noise 去噪器,多步积分可证明有害——低剂量 CT 的基准与基于任务的可检测性研究
无标签去噪单步流最优,多步积分偏离MMSE降保真,配对关键;低剂量CT中PSNR升但病灶可测性反降。
FIDAL:真实世界分布偏移下的多样性感知联邦主动学习
FIDAL融合不确定性、多样性与自适应OOD剔除,在开放集联邦主动学习中提升医学影像标注效率与精度。
一次评估,任意工作点:超网络摊销MeanFlow用于3D MRI重建
超网络将采样模式等运行点映射至单步MeanFlow,一次评估重建3D MRI,学习采样掩膜增益显著,支持自监督。
视频扩散训练中时间注意力头的专门化
逐头普查视频扩散训练:整体集中度不升,仅少数头专门化,结构见于首个时间块,注意力呈自帧与邻帧局部路由。
Enhancing Foundation Models for Imbalanced SAR Ship Classification via Targeted Oversampling
提升端壁气膜冷却预测泛化能力:将叠加原理融入基于Transformer的神经算子
提出融合叠加原理的Transformer神经算子SDNO,两阶段预测端壁气膜冷却温度场,对未见10–20孔布局泛化强且更准。