亚马逊称不再为数据中心使用保密协议
亚马逊宣布停止与县官员签署秘密协议,承认社区反对可能导致全国数据中心暂停。
2026年最佳智能猫咪追踪器:Fi Mini 与 Tractive 对比
经数月监测Basil的活动与睡眠,我发现Fi和Tractive猫咪追踪器各有取舍。
你的投资人可能成就也可能毁掉你的初创公司。创始人真正需要在股权结构表中纳入哪些投资人
创始人应有意选择能带来多元价值的投资人,而非谁愿投就纳入股权表;嘉宾分享三点筛选建议。
航海及海洋初创企业融资加码
过去一年,风投向海洋相关初创企业投入近30亿美元,重点为自主船舶、水上机器人、电动船艇和海洋数据。
记者手记:欧洲主权AI推进既需资本也需客户
Crunchbase News研究负责人Gené Teare在阿姆斯特丹HumanX主持讨论,对话欧洲和中东AI生态领袖,分享与Axelera AI、AI71高管的交流片段。
你的无人驾驶出租车正在监视你
Waymo、Zoox和特斯拉的自动驾驶车布满摄像头与传感器,部分镜头正对着乘客。
选举否认者认为共和党糟糕的中期选举民调是“心理战”
数十名知名MAGA网红和评论员纷纷置评。Catturd在X上称:“可笑的假民调正纷纷出炉。”
ChatGPT Mac 应用漏洞本可让黑客窃取敏感数据
AI代理的黑客能力受关注,但ChatGPT应用新修复漏洞表明,AI软件自身也是诱人、脆弱的攻击目标。
医护人员厌倦了替 Palantir 收拾烂摊子
某医院巨头与放射网络引入 Palantir 优化排班,护士等员工称新软件错误频发,令人疲惫沮丧。
AI把护士排班搞得一团糟,护士称这关乎安全问题
医院巨头和放射网络用Palantir优化排班,护士等称新软件致错、倦怠,且危及安全。
新竞赛让参赛者相互较量,竞逐生物学青春
本周我正式报名参加奇特竞赛:奖励“变年轻”。四十岁的我深知实际年龄只增不减,但比赛聚焦生物学年龄。
@elonmusk:在 XChat 中向 @Grok 提问
@elonmusk 发帖:在 XChat 中向 @Grok 提问
别被蒙蔽了——大语言模型并不会推理
2016年首尔人机围棋五番棋第二局,第37手看似荒谬;作者借此引出大语言模型不会真正推理。
@elonmusk:超级智能(原称AI)如今在会计考试中轻松拿高分
马斯克称,超级智能(原称AI)已在会计测试中轻松取得高分。
@deepseek_ai:请查看 @DeepSeekHarness。我们刚刚发布了适用于 macOS 和 Windows 的打包桌面版;Linux 用户可从 npm 上的 @deepseek-ai/dsh 包获取。https://t.co/Cde0dZ6cPy
DeepSeekHarness发布macOS/Windows桌面版,Linux可用npm包dsh
[AI新闻] Pi 1.0、Pi Durable 与 AIE NYC
Pi 1.0 让极简框架稳定并支持 TS;另含 Pi Durable、AIE NYC。
@karpathy:很酷的评测。只需向LLM提问“陆地还是海洋?”,并以文本形式给出经纬度坐标。问16200次,绘制成图像。模型全都知道。源于对互联网的压缩。
向LLM询问经纬度坐标是陆地还是海洋,共16200次并绘图,模型能准确判断。
AWS Strands Labs 发布 Strands Decider 2B:一款约 115 毫秒即可选出选项的开源决策模型
基于Qwen3.5-2B的开源决策模型,单次前向输出选项与置信概率,中位延迟115毫秒。
@dotey:😂 Claude Code 可以借助 Mod 做到吗?
询问 Claude Code 能否借助 Mod 做到。
AutoSynthData:为企业级智能体生成训练数据
未提供摘要,无法提炼。
长时程语言智能体中的重尾记忆轨迹
揭示智能体记忆呈核心-尾部重尾分布,提出CTWM按秩分配提示预算,节省token并降低尾部预测误差。
基于时序分割与语义抽象的自我中心与外部视角程序理解框架
多模态工作视频经边界分割与事件卡片抽象,增量构建工作环境模型,实现隐私约束下紧凑可审计的检索。
STATERA:利用冻结时序管片实现零样本仿真到现实运动学的隐藏质量估计
冻结时序管片适配V-JEPA,单目视频零样本估计隐藏质心,仿真到现实迁移最优。
喜剧中的愚人金:对话幽默中的奖励漏洞与对策
研究对话幽默奖励的漏洞与对策:惊喜嵌入奖励易被乱序回复欺骗,笑声线索可被利用;修正后改善但未达预期。
Noor超大型阿拉伯语语言模型碳足迹的整体评估
本文综合评估Noor超大型阿拉伯语模型全周期碳足迹,指出推理和外部成本影响显著,并探讨减排路径。
逆向项目反应理论:碎片化癌症药物反应矩阵中的稀疏稳健排序
提出逆向项目反应理论,将癌症类型与药物建模为耐药被试与项目,碎片化数据中比简单平均更稳健恢复排序。
从提议到可验证效果:Praxa——面向受治理AI智能体执行的证据约束型执行框架
Praxa以证据约束架构显式区分提案、授权、派发与验证效果;四条证据线均未证明性能优越。
空间升维用于稠密预测
提出空间升维:将输入提升到高维空间并由3D网络处理,稠密预测性能更优,参数量与推理成本大幅下降。
涌现式物体绑定具有有限空间视界
预训练ViT冻结块嵌入可解码同物体信号,但绑定随距离指数衰减至非零下限,呈现有限空间视界。
Adam 距离自然梯度下降有多远?
Adam与自然梯度的几何偏离随场景变化,病态下显著,但凭动量平滑仍能有效优化。
BudgetSchemaBench:Text-to-SQL 模式上下文的预算扫描式诊断基准
提出预算扫描诊断基准,发现检索覆盖受限时,执行准确率对模式上下文的预算远比对序列化格式敏感。
理由究竟传递了什么?角色专精问答中的消息干预研究
忠实理由不提升答案准确率,但受损理由显著改变验证支持判断,故理由共享应作为验证消息机制评估。
衡量微任务合格性差距:现成小语言模型何时足以用于智能体执行框架?
构建4项微任务基准测试现成小模型:均未达阈值,量化无改善;差距源于规模而非精度,宜仅作基线补充。
韩国性犯罪案件中的法律文本分类:从传统机器学习到结合XAI洞察的大语言模型
韩国性犯罪判例分类中,微调KLUE-BERT准确率99.3%,优于GPT与传统模型,XAI揭示语境理解局限。
因果世界模型何时有助于模块化 LLM 智能体
因果世界模型仅在跨模块接口可统计识别、且行动时可用时,才有助于模块化 LLM 智能体。
编码却脱节:在激活补丁零结果下分解视觉语言模型失败
三种视觉语言模型中层虽编码答案却因果失活,补丁零翻转;错误分为感知失败、编码脱节、先验覆盖,且可学习。
目标检测中的域泛化与合成数据:赋能者、探针与鸿沟
目标检测域泛化研究稀缺;合成数据既是赋能者与探针,又存在合成到真实鸿沟,未来需兼顾定位与分类。
FACET 在 WMT 2026 自动翻译质量评估任务中
提出免参考免训练FACET,将评估分流畅、准确、一致三通道;另交省略一致通道版,人工译后编辑排名第一。
FourierQK:滤波器形状、可容许性与泄漏-覆盖定律
QK注意力消融:抑制直流/奈奎斯特,段落尺度带宽最优,可容许滤波器更优;泄漏随覆盖增,适用双向注意力
在多实例强化学习系统中整合公平性与可解释性
研究融合RL-MIL、对抗去偏与偏好超网络的学生风险预测,发现偏好调节失效、模式坍塌,需梯度平衡与目标分离。
面向个性化偏好优化的梯度对齐配对选择
提出GAP-DPO,以效用梯度几何对齐选择偏好对,提升LLM个性化偏好优化效果。
可达性不等于泛化:理解装配动作识别中的动–名分解
系统分析三数据集上的动–名分解:泛化主要靠共现插值,失败集中于大词表成分,共享编码器致成分纠缠。
面向大语言模型的快速多项式超越函数
用3–4次BF16多项式替代sigmoid、tanh、SiLU,训练吞吐最多提升8%,损失几乎不变。
刻画推理时 PRM 剪枝片段嫁接无效的配置:来自三个推理语言模型的证据
PRM剪枝片段嫁接在推理时与独立并行思维链基线无显著差异;触发多未命中真正困难链,跨三模型六基准复现。
端侧命名实体识别:准确性、成本、可靠性与置信度的可部署性研究
端侧NER可部署性评测:编码器更可靠,小生成模型无效输出多,置信度需校准。
基于结构因果模型(SCM)的法律文书分类公平性与忠实可解释性
公平性正则化未改善人口公平,却持续削弱SHAP解释忠实性,表明公平与解释忠实性解离。
看见城市,还是识别地点?VLM城市感知中街景影像较现有城市数据的增量贡献
街景影像的增量价值取决于视觉可读性与本地数据覆盖;部分属性上现有数据已匹敌甚至优于图像。
DSSR-3D:3D高斯中视角相关指代的解耦推理
DSSR-3D以解耦推理实现3D高斯视角相关指代分割,免重训练,并提出ViewRef-GS基准。
面向快速 FP4 预训练的格式感知融合
格式感知融合协同设计FP4量化布局,Llama-3 8B预训练达37.9K tokens/s/GPU。
“非常可能”等于“不确定”?大语言模型在语言不确定性量化上如何与人类分道扬镳
大语言模型为“可能”“很可能”等词赋予的不确定性概率与人类差异显著,新算法从输出中学习标记映射,揭示二者置信语义的系统性偏差。