前 Google 与 SpaceX 产品经理创立的 Satlyt 融资 800 万美元,要在卫星上运行 AI
Satlyt 完成 800 万美元种子轮,由前 Google 和 SpaceX 产品经理 Rama Afullo 联合创立,总部位于加州 Sunnyvale 与内罗毕。
Satlyt 完成 800 万美元种子轮,由前 Google 和 SpaceX 产品经理 Rama Afullo 联合创立,总部位于加州 Sunnyvale 与内罗毕。
Cloudflare 发布两款自研开源决策模型 Clef 和 Clef-flash,托管在 Workers AI 上,在 Jev Decision Index 上领先现有模型,并以 Apache 2.0 协议开源至 Hugging Face。
Janus 是一个 Go 单文件二进制,通过 llama.cpp Vulkan 后端在 AMD/Intel/NVIDIA GPU 或 CPU 上运行 GGUF 模型,并暴露 OpenAI 兼容的 /v1/chat/completions 接口。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义插件将 Amazon S3 Vectors 接入其记忆子系统,作为生产环境的多智能体持久记忆层。
亚马逊云科技发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在预设选项间快速选择并输出置信度分数。模型完全开源、可本地运行,由 Amazon 杰出工程师 Marc Brooker 主导、从其个人项目孵化而来,通过 Strands Labs 推出。OpenAI 同周推出同类产品,决策模型赛道涌入大量开源项目。
Claude Platform on AWS(CPonAWS)多环境访问采用专属 AI Services 账户架构,通过 cross-account SigV4、workspace-scoped API key 与 OIDC 联邦三种模式,分别覆盖 AWS 工作负载、开发者本地与外部 CI/CD。
当 AI 工作负载从实验走向生产、按量计费成本难以预测时,企业需要判断何时将持续性需求转向自有 AI 容量会比持续购买更经济。
Pawprint Studio 推出的免费开放世界捉宠 RPG《Aniimo》本周在 GeForce NOW 同步首发,玩家无需下载 45GB 即可跨设备云端体验。同批共 11 款新作上线,《007 First Light》新增路径追踪并搭配 DLSS 4.5 Ray Reconstruction,Ultimate 会员可获 GeForce RTX 5080 级性能与 5K HDR 串流。
Actually the original title structure is "Bypassing inference bottlenecks。
Mistral 与 Cloudera 宣布建立合作,将 Mistral 模型集成到 Cloudera 混合数据平台,支持企业在私有云、公有云、本地及完全隔离环境中部署 AI 推理,并基于专有数据训练自有模型。
Google DeepMind 发布 WeatherNext 3 全球天气预报模型,引入实时地球同步卫星观测替代传统 NWP 数据,每小时更新并支持最高 5 公里分辨率。
推荐理由:WeatherNext 3 以实时卫星观测替代 NWP 数据训练,分辨率较前代提升约五倍,中等时效降水精度相对 IMERG 改善最高 60%。
Hugging Face 发布开源实验追踪 Python 库 Trackio,作为 wandb 的轻量替代品,提供本地 Gradio 仪表盘并支持同步到 Hugging Face Spaces 共享。
Hugging Face 官方博客宣布将命令行工具 huggingface-cli 重命名为 hf,并采用统一的 hf <resource> <action> 命令语法,主要命令包括 auth、download、upload、repo、cache 等。
HF 博客给出在 Flux.1-Dev 上加速 LoRA 推理的方案,结合 Flash Attention 3、torch.compile 与 TorchAO FP8 量化,并借助 Diffusers 的 hotswap 机制避免换 LoRA 时触发重新编译。
推荐理由:这篇博客把 Flash Attention 3、torch.compile 与 FP8 量化组合成可复用的 LoRA 推理加速配方,并给出 H100 与 RTX 4090 上的实测对照。
Mistral AI 发布文档理解 API Mistral OCR,输入图片和 PDF,输出有序的图文交错内容,已在 la Plateforme 上线,价格为 1000 pages/$,单节点最高可处理 2000 页/分钟。
推荐理由:原文附带与主流 OCR 模型的基准对比,读者可以据此横向判断其在多语言文档理解场景中的相对位置。
Elixir 社区发布 Bumblebee 库,这是 Hugging Face Transformers 的纯 Elixir 实现,使 GPT2 到 Stable Diffusion 等模型可在 Elixir 中直接运行。
Optimum 提供将 Transformers 模型转换为 ONNX 的三种路径:底层 torch.onnx、中层 transformers.onnx,以及高层 ORTModelForXxx API。
Hugging Face 工程师分享构建神经网络的三个实用步骤:动手前先深入分析数据分布、标签平衡性与噪声来源;先用 fastText、word2vec 配合逻辑回归等简单基线评估任务难度,再考虑 BERT 等复杂模型;实现完成后应尝试在小批量数据上过拟合,确认 loss 接近 0 以验证代码正确性。
在 Hugging Face Transformers v4.2.0 中,BERT、RoBERTa、ELECTRA、MPNet 的 TensorFlow 实现获得显著提速,在 V100 GPU、序列长度 128 下较 Google 官方 BERT 快约 4–11%、较 4.1.1 快约 2 倍。
1. Create a self-consistent Chinese title (title_zh) 2. Write a Chinese summary (summary_zh) based on the article content Let me analyze the article。