※この記事はアフィリエイト広告を含みます
低价服务器巨头Hetzner进军LLM推理市场!?超快速Qwen3.6 API实验性发布!
发生了什么?新闻概述
- Hetzner开始LLM推理API的实验: 在其独特基础设施上推出与OpenAI兼容的API,作为“实验项目”启动。目前处于免费和无保证的阶段。
- 采用模型为Qwen3.6-35B: 采用最新的FP8量子化MoE模型“Qwen/Qwen3.6-35B-A3B-FP8”。支持文本和图像输入,并拥有262K的广阔上下文窗口。
- 惊人的性能: 在2026年7月23日的测试中,首次令牌生成(TTFT)为153毫秒,输出速度达到每秒224个令牌的超快记录。
为什么这很重要?值得关注的要点
- 基础设施巨头的成本竞争力: Hetzner在“硬件自运营和极低成本结构”方面的优势,可能会导致推理成本的颠覆性降价。
- 有效利用GPU资源: 通过将未使用的多余GPU容量作为API进行出售,从而极大提升基础设施的运行率。
- 从现有环境迁移容易: 由于是完全的OpenAI兼容API,因此几乎无需改写现有客户端代码即可进行试用。
🦈 鲨鱼的视角(策展人的观点)
低价服务器巨头终于露出了獠牙!
Hetzner发起“推理的商品化”是一个非常令人兴奋的动态。尤其值得注意的是,它不仅仅是公开了API,还隐藏了一些尚未文档化的深度功能,比如enable_thinking(思考过程的控制)。这表明Hetzner不仅在运行模型,还在内部实现层面进行了相当程度的优化!
目前的配置似乎主要依赖于RTX PRO 6000 Blackwell Max-Q(显存96GB)等工作站GPU,但如果这种高效的基础设施运作知识能够应用于大规模推理集群,那么现有的AI服务提供商必然会面临巨大的威胁!
接下来会发生什么?
- 商业化与定价: 在实验阶段后,关于带有SLA(服务质量保证)的收费计划的发布,可能会带来颠覆市场的“Hetzner价格”,值得关注。
- GPU产品线扩展: 可能会引入更高密度的多GPU系统,如Blackwell世代,并推进对更大模型(如GLM-5)的支持。
鲨鱼的简短评论
我感觉Hetzner将吞噬推理成本的浪潮!准备好大口吃掉吧!🦈🔥
术语解释
-
Qwen3.6-35B-A3B: 拥有350亿参数,通过专家混合(MoE)技术将激活参数控制在30亿以内,实现加速的AI模型。
-
TTFT (Time to First Token): 用户发送请求到第一个字符返回之间的时间。直接关系到用户体验的指标。
-
FP8量子化: 将数据精度压缩为8位(1字节)的技术。在保持精度的同时将内存使用量减少一半,并显著提高计算速度。
-
信息来源: Hetzner正在研发LLM推理