AI产品库
Groq Logo

AI 推理云与加速硬件平台

Groq

用自研 LPU 做低延迟大模型推理的 neocloud

官方定位是「面向快速推理的 premier neocloud」,也是全球性 AI 基础设施平台:把基础设施、推理与云服务合成一张分布式网络,自研 LPU 与新一代 LPX 是核心,官方称其与 NVIDIA 的下一代 GPU 协同工作。

深度介绍

Groq详细介绍

LPU:为推理而生的芯片路线

Groq 首页把自己的身份写成「面向快速推理的 premier neocloud」,主张训练产生可能性、推理产生价值,而推理正在成为瓶颈。它的路线是不靠通用 GPU 硬扛,而是自研 LPU(Language Processing Unit)并对外出租算力;官网同时说明随着 LPX 推出,这套加速器会与 NVIDIA 的下一代 GPU 协同工作,官方措辞是「快与便宜不再是二选一」。对使用者来说,这套路线的实际意义是延迟与每秒生成速度的下限由硬件与片上内存带宽决定,而不是靠排队与批处理硬挤出来。

📐

官方给出的机架级指标

平台页把关键指标直接列了出来:每机架 256 颗 LPU、40 PB/s 的 SRAM 带宽、每用户 1000 token/秒、每机架 128 GB 片上 SRAM、315 PFLOPS 的 FP8 推理算力。这些数字的解释力在于它们都是「推理形态」的指标——片上 SRAM 决定能缓存多少权重与 KV、SRAM 带宽决定解码阶段每步能多快取数、单用户 tok/s 决定交互手感。官方还说明当 Groq 3 LPX 机架发布时,每机架会把 256 颗下一代 LPU 加速器接到 NVIDIA 的 Vera Rubin 上,用于低延迟、长上下文的推理。

🧱

三层产品:Metal、Core、Assured

官方把平台拆成三层,方便按需选档:GroqMetal 是专用裸金属基础设施,强调速度、可靠性与控制权都在客户手里;GroqCore 在此之上提供「经过验证的推理栈」,把独享容量变成可直接上线的性能,官方明确说不需要客户具备基础设施专业能力;GroqAssured 再叠一层企业级治理、可审计与控制能力。也就是说,同一个底层可以只买算力、买推理能力、或买带合规治理的托管形态,选型时不必在最底层的运维细节上做取舍。

🌍

13 个数据中心、四大洲

官方平台页列出当前运营 13 个数据中心,横跨北美、欧洲、中东与亚太,并点名了具体机房:美国的 Liberty Lake、St Paul、Dallas、Houston,加拿大的 Kamloops、Vaudreuil-Dorion、Calgary,芬兰 Vantaa,澳大利亚悉尼,英国伦敦,以及沙特利雅得。对需要控制数据落地点或压低跨地域延迟的团队,这份清单是可以直接拿来对照合规与网络规划的资料;官方公告中也把「全球推理足迹」列为融资的主要投向之一。

🔌

OpenAI 兼容接口与完整能力面

接入侧走控制台:console.groq.com 提供 Playground、API Key 与用量面板,API 基址为 api.groq.com,并明确提供 OpenAI 兼容路径,因此现有 SDK 通常只改 base_url 与 Key 即可跑通。文档覆盖面比单纯的文本生成宽:Responses API、速率限制、模板、语音转写、语音合成(含 Orpheus)、OCR 与图像识别、推理模型、内容审核、结构化输出、提示缓存、工具调用、代码执行、远程工具与 MCP、连接器、本地工具调用,以及一整页编码工具集成(Factory Droid、OpenCode、Kilo Code、Roo Code、Cline 等)。

🧠

面向 Agent 的工具与缓存能力

文档里「提示缓存」「工具调用」「结构化输出」这三项放在一起看,指向的是 Agent 场景:缓存能把反复出现的长系统提示词成本压下来,结构化输出保证模型返回值能被程序直接解析,工具调用与 MCP 则负责把外部能力接进来;再加上代码执行与远程工具,基本可以覆盖一个完整 Agent Loop 的所需组件。官方还单独维护「Coding with Groq」一类集成清单,说明它在编码助手这类高频、低容忍延迟的场景里被当作默认推理后端之一使用。

🎙

语音与多模态是独立能力项

除文本外,官方文档把语音转写、语音合成与 OCR / 图像识别单独列为产品能力,而不是塞进文本接口的附属功能。对语音助手、会议记录、客服质检这类应用,这意味着同一条链路上可以复用同一个 Key、同一套权限与计费口径,不必为语音再单独接一家供应商;官方在文档里同时给出合成音色(如 Orpheus)与识别模型的说明,选型时可按语种、延迟与音质要求分别比对。

💳

价格与采购方式的变化

需要注意官网当前的形态:访问 groq.com/pricing 会跳回首页,也就是**没有独立的公开价目页**;价格信息出现在控制台文档与账号内,文档的模型页以「PRICE PER 1M TOKENS」为单位列价。同时,面向企业的三层产品(GroqMetal / GroqCore / GroqAssured)走商务洽谈,官方公告把 2026 年的融资用途说成扩建全球推理足迹与支撑中大型 NVIDIA 加速计算集群的租用需求。因此买容量前建议先按官方文档确认当期单价与限额,集群与裸金属则直接联系销售。

产品特点

核心功能与独有价值

01

自研芯片 + 对外出租算力的组合

多数推理服务商是买卡再转卖,Groq 是把自研 LPU 做成对外可租的推理基础设施,并在 LPX 一代上与 NVIDIA 的 GPU 协同。对使用者而言,这意味着同一家能提供两种底层选择:要极致低延迟时走 LPU,要通用与训练时走 GPU 集群,结算与网络仍在同一平台内。

02

把推理指标写进产品页

官方平台页直接给出每机架 256 颗 LPU、40 PB/s SRAM 带宽、每用户 1000 token/秒、128 GB 片上 SRAM、315 PFLOPS FP8 这些数字。这类指标比「跑分」更接近真实使用体验,也方便用户在采购前判断目标负载能否落在硬件能力范围内。

03

从裸金属到托管的三档选择

GroqMetal、GroqCore、GroqAssured 三层的分工很清楚:只想要算力就买 Metal,想省运维就买 Core,需要治理与审计就加 Assured。官方对 Core 的表述是「不需要基础设施专业能力」,也就是承认了不同团队的运维水位差异,而不是强行把所有人推到同一形态。

04

数据中心清单公开可核对

官方把 13 个数据中心的所在城市逐条列出,覆盖美加、芬兰、英国、澳大利亚与沙特。这份清单对做数据落地点评估、延迟预算与容灾规划都直接可用,也等于把「全球推理足迹」这一说法变成了可核对的名单。

最近动态

重要更新

完成 3.5 亿美元 A 轮,估值 35 亿美元

官方新闻室 2026 年 8 月 17 日发布公告:Groq 完成 3.5 亿美元 A 轮融资,由 Disruptive 领投,NVIDIA 计划参投,本轮估值 35 亿美元;连同 2026 年 6 月完成的 6.5 亿美元,近期融资合计 10 亿美元。公告同时给出经营数据:13 个数据中心、超过 600 万开发者、每周处理数万亿 token,并计划在 2027 年把容量从 54 兆瓦扩到 200 兆瓦以上。

取得 NVIDIA Cloud Partner 认证

同一份公告说明,Groq 是 NVIDIA Cloud Partner(NCP),具备按 NVIDIA 参考架构与运营标准设计、部署与运营 NVIDIA 加速计算的认证资质;资本将用于支撑需要中大型 NVIDIA 加速计算集群用于训练与推理的客户。这条信息解释了为什么平台同时提供 LPU 与 GPU 两类算力,而不是只押一条路线。

平台页公开三层产品与机架指标

截至 2026 年 9 月的官方平台页显示,Groq 的产品按 GroqMetal(专用裸金属)、GroqCore(验证过的推理栈)、GroqAssured(企业治理与可审计)三层组织,并列出每机架 256 颗 LPU、40 PB/s SRAM 带宽、每用户 1000 token/秒、128 GB 片上 SRAM、315 PFLOPS FP8 等指标;页面另说明 Groq 3 LPX 机架发布时会将 256 颗下一代 LPU 接入 NVIDIA Vera Rubin。

13 个数据中心名单公开

官方平台页列出当前运营的 13 个数据中心,含美国 Liberty Lake、St Paul、Dallas、Houston,加拿大 Kamloops、Vaudreuil-Dorion、Calgary,芬兰 Vantaa,澳大利亚悉尼,英国伦敦与沙特利雅得。官网同期已不再提供独立定价页(/pricing 跳回首页),价格改由控制台文档按每百万 token 列出。

产品总结

Groq 的自我定位是「面向快速推理的 neocloud」,也是把基础设施、推理与云服务合成一张分布式网络的 AI 基础设施平台。技术路线是自研 LPU(Language Processing Unit),官方称随着 LPX 推出,这套加速器会与 NVIDIA 的下一代 GPU 协同工作,目标是让「快」与「便宜」不再互相排斥。官方平台页给出的机架级指标包括:每机架 256 颗 LPU、40 PB/s SRAM 带宽、每用户 1000 token/秒、每机架 128 GB 片上 SRAM,以及 315 PFLOPS 的 FP8 推理算力;并说明 Groq 3 LPX 机架发布时会把 256 颗下一代 LPU 加速器接入 NVIDIA 的 Vera Rubin,用于低延迟、长上下文推理。 产品按三层组织:GroqMetal 提供专用裸金属基础设施;GroqCore 在其上提供经过验证的推理栈,官方称不需要客户具备基础设施专业能力;GroqAssured 再叠加企业级治理、可审计与管控。算力布局上,官方列出 13 个数据中心、横跨北美、欧洲、中东与亚太,并逐条点名了机房所在城市。 接入侧以控制台为核心:console.groq.com 提供 Playground、API Key 与用量面板,API 基址为 api.groq.com 并提供 OpenAI 兼容路径,常规做法是改 base_url 与 Key。文档覆盖面较宽,除文本生成外还包括语音转写与合成、OCR 与图像识别、推理模型、结构化输出、提示缓存、工具调用、代码执行与 MCP,并列出若干编码工具集成。 经营与资本层面,官方 2026 年 8 月 17 日公告完成 3.5 亿美元 A 轮融资(Disruptive 领投、NVIDIA 计划参投),估值 35 亿美元;连同 6 月的 6.5 亿美元,近期融资合计 10 亿美元。公告还给出 600 万以上开发者、每周数万亿 token、13 个数据中心,以及 2027 年容量从 54 兆瓦扩至 200 兆瓦以上的计划,并说明 Groq 是 NVIDIA Cloud Partner(NCP)认证厂商。 使用前需要注意几点:官网目前没有独立公开定价页(访问 /pricing 会跳回首页),价格以控制台文档与账号内按每百万 token 的当期数字为准,裸金属与推理栈走商务洽谈;OpenAI 兼容不等于行为完全一致,模型支持范围、结构化输出与工具调用的细节仍需按官方文档逐项确认;不同地区机房的延迟与可用模型可能有差异,部署前应确认数据落地点;编码助手类工具集成更新较快,选型时以官方文档当期清单为准。整体而言,它适合把推理延迟与每秒生成速度当作硬指标、并可能需要独享容量的团队。

产品类型
AI 推理云与加速硬件平台
支持平台
GroqCloud 控制台 / OpenAI 兼容 REST API / Responses API / 语音转写与语音合成 / OCR 与图像识别 / 结构化输出与工具调用 / GroqMetal 裸金属 / GroqCore / GroqAssured
资费模式
官网现无独立公开价目页(访问 /pricing 会跳回首页),价格在控制台文档与账号内按每百万 token 列出;裸金属与推理栈按商务洽谈。

核验信息

参考文章与数据来源

本页事实来自 Groq 官方渠道:官网首页(「premier neocloud for fast inference」定位、LPU 与 LPX 表述)、平台页(GroqMetal / GroqCore / GroqAssured 三层、每机架 256 颗 LPU、40 PB/s SRAM 带宽、每用户 1000 token/秒、128 GB 片上 SRAM、315 PFLOPS FP8、Groq 3 LPX 与 NVIDIA Vera Rubin、13 个数据中心名单)、官方新闻室 2026 年 8 月 17 日融资公告(3.5 亿美元 A 轮、35 亿美元估值、600 万开发者、54→200 兆瓦计划、NVIDIA Cloud Partner 认证)、控制台文档(OpenAI 兼容、模型页每百万 token 价格、语音与多模态能力)与控制台入口。核验时间 2026 年 9 月 22 日。价格、模型与机房布局变化较快,且官网当前无独立公开价目页,请以控制台文档为准。

  1. 官网Groq 官网
  2. 官网平台说明(三层产品与机架指标)
  3. 官方文档官方文档(Quickstart)
  4. 官方文档支持模型与每百万 token 价格
  5. 官方文档Groq 完成 3.5 亿美元 A 轮(官方新闻室,2026-08-17)
  6. 官网GroqCloud 控制台
  7. 官网法律与条款

用户体验调查

Groq介绍页面对您是否有帮助?