
초당 3,400 토큰 양산 개시 — 추론 전용칩 스타트업의 독립 시장이 좁아진다
#NVIDIA가 Hot Chips 2026에서 추론 가속기 Groq 3 LPX를 정식 양산(full production)에 넣었습니다. Gemma 4 31B에 10만 토큰 컨텍스트를 물린 벤치마크에서 초당 3,400 토큰, 경쟁 플랫폼 대비 응답성 4배를 기록했습니다. Nebius가 첫 도입 클라우드이고 Groq도 조기 도입을 예고했습니다. '학습은 GPU, 추론은 전용칩'이라는 도전자 서사가 한 플랫폼 안으로 흡수되는 구간입니다.
💡에이전트 워크로드의 병목이 총 처리량에서 사용자 1인당 토큰 생성 속도로 옮겨가면서, 추론 단가와 응답성의 기준선이 다시 그어집니다. 전용칩 스타트업의 차별화 폭도 함께 줄어듭니다.









