---
format: "aidr-story-markdown/v1"
id: "72a147bca7dea9cbfdd2be878f5125b4f2aa716868945179bac3a08b7535bdcf"
canonical_url: "https://aidr.today/72a147bc?lang=vi"
title: "Giới thiệu Amazon SageMaker HyperPod Inference Gateway"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-09-18T13:08:34.000Z"
category: "Models"
topics: ["anthropic","claude","multi-agent","open-source","amazon","inference","chips","infra"]
source_urls: ["https://aws.amazon.com/blogs/machine-learning/introducing-amazon-sagemaker-hyperpod-inference-gateway/","https://aws.amazon.com/blogs/machine-learning/amazon-sagemaker-inference-2026-year-to-date-launches-in-review/"]
summary: "Amazon SageMaker HyperPod Inference Gateway là một tiện ích mở rộng định tuyến nhận thức GPU, dựa trên Kubernetes, dành cho Amazon EKS. Nó sử dụng tín hiệu GPU thời gian thực để gửi mỗi yêu cầu suy luận đến pod phù hợp nhất, giảm độ trễ token đầu tiên lên đến 82% mà không cần thay đổi máy chủ mô hình hoặc ứng dụng khách."
---

# Giới thiệu Amazon SageMaker HyperPod Inference Gateway

> [Open the canonical story](<https://aidr.today/72a147bc?lang=vi>)

**Published:** 2026-09-18T13:08:34.000Z
**Category:** Models
**Topics:** anthropic, claude, multi\-agent, open\-source, amazon, inference, chips, infra

## Summary

Amazon SageMaker HyperPod Inference Gateway là một tiện ích mở rộng định tuyến nhận thức GPU, dựa trên Kubernetes, dành cho Amazon EKS\. Nó sử dụng tín hiệu GPU thời gian thực để gửi mỗi yêu cầu suy luận đến pod phù hợp nhất, giảm độ trễ token đầu tiên lên đến 82% mà không cần thay đổi máy chủ mô hình hoặc ứng dụng khách\.

## Sources

- [Story source](<https://aws.amazon.com/blogs/machine-learning/introducing-amazon-sagemaker-hyperpod-inference-gateway/>)
- [Story source](<https://aws.amazon.com/blogs/machine-learning/amazon-sagemaker-inference-2026-year-to-date-launches-in-review/>)

