---
format: "aidr-story-markdown/v1"
id: "a0ecdfee72fef23879c0259187a975b33cf25b133b38cee93a51b8d28f8addca"
canonical_url: "https://aidr.today/a0ecdfee?lang=vi"
title: "Tối ưu chi phí và độ trễ với Amazon Bedrock prompt caching"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-09-15T16:18:19.000Z"
category: "Infra"
topics: ["amazon","agent","multi-agent","inference","benchmark"]
source_urls: ["https://aws.amazon.com/blogs/machine-learning/optimizing-cost-and-latency-with-amazon-bedrock-prompt-caching/","https://aws.amazon.com/blogs/machine-learning/optimizing-agent-system-prompts-with-amazon-bedrock-agentcore/"]
summary: "Prompt caching trong Amazon Bedrock có thể giảm chi phí token đầu vào lên đến 90% khi bạn liên tục gửi cùng một ngữ cảnh đến các mô hình nền tảng. Bài viết hướng dẫn qua sáu kịch bản prompt caching thực tế bằng Converse API: nội dung tin nhắn, system prompt, định nghĩa công cụ, TTL hỗn hợp, cách ly tenant và tích hợp LangChain."
---

# Tối ưu chi phí và độ trễ với Amazon Bedrock prompt caching

> [Open the canonical story](<https://aidr.today/a0ecdfee?lang=vi>)

**Published:** 2026-09-15T16:18:19.000Z
**Category:** Infra
**Topics:** amazon, agent, multi\-agent, inference, benchmark

## Summary

Prompt caching trong Amazon Bedrock có thể giảm chi phí token đầu vào lên đến 90% khi bạn liên tục gửi cùng một ngữ cảnh đến các mô hình nền tảng\. Bài viết hướng dẫn qua sáu kịch bản prompt caching thực tế bằng Converse API: nội dung tin nhắn, system prompt, định nghĩa công cụ, TTL hỗn hợp, cách ly tenant và tích hợp LangChain\.

## Sources

- [Story source](<https://aws.amazon.com/blogs/machine-learning/optimizing-cost-and-latency-with-amazon-bedrock-prompt-caching/>)
- [Story source](<https://aws.amazon.com/blogs/machine-learning/optimizing-agent-system-prompts-with-amazon-bedrock-agentcore/>)

