LLM được huấn luyện để sinh ngôn ngữ tự nhiên. Nhưng nhiều bằng chứng cho thấy đầu ra ngôn ngữ và các đặc trưng ngôn ngữ được rút trích cơ học của LLM không phải lúc nào cũng tin cậy để hiểu quá trình tính toán nội bộ. Chúng tôi đưa ra khái niệm "khó đọc ngôn ngữ" để chỉ những trường hợp ngôn ngữ mà LLM bày ra hoặc được sond sóc cơ học không phản ánh đúng cách mô hình nghĩ thực sự. Đối với LLM có quá trình tính toán nội bộ không được biểu đạt trực tiếp bằng ngôn ngữ mà là bằng toán học trên không gian kích hoạt, khả năng khó đọc ngôn ngữ là điều không thể tránh khỏi. Nếu luôn tồn tại khả năng này, các cơ chế bảo mật dựa trên tự báo cáo ngôn ngữ của mô hình (ví dụ: giám sát chain-of-thought, tự phê bình theo hiến pháp, sond sóc kích hoạt cho các vectơ đặc trưng ngôn ngữ) sẽ không thể hoàn toàn đúng đắn. Môi trường cô lập mô hình cần các kỹ thuật cô lập không phụ thuộc vào việc đọc trạng thái ngôn ngữ của mô hình. Theo chúng tôi, theo dõi nguồn độc (taint tracking) là hướng tiếp cận đóng hộp đen hiệu quả: bất kể mô hình tự báo cáo ngôn ngữ thế nào, chính sách theo dõi nguồn độc có thể định nghĩa trước các thành phần trạng thái hệ thống không bao giờ được ảnh hưởng bởi dữ liệu do mô hình tạo ra. Chúng tôi cũng thảo luận thêm các cơ chế cô lập khác (như ảo hóa mạnh mẽ, kiểm toán bên thứ ba cấu hình cô lập) cùng nhóm hỗ trợ nền tảng cho giám sát ngôn ngữ, đã giảm thiểu các cuộc tấn công cô lập gần đây từ các mô hình tiên phong.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. THẢO LUẬNtomjakubowskinews.ycombinator.com
  2. THẢO LUẬNmaharshi365news.ycombinator.com
  3. SOURCEhnmaharship.com
Bản Markdown