Kiểm soát cách ElevenAgents hoạt động trong môi trường thực tế

Kiểm soát hành vi của agent trong môi trường thực tế bằng các biện pháp bảo vệ nhằm đảm bảo phản hồi an toàn, tuân thủ quy định và đáng tin cậy.

Tổng quan

Cơ chế kiểm soát an toàn cung cấp cho các nhóm giải pháp mạnh mẽ để quản lý hành vi của agent trong môi trường thực tế, giúp duy trì đúng chủ đề, nhất quán với thương hiệu và chống lại các hành vi thao túng ở quy mô doanh nghiệp.

Guardrails 2.0 đã thiết kế lại lớp bảo mật để các nhóm dễ dàng hơn trong việc: Thiết lập những chính sách tùy chỉnh bằng ngôn ngữ tự nhiên, kích hoạt các biện pháp bảo vệ có sẵn, kiểm soát quy trình xử lý khi cơ chế kiểm soát được kích hoạt, và tự tin triển khai agent cho các quy trình công việc quan trọng.

Cơ chế kiểm soát an toàn định hướng agent đưa ra phản hồi chính xác và ngăn chặn các phản hồi không phù hợp trước khi chúng đến tay người dùng. Chúng bảo vệ các cuộc hội thoại thông qua nhiều lớp: Định hình cách agent phản hồi, xác thực dữ liệu đầu vào từ người dùng và đánh giá độc lập mọi phản hồi mà không làm tăng độ trễ. Nhờ đó, rủi ro về thương hiệu và tuân thủ quy định trong mỗi cuộc hội thoại được giảm thiểu.

Cách thức hoạt động của cơ chế kiểm soát an toàn

Cơ chế kiểm soát an toàn bảo vệ các cuộc hội thoại ở 3 cấp độ:

Củng cố câu lệnh hệ thống

Phương thức chính để kiểm soát hành vi của agent. Bạn thêm các hướng dẫn cụ thể vào câu lệnh hệ thống (system prompt) về những hành vi được phép và không được phép, đồng thời kích hoạt Focus Guardrail để củng cố các hướng dẫn đó trong suốt cuộc hội thoại. Đây là yếu tố giúp agent hoạt động đúng hướng trong phần lớn các tương tác.

Xác thực dữ liệu đầu vào của người dùng

Một lớp bảo vệ giúp phát hiện các hành vi tấn công hoặc cố ý thao túng trước khi agent kịp phản hồi. Cơ chế kiểm soát an toàn phân tích nội dung người dùng nhập, phát hiện các nỗ lực tấn công Prompt injection hoặc thao túng, và có thể chấm dứt những cuộc hội thoại tiềm ẩn rủi ngại bảo mật.

Xác thực phản hồi của agent

Bước kiểm tra cuối cùng giúp đánh giá độc lập mọi phản hồi của agent trong thời gian thực dựa trên các chính sách đã thiết lập. Nếu agent định đưa ra phản hồi vi phạm quy tắc (bất chấp câu lệnh hệ thống), các bộ xác thực phản hồi sẽ chặn nội dung đó trước khi nó được gửi đi.

Củng cố câu lệnh hệ thống đóng vai trò là nền tảng. Việc xác thực dữ liệu đầu vào và phản hồi đóng vai trò điều chỉnh lại hướng đi cho những trường hợp sai lệch lọt qua lớp kiểm soát đầu tiên. Đối với các quy tắc quan trọng nhất, hãy đưa chúng vào cả câu lệnh hệ thống lẫn thiết lập dưới dạng một Guardrail tùy chỉnh độc lập; cách làm này tạo ra cơ chế phòng thủ nhiều lớp, đảm bảo rằng ngay cả khi mô hình ngôn ngữ lớn (LLM) đi chệch khỏi hướng dẫn ban đầu, bộ xác thực phản hồi vẫn sẽ phát hiện và ngăn chặn kịp thời trước khi nội dung được gửi đi.

Cơ chế kiểm soát an toàn Công dụng Cấp độ bảo vệ Tác động của độ trễ Chi phí Chiến lược kết thúc (Exit) Trạng thái phát hành
Focus (bảo vệ tập trung) Giúp các agent bám sát chủ đề và tuân thủ câu lệnh hệ thống (system prompt) của bạn Củng cố câu lệnh hệ thống Tối thiểu Đã bao gồm N/A Chính thức ra mắt công chúng
Manipulation (chống thao túng) Phát hiện và chặn tấn công Prompt injection Kiểm tra dữ liệu người dùng nhập Không có tác dụng Đã bao gồm Kết thúc cuộc trò chuyện Chính thức ra mắt công chúng
Content (bảo vệ nội dung) Đánh dấu và ngăn chặn nội dung không phù hợp Xác thực phản hồi của agent Tùy thuộc vào chế độ thực thi Đã bao gồm Có thể cấu hình Alpha
Custom (bảo vệ tùy chỉnh) Thực thi các chính sách đặc thù cho doanh nghiệp của bạn Xác thực phản hồi của agent Tùy thuộc vào chế độ thực thi Dựa trên mức sử dụng Có thể cấu hình Alpha

Củng cố System Prompt (Câu lệnh hệ thống)

Cách hiệu quả nhất để đảm bảo agent hoạt động đúng ý muốn là viết một System Prompt chất lượng và kích hoạt chế độ Focus Guardrail. Sự kết hợp này giúp định hướng agent đưa ra phản hồi chính xác ngay từ đầu.

Bạn có thể sử dụng System Prompt để đưa ra các chỉ dẫn cụ thể về những việc agent nên và không nên làm. Các mô hình được tinh chỉnh để đặc biệt chú trọng đến mục có tiêu đề # Guardrails. Hãy sử dụng tiêu đề này cho các quy tắc hành vi quan trọng nhất.

Ví dụ về củng cố System Prompt

# Guardrails
- Only provide information that is publicly documented about ElevenLabs products, pricing, and features.
- Do not speculate about unreleased features, internal roadmaps, or future pricing changes.
- If you cannot resolve an issue with available documentation or tools, clearly explain the limitation and offer to escalate to a human support representative.
# Guardrails
- Chỉ cung cấp thông tin đã được công bố công khai về sản phẩm, giá cả và tính năng của ElevenLabs.
- Không đưa ra phỏng đoán về các tính năng chưa phát hành, lộ trình phát triển nội bộ hoặc thay đổi giá trong tương lai.
- Nếu không thể giải quyết vấn đề bằng tài liệu hoặc công cụ hiện có, hãy giải thích rõ ràng về hạn chế đó và đề nghị chuyển vấn đề cho nhân viên hỗ trợ.

Để biết hướng dẫn chi tiết về cách viết System Prompt hiệu quả, hãy tham khảo tài liệu hướng dẫn viết prompt của Quantrimang.com.

Focus Guardrail

Tính năng này củng cố cho System Prompt của agent, giúp các phản hồi luôn đi đúng trọng tâm, phù hợp và nhất quán với những mục tiêu cũng như chỉ dẫn mà bạn đã thiết lập. Điều này đặc biệt hữu ích trong các cuộc hội thoại dài hoặc phức tạp, nơi agent dễ bị chệch khỏi mục tiêu ban đầu.

Việc kết hợp giữa củng cố System Prompt và kích hoạt Focus Guardrail là phương pháp hiệu quả nhất để định hướng agent đưa ra phản hồi chính xác.

Xác thực đầu vào của người dùng

Cơ chế chống thao túng (Manipulation Guardrails)

Phát hiện và ngăn chặn các hành vi người dùng cố gắng thao túng agent nhằm vượt qua những chỉ dẫn đã thiết lập. Khi được kích hoạt, hệ thống sẽ phân tích đầu vào của người dùng để tìm các dấu hiệu của việc tấn công Prompt injection hoặc cố gắng ghi đè chỉ dẫn, đồng thời có thể chấm dứt những cuộc hội thoại tiềm ẩn rủi ro bảo mật.

Xác thực phản hồi của agent

Cơ chế bảo vệ nội dung (Content guardrails)

Nhận diện và ngăn chặn nội dung không phù hợp trong phản hồi của agent - chẳng hạn như nội dung nhạy cảm về chính trị, khiêu dâm hoặc bạo lực - trước khi nội dung đó đến tay người dùng. Điều này giúp đảm bảo phản hồi phù hợp với mục đích sử dụng và đối tượng khách hàng của agent.

Cơ chế bảo vệ tùy chỉnh (Custom guardrails)

Khi các agent đảm nhận những công việc quan trọng, các nhóm cần có quyền kiểm soát rõ ràng đối với hành vi của chúng. Chế độ Custom guardrails cho phép bạn thiết lập các quy tắc quan trọng nhất đối với doanh nghiệp của mình. Ví dụ:

  • Trợ lý bán lẻ không được phép hoàn tiền cho các mặt hàng không đủ điều kiện. Nhân viên lễ tân y tế không nên đưa ra lời khuyên về y tế.
  • Nhân viên ngân hàng không nên tư vấn đầu tư.

"Custom Guardrails" (Cơ chế kiểm soát tùy chỉnh) là các quy tắc dựa trên mô hình ngôn ngữ lớn (LLM), cho phép bạn tự thiết lập tiêu chí chặn thông qua những câu lệnh (prompt) bằng ngôn ngữ tự nhiên. Khi được kích hoạt, mỗi cơ chế kiểm soát tùy chỉnh sẽ gửi phản hồi của agent đến một mô hình gọn nhẹ; mô hình này sẽ đánh giá phản hồi dựa trên quy tắc của bạn và đưa ra quyết định chặn hoặc cho phép. Điều này mang lại khả năng kiểm soát linh hoạt và chuyên biệt theo lĩnh vực đối với những gì agent của bạn được phép hoặc không được phép nói.

Đối với mỗi cơ chế kiểm soát tùy chỉnh, bạn có thể xác định:

Trường Mô tả
Name Một nhãn mô tả cho cơ chế kiểm soát (ví dụ: “Không phải lời khuyên tài chính”).
Prompt Một chỉ dẫn bằng ngôn ngữ tự nhiên mô tả nội dung cần chặn (ví dụ: “Chặn mọi nội dung cung cấp lời khuyên tài chính cụ thể, khuyến nghị đầu tư hoặc hướng dẫn về thuế”).
Execution mode streaming (mặc định) hoặc blocking. 
Trigger action (Exit strategy) end_call (mặc định) hoặc retry. 

Các cơ chế kiểm soát tùy chỉnh có thể được sử dụng để chặn những chủ đề cụ thể liên quan đến doanh nghiệp của bạn, thực thi các yêu cầu tuân thủ đặc thù ngành và áp dụng những biện pháp an toàn riêng của doanh nghiệp. Mỗi cơ chế có thể được bật hoặc tắt riêng lẻ mà không cần xóa bỏ; khi có nhiều cơ chế được kích hoạt, chúng sẽ chạy song song với các cơ chế kiểm soát khác. Mọi vi phạm được kích hoạt đều sẽ được ghi lại để xem xét.

Chế độ thực thi

Chế độ thực thi xác định xem các cơ chế kiểm soát có thêm thời gian chờ trước khi người dùng nhìn thấy hoặc nghe thấy phản hồi hay không.

Ở chế độ Streaming, phản hồi của agent có thể bắt đầu trước khi cơ chế kiểm soát được kích hoạt; đối với thoại, một phần nhỏ âm thanh (thường dưới 500 ms) có thể được phát ra trước khi lệnh chặn kết thúc cuộc gọi. Đối với agent văn bản, người dùng có thể thấy phản hồi một phần hoặc toàn bộ nếu quá trình đánh giá chưa hoàn tất trước khi dữ liệu được gửi đi.

Ở chế độ Blocking, agent chỉ phản hồi sau khi các cơ chế kiểm soát đã hoàn tất việc kiểm tra. Quá trình này thường làm tăng thêm độ trễ từ 200 đến 500 ms.

Chiến lược kết thúc (exit)

Chiến lược kết thúc cho phép bạn xác định hành động của agent khi một cơ chế kiểm soát được kích hoạt. Bạn có thể chọn một trong các phương án sau:

  • end_call (mặc định): Kết thúc cuộc gọi ngay lập tức.
  • retry: Tạo lại phản hồi dựa trên feedback của bạn thay vì hủy bỏ cuộc trò chuyện. Agent sẽ thử lại phản hồi tối đa 3 lần; nếu mọi lần thử đều vẫn vi phạm cơ chế kiểm soát, cuộc gọi sẽ kết thúc.

Chế độ Retry chỉ hoạt động khi ở chế độ Blocking. Ở chế độ Streaming, kết thúc cuộc gọi là chiến lược kết thúc duy nhất khả dụng.

Phản hồi thử lại (Retry feedback)

Phản hồi thử lại có thể chứa bất kỳ hướng dẫn nào bạn muốn áp dụng cho lượt tương tác tiếp theo - nội dung này được đưa vào dưới dạng hướng dẫn hệ thống trước khi mô hình tạo lại phản hồi. Điều này bao gồm việc gọi các công cụ hệ thống như transfer_to_agent hoặc transfer_to_number. Dưới đây là một số ví dụ về cách cấu hình phản hồi thử lại:

  • Từ chối chung (mặc định): Phản hồi của bạn đã bị chặn bởi một cơ chế kiểm soát chặn nội dung khớp với điều kiện/danh mục sau: {{trigger_reason}}. Trong lượt tương tác tiếp theo, bạn phải nói với người dùng: “Tôi xin lỗi nhưng tôi không thể trả lời câu hỏi đó, bạn có muốn biết điều gì khác không?”
  • Thử lại với hướng dẫn điều chỉnh: Phản hồi trước đó của bạn đã bị chặn bởi một cơ chế kiểm soát. Phản hồi bị chặn là: {{agent_message}}. Trong lượt tiếp theo, bạn phải đưa ra câu trả lời mới và câu trả lời đó không được vi phạm: {{trigger_reason}}
  • Chuyển sang nhân viên hỗ trợ khác: Phản hồi trước đó của bạn đã bị cơ chế kiểm soát chặn lại. Trong lượt tiếp theo, bạn phải sử dụng công cụ transfer_to_agent để chuyển cuộc hội thoại sang một nhân viên hỗ trợ khác. Nội dung phản hồi bị chặn là: {{agent_message}}. Cơ chế kiểm soát chặn các nội dung thuộc điều kiện/danh mục: {{trigger_reason}}.
  • Chuyển sang nhân viên trực tổng đài (người thật): Phản hồi của bạn đã bị chặn bởi cơ chế kiểm soát áp dụng cho các nội dung thuộc điều kiện/danh mục: {{trigger_reason}}. Trong lượt tiếp theo, bạn BẮT BUỘC phải chuyển cuộc gọi cho nhân viên trực tổng đài (người thật) bằng cách sử dụng công cụ transfer_to_number.

Để sử dụng các công cụ hệ thống trong phần phản hồi yêu cầu thử lại, hãy kích hoạt và cấu hình những công cụ tương ứng trong phần cài đặt của agent. Chỉ những công cụ đã được thiết lập cho agent mới có thể được kích hoạt.

Bạn có thể sử dụng các biến giữ chỗ (placeholder) sau trong nội dung phản hồi:

Placeholder Được thay thế bằng
{{trigger_reason}} Prompt của cơ chế bảo vệ khi được định nghĩa trong các cơ chế tùy chỉnh. Danh mục được kích hoạt khi được định nghĩa trong những cơ chế bảo vệ nội dung.
{{agent_message}} Kết quả đầu ra của agent đã bị chặn (hữu ích cho việc điều hướng quá trình thử lại).

Chế độ Streaming được khuyến nghị cho các voice agent; chế độ Blocking được khuyến nghị cho các text agent.

Chế độ Blocking (đặc biệt là khi có cơ chế thử lại - retry) có thể hoạt động theo cách khó dự đoán hơn đối với voice agent. Nếu sử dụng chế độ chặn cho voice agent, hãy kiểm thử kỹ lưỡng hoặc chọn kết thúc cuộc gọi thay vì thử lại cho đến khi bạn hoàn toàn tin tưởng vào cơ chế hoạt động của nó.

Chi phí

Các cơ chế bảo vệ Focus, Manipulation và Content được cung cấp miễn phí cho tất cả người dùng ElevenAgents.

Các cơ chế bảo vệ tùy chỉnh (Custom Guardrails) tính phí dựa trên mức độ sử dụng và phát sinh thêm chi phí LLM, tương tự như những lệnh gọi mô hình khác trong ElevenAgents. Mỗi cơ chế bảo vệ tùy chỉnh được kích hoạt sẽ gửi mọi phản hồi của agent đến một mô hình gọn nhẹ để đánh giá; do đó, chi phí phụ thuộc vào độ dài của câu lệnh (prompt), độ dài trung bình của cuộc hội thoại và số lượng cuộc hội thoại. Nếu kích hoạt nhiều cơ chế bảo vệ tùy chỉnh, mỗi cơ chế sẽ thực hiện đánh giá riêng cho từng phản hồi. Bạn nên xem xét lưu lượng dự kiến ​​và lựa chọn mô hình trước khi kích hoạt nhiều cơ chế bảo vệ tùy chỉnh trong môi trường thực tế.

Bạn có thể xem chi phí ước tính (nằm bên dưới phần nhập câu lệnh) khi tạo hoặc chỉnh sửa cơ chế bảo vệ tùy chỉnh.

Ước tính chi phí cho cơ chế bảo vệ tùy chỉnh
Ước tính chi phí cho cơ chế bảo vệ tùy chỉnh

Thử lại và chi phí: Mỗi lần thử lại đồng nghĩa với việc agent tạo thêm phản hồi và hệ thống thực hiện thêm một lần đánh giá bảo vệ; do đó, việc thử lại sẽ làm tăng chi phí dựa trên mức sử dụng so với tùy chọn kết thúc cuộc gọi (tối đa 3 lần thử cho mỗi lượt bị chặn).

Cấu hình

Cấu hình qua dashboard

1. Truy cập cài đặt agent

Mở agent của bạn trong dashboard ElevenLabs và chuyển đến tab Security.

2. Kích hoạt các cơ chế bảo vệ

Bật các danh mục cơ chế bảo vệ mà bạn muốn sử dụng. Bạn có thể dùng những nút có sẵn để nhanh chóng kích hoạt hoặc tắt tất cả các danh mục.

3. Cấu hình chế độ thực thi và chiến lược exit (cho cơ chế bảo vệ tùy chỉnh và nội dung)

Đối với mỗi cơ chế bảo vệ tùy chỉnh hoặc bảo vệ nội dung, hãy chọn chế độ thực thi Streaming hoặc Blocking. Chế độ Blocking phù hợp với text agent; chế độ Streaming phù hợp với voice agent. Thiết lập Action on guardrail violation (tương ứng với tham số trigger_action): end call (áp dụng cho mọi chế độ) hoặc retry (chỉ áp dụng khi chọn chế độ Blocking; tính năng thử lại không khả dụng ở chế độ Streaming). Nếu chọn retry, hãy chỉnh sửa Feedback to inject when retrying để điều hướng mô hình. Sử dụng các biến giữ chỗ {{trigger_reason}} (prompt tùy chỉnh hoặc danh mục nội dung đã kích hoạt cơ chế chặn) và {{agent_message}} trong template.

4. Lưu cấu hình

Lưu cấu hình agent của bạn. Các thay đổi sẽ có hiệu lực ngay lập tức đối với những cuộc hội thoại mới.

Cấu hình qua CLI

1. Tải cấu hình agent về

elevenlabs agents pull --agent "<agent-name>"

2. Chỉnh sửa file agent_configs/<agent-name>.json

Thiết lập platform_settings.guardrails:

{
  "platform_settings": {
    "guardrails": {
      "version": "1",
      "prompt_injection": { "isEnabled": true },
      "custom": {
        "config": {
          "configs": [
            {
              "is_enabled": true,
              "name": "No financial advice",
              "prompt": "Block any content that provides specific financial advice, investment recommendations, or tax guidance.",
              "execution_mode": "blocking",
              "trigger_action": {
                "type": "retry",
                "feedback": "Your response was blocked by a guardrail that blocks content that matches this condition/category: '{{trigger_reason}}' During your next turn you must tell the user \"I'm sorry but I can't answer that question, would you like to know something else?\"."
              }
            }
          ]
        }
      }
    }
  }
}

3. Đẩy các thay đổi của bạn lên

elevenlabs agents push --agent "<agent-name>"

Cấu hình qua API

Python

from elevenlabs import ElevenLabs

elevenlabs = ElevenLabs()

elevenlabs.conversational_ai.agents.update(
    agent_id="agent_7101k5zvyjhmfg983brhmhkd98n6",
    platform_settings={
        "guardrails": {
            "version": "1",
            "prompt_injection": {"isEnabled": True},
            "custom": {
                "config": {
                    "configs": [
                        {
                            "is_enabled": True,
                            "name": "No financial advice",
                            "prompt": "Block any content that provides specific financial advice, investment recommendations, or tax guidance.",
                            "execution_mode": "blocking",
                            "trigger_action": {
                                "type": "retry",
                                "feedback": "Your response was blocked by a guardrail that blocks content that matches this condition/category: '{{trigger_reason}}' During your next turn you must tell the user \"I'm sorry but I can't answer that question, would you like to know something else?\".",
                            },
                        }
                    ]
                }
            },
        },
    },
)

TypeScript

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient();

await elevenlabs.conversationalAi.agents.update("agent_7101k5zvyjhmfg983brhmhkd98n6", {
  platformSettings: {
    guardrails: {
      version: "1",
      promptInjection: { isEnabled: true },
      custom: {
        config: {
          configs: [
            {
              isEnabled: true,
              name: "No financial advice",
              prompt:
                "Block any content that provides specific financial advice, investment recommendations, or tax guidance.",
              executionMode: "blocking",
              triggerAction: {
                type: "retry",
                feedback: `Your response was blocked by a guardrail that blocks content that matches this condition/category: '{{trigger_reason}}' During your next turn you must tell the user "I'm sorry but I can't answer that question, would you like to know something else?".`,
              },
            },
          ],
        },
      },
    },
  },
});

Khi cơ chế kiểm soát được kích hoạt, cách thức xử lý sẽ phụ thuộc vào loại cơ chế và cấu hình đã thiết lập:

  • Kết thúc cuộc gọi/phiên: Phiên làm việc kết thúc ngay lập tức (cuộc gọi thoại bị ngắt hoặc phiên chat bị đóng). Sự kiện kích hoạt này sẽ được ghi lại trong lịch sử hội thoại.
  • Thử lại (áp dụng cho cơ chế chặn tùy chỉnh hoặc chặn theo nội dung): Lượt phản hồi vi phạm của trợ lý sẽ bị loại bỏ, hệ thống sẽ chèn thông báo phản hồi và mô hình sẽ thử lại - tối đa 3 lần - trước khi kết thúc phiên nếu cơ chế kiểm soát vẫn tiếp tục kích hoạt.

Đối với tùy chọn kết thúc cuộc gọi/phiên, người dùng cuối sẽ gặp tình trạng cuộc gọi bị ngắt hoặc phiên chat bị đóng. Chi tiết về vi phạm sẽ hiển thị trong nhật ký hội thoại dành cho bạn và không hiển thị nguyên văn cho người dùng cuối.

Sau khi kết thúc cuộc gọi/phiên, người dùng có thể bắt đầu một cuộc hội thoại mới. Cơ chế kiểm soát không chặn người dùng vĩnh viễn; nó chỉ chặn phản hồi cụ thể (hoặc phiên làm việc) vi phạm chính sách.

Các phương pháp hay nhất

Agent hỗ trợ khách hàng

Sử dụng các cơ chế kiểm soát tùy chỉnh để thực thi những chính sách đặc thù của doanh nghiệp. Ví dụ:

  • Chặn việc hoàn tiền, cấp tín dụng hoặc thay đổi gói đăng ký trừ khi đã xác nhận đủ điều kiện thông qua các công cụ.
  • Chặn việc cung cấp giảm giá hoặc mã khuyến mãi trừ khi có sự cho phép rõ ràng.
  • Chặn các phản hồi mang tính phỏng đoán về lộ trình phát triển sản phẩm hoặc những tính năng chưa được phát hành.

Ứng dụng y tế

Sử dụng các cơ chế kiểm soát tùy chỉnh để kiểm soát chặt chẽ những giới hạn chuyên môn y tế. Ví dụ:

  • Chặn việc chẩn đoán bệnh lý hoặc đề xuất các phương pháp điều trị cụ thể.
  • Chặn việc đưa ra khuyến nghị về liều lượng thuốc.
  • Ngăn chặn việc thay thế lời khuyên từ chuyên gia y tế có giấy phép hành nghề.

Nội dung giáo dục

Sử dụng các cơ chế kiểm soát tùy chỉnh để quản lý những chủ đề học thuật nhạy cảm. Ví dụ:

  • Chặn hướng dẫn chi tiết từng bước cho các thí nghiệm gây hại hoặc quy trình không an toàn.
  • Chặn việc tạo đáp án cho các bài kiểm tra hoặc kỳ thi đang diễn ra.
  • Chặn nội dung có thể tiếp tay cho hành vi gian lận trong học tập.

Công cụ nội bộ doanh nghiệp

Sử dụng các cơ chế kiểm soát tùy chỉnh để bảo vệ hoạt động và dữ liệu của công ty. Ví dụ:

  • Chặn chia sẻ tài liệu nội bộ hoặc các quy trình bảo mật.  
  • Chặn tiết lộ các API riêng, câu lệnh hệ thống (system prompt) hoặc thông tin chi tiết về cơ sở hạ tầng.
  • Chặn mô phỏng các hành động đòi hỏi quyền hạn của cấp quản lý hoặc quản trị viên.

Kiểm thử với các tình huống thực tế

Trước khi triển khai, hãy kiểm thử cấu hình cơ chế kiểm soát của bạn với:

  • Các luồng hội thoại thông thường để đảm bảo không xảy ra lỗi nhận diện sai 
  • Các trường hợp ngoại lệ tiệm cận nhưng không vượt qua giới hạn an toàn
  • Các câu lệnh mang tính tấn công nhằm mục đích khai thác những phản hồi gây hại
Thứ Tư, 07/10/2026 07:30
5 ★ 1 👨 2
Xác thực tài khoản!

Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:

Số điện thoại chưa đúng định dạng!
Số điện thoại này đã được xác thực!
Bạn có thể dùng Sđt này đăng nhập tại đây!
Lỗi gửi SMS, liên hệ Admin
0 Bình luận
Sắp xếp theo