Home page / Technology updates

Tonic Textual ra mắt trên Microsoft Fabric: Chuẩn bị dữ liệu phi cấu trúc cho AI

Phần lớn dữ liệu của doanh nghiệp tồn tại ở dạng phi cấu trúc và thường bị hạn chế truy cập do chứa thông tin nhạy cảm, gây cản trở lớn cho các dự án AI. Để giải quyết thách thức này, Microsoft đã công bố phát hành chính thức (GA) Tonic Textual dưới dạng một workload tích hợp ngay trong Microsoft Fabric, giúp các doanh nghiệp chuẩn bị và ẩn danh hóa dữ liệu văn bản một cách an toàn để sẵn sàng cho các ứng dụng AI.

Thách thức từ dữ liệu phi cấu trúc trong kỷ nguyên AI

Theo dự báo của Gartner, đến hết năm 2026, 60% dự án AI sẽ bị hủy bỏ vì thiếu dữ liệu sẵn sàng cho AI. Một phần lớn thông tin doanh nghiệp tồn tại dưới dạng văn bản phi cấu trúc, bao gồm phiếu hỗ trợ, hợp đồng, bản ghi cuộc gọi, tài liệu kỹ thuật và trao đổi nội bộ. Những nguồn này chứa đựng thông tin giá trị để huấn luyện hoặc đánh giá hệ thống AI, nhưng đồng thời cũng chứa dữ liệu nhạy cảm như thông tin cá nhân, chi tiết tài chính, hoặc bí mật kinh doanh, khiến việc truy cập chúng bị giới hạn.

Tonic Textual: Giải pháp chuẩn bị dữ liệu an toàn trên Microsoft Fabric

Ngày 26/3/2026, Tonic Textual đã được phát hành chính thức (GA) dưới dạng một workload trong Microsoft Fabric Workload Hub. Workload này cung cấp các công cụ giúp doanh nghiệp phát hiện thông tin nhạy cảm trong văn bản và chuẩn bị các dataset có thể sử dụng an toàn trong các quy trình phát triển AI ngay trên nền tảng Fabric. Ví dụ, trong ngành y tế, các ghi chú lâm sàng hay hồ sơ bệnh án chứa nhiều ngữ cảnh quan trọng nhưng cũng bao gồm thông tin sức khỏe cần được bảo vệ. Việc chuẩn bị dữ liệu này trước khi đưa vào hệ thống AI cho phép tổ chức giảm thiểu rủi ro về quyền riêng tư mà vẫn khai thác được giá trị thông tin.

Với Tonic Textual, các tổ chức có thể cấu hình cách xử lý các thực thể nhạy cảm được phát hiện, bao gồm các tùy chọn:

  • Redacting: Biên tập và che đi các giá trị nhạy cảm.
  • Masking: Che giấu các định danh cụ thể.
  • Synthesizing: Thay thế các giá trị bằng dữ liệu tổng hợp (synthetic data).
  • Áp dụng các quy tắc tùy chỉnh cho từng loại thực thể cụ thể.

Việc thực hiện các bước này ngay trong Fabric cho phép các đội ngũ chuẩn bị dữ liệu văn bản mà không cần di chuyển nó ra ngoài nền tảng, đảm bảo tính nhất quán và an toàn.

Quy trình làm việc mẫu với Tonic Textual trong Fabric

Dưới đây là quy trình làm việc mẫu để chuẩn bị dữ liệu văn bản cho các workflow AI bằng Tonic Textual trong Fabric.

1. Thêm workload

Cài đặt Tonic Textual từ Microsoft Fabric Workload Hub.

Tonic Textual trong Microsoft Fabric Workload Hub.

2. Chọn dữ liệu trong OneLake

Chọn các bộ sưu tập tài liệu, bản ghi hoặc các dataset văn bản khác được lưu trữ trong OneLake.

Chọn thư mục nguồn trong OneLake để xử lý.

3. Chọn vị trí đầu ra

Chỉ định nơi dataset đã được chuẩn bị sẽ được ghi vào OneLake. Điều này cho phép giữ nguyên dữ liệu gốc và tạo ra một dataset riêng biệt, sẵn sàng cho AI.

Chọn thư mục đích trong OneLake để lưu dữ liệu đã xử lý.

4. Phát hiện các thực thể nhạy cảm

Tonic Textual sẽ quét dataset và xác định các thông tin nhạy cảm.

Giao diện quét và phát hiện các thực thể nhạy cảm trong tệp.

5. Cấu hình các phép biến đổi

Lựa chọn cách xử lý cho từng loại thực thể được phát hiện (redaction, synthesis…).

Cấu hình tùy chọn ẩn danh hóa dữ liệu.

6. Sử dụng dữ liệu đã chuẩn bị

Dataset kết quả vẫn nằm trong Fabric và có thể được sử dụng trong các pipeline downstream, chẳng hạn như cho hệ thống training hoặc retrieval-augmented generation (RAG). Cách tiếp cận này giúp các đội ngũ chuẩn bị dataset an toàn trước khi chúng được sử dụng trong các prompt hoặc mô hình AI, đồng thời vẫn giữ được ngữ cảnh và cấu trúc ban đầu của dữ liệu.

👋 Hi! Bạn cần tư vấn gì về dịch vụ Microsoft?