Phương pháp luận

Đằng sau mỗi con số là một câu nói của người dùng

Kompa công bố những con số như “80.135 thảo luận” hay “NSR 87,3%”. Trang này giải thích một “thảo luận” được tính như thế nào, những gì bị loại bỏ trước khi đếm, và công thức đằng sau từng chỉ số.

Nội dung trên trang này là phương pháp dùng chung cho mọi báo cáo Kompa phát hành.

  1. Thu thậpCollect
  2. Gom cụmCluster
  3. Xác thựcAuthenticate
  4. Hiểu nội dungUnderstand
  5. Kiểm chứngVerify

Một lô dữ liệu đi qua năm bước xử lý

  1. 01Thu thập

    Đang quét facebook.com

    Xử lý hàng triệu dữ liệu mỗi ngày

    • LinhTikTokXài hai tuần rồi, pin trâu thật@linhchi.ng · 3 giờ trước
    • HuyDiễn đànGiá này so với bên kia thì ổn áp@huy.tran · 4 giờ trước
    • QuyênFacebookNhân viên tư vấn nhiệt tình, sẽ quay lạiTìm theo ngữ nghĩa

    Thuật ngữTruy hồi ngữ nghĩa

    Tìm được cả bài không nhắc tên thương hiệu

  2. 02Gom cụm

    • NamFacebookGiao hàng nhanh, đóng gói cẩn thận lắm@nam331 · 5 giờ trước
    • NamFacebookGiao hàng nhanh, đóng gói cẩn thận ạ 😍96% giống nhau
    • NgọcThreadsĐặt tối qua sáng nay có hàng luôn@ngocanh__ · 6 giờ trước

    1 Trùng lặp

    Thuật ngữGom cụm ngữ nghĩaTrùng lặp gần

    Khác vài chữ vẫn là một thảo luận

  3. 03Xác thực

    • TuấnFacebookApp hay lỗi lúc thanh toán@tuan.ng89 · 7 giờ trước
    • shop_giare247FacebookINBOX SHOP GIÁ SỈ 0909 ***@shop_giare247 · 6 giờ trước
    • MaiDiễn đànTư vấn viên trả lời hơi chậm@mai.phuong · 9 giờ trước
    • kèo thơm hôm nayThreadsvào bio nhận ngay 200k@keothom_vip · 8 giờ trước

    2 Spam

    Đăng phối hợp cùng mẫu · cách 4 phút

    Thuật ngữĐiểm xác thựcĐăng bài phối hợp

    Hai tài khoản, cùng mẫu đăng, cách nhau bốn phút

  4. 04Hiểu nội dung

    Bài gốcNhà mạng nào wifi ổn định nhất khu Quận 7 vậy mọi người?

    BảoDiễn đàn2 giờ trước

    Wifidạo nàychập chờnquá,aicũngbịhaymình mìnhvậy ta

    Thuộc tính

    1. Chất lượng mạngWifi · chập chờn
    2. Độ ổn địnhdạo này · chập chờn · quá
    3. Vùng phủ sóngai · cũng · bị

    Ý định

    1. Hỏi đáphay · mình mình · vậy ta

    Thuật ngữSắc thái theo thuộc tínhÝ định người viết

    Mỗi thuộc tính một sắc thái riêng

  5. 05Kiểm chứng

    Ngưỡng chuyển rà soát70%

    • BảoWifi dạo này chập chờn quá, ai cũng bị hay mình mình vậy ta

      Nhãn máy gán

    • QuyênNhân viên tư vấn nhiệt tình, sẽ quay lại

      Nhãn máy gán

    Truy ngược về dữ liệu gốc

    Thuật ngữĐộ tin cậyNgưỡng chuyển người rà soát

    Dưới ngưỡng tin cậy thì người đọc lại

Độ phủ dữ liệu

Dữ liệu đến từ đâu

Độ phủ 360° trải từ kênh truyền thông chính thống đến dữ liệu mở trên internet — mạng xã hội, báo chí, thương mại điện tử, phát thanh truyền hình và diễn đàn. Thảo luận về thương hiệu diễn ra ở tất cả những nơi đó, và một con số chỉ lấy từ một nơi là một con số thiếu.

20+Nền tảng thu thập

Facebook, TikTok, YouTube, Threads, diễn đàn, báo điện tử…

  • 200.000+Kênh YouTube
  • 1.350+Đầu báo online, báo giấy, báo in
  • 200+Trang thương mại điện tử
  • 50+Kênh truyền hình và radio

Chỉ dữ liệu công khai

Độ phủ mới là một nửa. Nửa còn lại là tìm đúng thảo luận bên trong độ phủ đó: ngoài đối sánh từ khóa, hệ thống truy hồi theo ngữ nghĩa, nên một bài viết nói về thương hiệu mà không gọi đúng tên vẫn nằm trong dữ liệu.

Cùng với trang, hội nhóm và bài đăng cộng đồng trên Facebook ở khắp Việt Nam. “Nền tảng” và “nguồn” là hai đơn vị khác nhau: một nền tảng như YouTube chứa hàng trăm nghìn nguồn.

Quy trình

Từ dữ liệu thô đến một con số

Năm bước, chạy liên tục. Phần lớn dữ liệu thô không bao giờ trở thành một thảo luận được đếm — chủ yếu bị loại ở khâu trùng lặp và spam.

  1. Xác định nguồn và truy hồi

    Hệ thống xác định các nguồn liên quan đến thương hiệu, sản phẩm và bộ từ khóa được thiết lập. Ngoài đối sánh từ khóa, hệ thống còn truy hồi theo ngữ nghĩa: một bài viết nói về thương hiệu nhưng không chứa từ khóa nào vẫn được tìm thấy.

  2. Thu thập thời gian thực

    Crawler tự động thu thập từ các nguồn đã xác định theo thời gian thực. Mỗi nguồn được ghi nhận kèm cấp độ tin cậy: một đầu báo có giấy phép và một tài khoản diễn đàn ẩn danh đều được thu thập, nhưng không phải là bằng chứng ngang nhau.

  3. Gom cụm và khử trùng lặp

    Các bài gần giống nhau được gom thành một cụm theo ngữ nghĩa chứ không theo chuỗi ký tự, nên một bài đăng lại có thêm emoji, hashtag hay đổi vài chữ vẫn bị nhận ra. Một thông cáo đăng lại trên nhiều đầu báo được tính là một thảo luận với nhiều nguồn.

  4. Xác thực nguồn

    Spam, tài khoản rao bán và hành vi tự động bị loại. Các tài khoản đăng nội dung gần giống nhau trong khoảng thời gian hẹp được gom thành một nhóm phối hợp, tính một lần và báo cáo riêng. Mỗi dữ liệu mang một điểm xác thực; phần không đạt ngưỡng bị loại khỏi con số chính và được nêu rõ.

  5. Hiểu nội dung và kiểm chứng

    Mỗi thảo luận được tách từ tiếng Việt, gán thuộc tính, sắc thái theo từng thuộc tính và ý định người viết. Mỗi nhãn đi kèm độ tin cậy; dưới ngưỡng thì chuyển cho người rà soát. Mọi con số trong báo cáo đều truy ngược được về tập dữ liệu tạo ra nó.

Hệ thống thu thập

  • Thu thập dữ liệu từ 20+ nền tảng
  • Tự động phân loại thông tin
  • Xử lý hàng triệu dữ liệu mỗi ngày
  • Cập nhật real-time 24/7
  • Hỗ trợ đa ngôn ngữ
  • Hệ thống proxy và IP tự động

Hệ thống

Bốn tầng xử lý

Dữ liệu đi qua bốn tầng: thu thập và truy hồi theo ngữ nghĩa, hiểu nội dung tiếng Việt ở mức thuộc tính và ý định, kiểm chứng bằng độ tin cậy cùng người rà soát, và cuối cùng là cảnh báo khi có dấu hiệu bất thường.

  1. Thu thập và truy hồi

    Hệ thống lắng nghe từ kênh tin tức chính thống, diễn đàn, trang thương mại điện tử đến các nền tảng mạng xã hội. Việc truy hồi dựa trên cả bộ từ khóa lẫn ngữ nghĩa, nên thảo luận liên quan vẫn được tìm thấy khi người viết không gọi đúng tên thương hiệu.

  2. Hiểu nội dung tiếng Việt

    Tách từ, gán thuộc tính, sắc thái theo từng thuộc tính và ý định người viết. Các trường hợp đặc thù của tiếng Việt — mỉa mai, teencode, chen tiếng Anh, từ địa phương — được xử lý ở tầng này thay vì bị bỏ qua.

  3. Kiểm chứng và rà soát

    Mỗi nhãn do máy gán đều có độ tin cậy. Dưới ngưỡng, dữ liệu được chuyển cho đội ngũ rà soát 24/7. Chất lượng của từng nhóm nhãn được đo trên một bộ dữ liệu vàng tiếng Việt thay vì được mô tả bằng tính từ.

  4. Cảnh báo và quản trị

    Khi thông tin tiêu cực vượt ngưỡng hoặc xuất hiện dấu hiệu đăng bài phối hợp, hệ thống cảnh báo sớm để đội ngũ xử lý trước khi thành khủng hoảng.

Con người trong vòng lặp

Máy gán nhãn. Người rà soát.

Dưới ngưỡng tin cậy, một thảo luận không được giữ nhãn tự động mà chuyển cho người rà soát. Người rà soát không đọc lại toàn bộ dữ liệu — họ xử lý đúng phần mà hệ thống tự nhận là chưa chắc.

Nhưng con người cũng không thống nhất với nhau. Mỉa mai, tiếng lóng vùng miền và câu đa nghĩa là ba trường hợp mà hai người đọc có thể gán hai nhãn khác nhau. Vì vậy mức đồng thuận giữa những người gán nhãn được đo trên bộ dữ liệu vàng chứ không được giả định: nếu con người còn không thống nhất với nhau thì không thể đòi hỏi máy chính xác hơn mức đó.

Công thức

Mọi chỉ số đều có công thức, không ước lượng

Mọi tỉ lệ trong báo cáo của Kompa đều đến từ một công thức nêu rõ bên dưới. Kompa không phát hành điểm tổng hợp dạng hộp đen: một chỉ số độc quyền thì khách hàng không kiểm chứng được. Kéo thanh trượt để xem công thức phản ứng.

Tỉ lệ sắc thái — NSR (Net Sentiment Rate)

NSR64,0%

Thảo luận trung lập không nằm trong công thức — NSR chỉ so sánh tích cực với tiêu cực. NSR được tính cho từng thuộc tính; con số tổng là trung bình có trọng số theo lượng thảo luận của các thuộc tính.

Cơ cấu ý định

  1. Phàn nàn34%
  2. Hỏi đáp26%
  3. Khen18%
  4. So sánh12%
  5. Ý định mua7%
  6. Dấu hiệu rời bỏ3%

Tỉ trọng thảo luận theo ý định người viết: phàn nàn, khen, có ý định mua, so sánh, hỏi đáp, dấu hiệu rời bỏ. Hai thương hiệu có cùng NSR vẫn có thể có cơ cấu ý định hoàn toàn khác nhau.

Chỉ số sắc thái / thuộc tính

Dùng để so sánh sắc thái hoặc thuộc tính của một thương hiệu với mặt bằng ngành. Bằng 1 nghĩa là ngang ngành; lớn hơn 1 là cao hơn ngành.

Định vị

Ma trận sức khỏe thương hiệu

Ma trận xác định vị trí của thương hiệu dựa trên ba chỉ số social listening: tổng lượng thảo luận, tỉ lệ sắc thái (NSR) và quy mô người tham gia thảo luận.

Chọn một thuộc tính để xem NSR riêng của thuộc tính đó. Một thương hiệu có thể dẫn đầu về giao hàng và tụt lại về giá — con số tổng là trung bình có trọng số của các thuộc tính, nên nó che mất chính điều này.

Ví dụ minh họa
x
Trục ngang — tổng lượng thảo luậnThang tương đối — lượng thảo luận không so sánh được giữa các ngành
y
Trục dọc — NSR (%)
Kích thước bong bóng — quy mô người tham gia thảo luậnÍt người tham giaNhiều người tham gia
α — thương hiệu đang được báo cáo
β–θ — các thương hiệu khác trong ngành
NSR 87,3% — con số trang này giải thích

Di chuột hoặc chạm vào một vùng để xem ý nghĩa của vùng đó.

Các thương hiệu trên biểu đồ chỉ để minh họa cách đọc ma trận, không phải số liệu từ một nghiên cứu đã công bố.

Thuật ngữ

45 thuật ngữ dùng trong mọi báo cáo

Đây là bộ thuật ngữ chuẩn của Kompa. Khi một báo cáo viết “thị phần thảo luận” hay “unique voice”, nghĩa của nó là định nghĩa dưới đây — không phải một cách hiểu khác.

45 thuật ngữ

Thuật ngữ trong báo cáoThuật ngữ phương pháp

Thuật ngữ trong báo cáo28

Các hội thoại có chứa từ khóa liên quan trực tiếp và gián tiếp đến đối tượng cần phân tích dữ liệu, trong các bài đăng, video, tin tức, bình luận, chia sẻ.

Tổng các cuộc hội thoại của đối tượng cần phân tích dữ liệu được tạo ra trên các nền tảng từ báo chí, diễn đàn, mạng xã hội.

Một nhóm các sản phẩm, dịch vụ, loại hình kinh doanh và tổ chức có cùng cơ cấu tổ chức, vận hành với cùng mục đích kinh doanh hoặc sản phẩm phân phối, và cùng chung tệp khách hàng.

Các từ hoặc cụm từ được sử dụng với mục đích tổng hợp dữ liệu.

Các nguồn nơi tạo ra và lưu giữ các hội thoại của đối tượng cần thu thập và phân tích dữ liệu.

Các hội thoại được đăng tải và quản lý bởi ban quản trị, cùng bình luận từ các thành viên, trên website, fanpage, kênh YouTube chính thống của doanh nghiệp.

Các thảo luận được tạo ra từ người dùng mạng một cách tự nhiên trên môi trường internet và có đề cập đến thương hiệu.

Các thảo luận được gán nhãn theo nhóm nội dung hoặc chủ đề liên quan, thể hiện đặc điểm của thông tin hoặc sự việc.

Người dùng tạo ra bài đăng, hoặc những người đưa ra các bình luận.

Mức độ tương quan giữa các cuộc trò chuyện về thương hiệu, sản phẩm, dịch vụ trên nhiều kênh khác nhau, so với các đối thủ cạnh tranh trên thị trường.

Tỉ lệ giữa thảo luận tích cực và tiêu cực. Thảo luận trung lập không tham gia vào phép tính.

Cảm xúc của người dùng trên các nền tảng mạng xã hội, gồm ba nhóm:

  • Tích cựcPositiveThích hoặc yêu thích thương hiệu, chiến dịch.
  • Trung lậpNeutralCó đề cập đến thương hiệu nhưng không thể hiện cảm xúc.
  • Tiêu cựcNegativeGhét hoặc không thích thương hiệu, chiến dịch.

Dùng để so sánh sắc thái hoặc thuộc tính của một thương hiệu với mặt bằng toàn ngành. Bằng 1 là ngang ngành, lớn hơn 1 là cao hơn ngành.

Các biểu tượng thể hiện cảm xúc của người dùng trên nền tảng mạng xã hội: thích, yêu thích, buồn, giận dữ, vui vẻ.

Hành vi và xu hướng của người dùng, rút ra từ dữ liệu thu thập được.

Các chủ đề có số lượng hội thoại cao nhất.

Các người dùng tạo ra nhiều lượng hội thoại nhất trên mạng xã hội.

Các thảo luận hoặc tình huống giữa hai hay nhiều người và các tương tác của họ: thích, bình luận, chia sẻ.

Các hội thoại về hoạt động khuyến mãi online và offline.

Giá trị của thương hiệu trên các kênh mạng xã hội.

Sức khỏe thương hiệu trên truyền thông, quyết định bởi ba chỉ số: tổng lượng thảo luận (total mentions), tỉ lệ sắc thái (NSR) và lượng người dùng tạo ra thảo luận (unique voice).

Các yếu tố then chốt đảm bảo sự thành công của hoạt động truyền thông thương hiệu.

Quá trình mà khách hàng trải nghiệm trong khi mua hàng và sử dụng sản phẩm, dịch vụ.

Các phản hồi và thảo luận trực tiếp đến thông điệp của chiến dịch.

Các phản hồi và thảo luận trực tiếp đến thương hiệu và các thông điệp chiến dịch của thương hiệu.

Chi phí khi đặt bài viết truyền thông và slot quảng cáo trên TV, radio.

Giá trị thương hiệu nhận được cho mỗi hoạt động truyền thông trên TV, slot radio và bài viết truyền thông.

Thuật ngữ phương pháp17

Cách tìm dữ liệu dựa trên ý nghĩa của câu thay vì chỉ đối sánh từ khóa. Một bài viết nói về thương hiệu mà không nhắc tên thương hiệu vẫn được tìm thấy.

Diễn ra ở bước 1 · Thu thập

Nhóm các thảo luận có cùng nội dung vào một cụm dựa trên ý nghĩa, không dựa trên việc trùng khớp từng ký tự.

Diễn ra ở bước 2 · Gom cụm

Hai thảo luận không giống nhau từng chữ nhưng cùng một nội dung — thêm emoji, thêm hashtag, đổi một vài từ. Được tính là một thảo luận.

Diễn ra ở bước 2 · Gom cụm

Một thông cáo hoặc bài viết được đăng lại trên nhiều đầu báo được tính là một thảo luận với nhiều nguồn, thay vì nhiều thảo luận riêng biệt.

Diễn ra ở bước 2 · Gom cụm

Mức độ tin rằng một thảo luận đến từ người dùng thật và độc lập. Phần không đạt ngưỡng bị loại khỏi con số chính và được nêu rõ trong báo cáo.

Diễn ra ở bước 3 · Xác thực

Nhiều tài khoản đăng nội dung gần giống nhau trong khoảng thời gian hẹp. Được gom thành một nhóm, tính một lần và báo cáo tách khỏi thảo luận tự nhiên.

Diễn ra ở bước 3 · Xác thực

Sắc thái được gán cho từng thuộc tính trong một thảo luận, không phải cho cả bài. Một bài có thể tích cực về giao hàng và tiêu cực về giá cùng lúc.

Điều người viết muốn khi đăng: phàn nàn, khen, có ý định mua, so sánh, hỏi đáp, hoặc dấu hiệu rời bỏ. Hai thương hiệu cùng NSR vẫn có thể khác hẳn nhau ở đây.

Thói quen xen tiếng Anh vào câu tiếng Việt — “ship nhanh”, “sale off”, “oke em”. Câu chen ngôn ngữ vẫn được tách từ và gán nhãn như câu thuần Việt.

Cách viết tắt và biến âm phổ biến trên mạng xã hội Việt Nam — “ko”, “dc”, “vs”, “iu”. Được chuẩn hóa về dạng đầy đủ trước khi phân tích.

Câu mang nghĩa ngược với chữ viết. Đây là trường hợp mà cả máy lẫn người đều có thể gán nhãn khác nhau, nên nó được đo riêng thay vì gộp vào sai số chung.

Diễn ra ở bước 4 · Hiểu nội dung

Nối một cách gọi trong câu về đúng đối tượng: thương hiệu, sản phẩm, đối thủ hay một người. “Shop này”, “nó”, tên viết tắt đều được nối về thực thể tương ứng.

Mức chắc chắn của hệ thống với một nhãn đã gán, tính trên thang 0–100. Đi kèm mọi nhãn tự động.

Mức độ tin cậy mà dưới đó một thảo luận được chuyển cho người rà soát thay vì giữ nhãn tự động.

Diễn ra ở bước 5 · Kiểm chứng

Tập dữ liệu tiếng Việt do người gán nhãn thủ công, dùng làm chuẩn để đo độ chính xác của hệ thống. Chất lượng mô hình được đo trên bộ này chứ không được mô tả bằng tính từ.

Diễn ra ở bước 5 · Kiểm chứng

Mức độ hai người gán nhãn độc lập cho cùng một kết quả. Nếu con người còn không thống nhất với nhau thì không thể đòi hỏi máy chính xác hơn mức đó.

Diễn ra ở bước 5 · Kiểm chứng

Mỗi con số trong báo cáo đều truy ngược được về đúng tập thảo luận đã tạo ra nó. Không có bước này thì một con số chỉ có thể tin, không thể kiểm.

Diễn ra ở bước 5 · Kiểm chứng

Chú thích dữ liệu

Mỗi biểu đồ đều đi kèm sáu thông tin này

Một con số không có phạm vi đo thì không kiểm chứng được. Đây là phần chú thích tối thiểu đi kèm mọi biểu đồ trong báo cáo Kompa.

Thời gian đo lường
01/01/2026 – 26/03/2026
Nền tảng được tính
Facebook, TikTok, YouTube, diễn đàn, báo điện tử
Bộ từ khóa
12 từ khóa thương hiệu + 34 từ khóa ngành
Cách truy hồi
Từ khóa + truy hồi ngữ nghĩa
Tổng thảo luận
14.130
Tỉ lệ người rà soát
8,4% dưới ngưỡng tin cậy, đã rà soát thủ công

Thiếu bất kỳ dòng nào trong sáu dòng trên thì con số không so sánh được với kỳ trước hay với một báo cáo khác.

Phạm vi

Những gì phương pháp này không đo được

Một phương pháp chỉ có ích khi biết rõ giới hạn của nó. Năm điều dưới đây áp dụng cho mọi báo cáo Kompa phát hành.

  • Chỉ dữ liệu công khai

    Tin nhắn riêng tư, nhóm kín và nội dung bị xóa trước thời điểm thu thập không nằm trong dữ liệu. Một cuộc thảo luận không công khai là một cuộc thảo luận không được đếm.

  • Sắc thái có sai số

    Mỉa mai, tiếng lóng vùng miền và câu đa nghĩa là ba trường hợp mà cả máy lẫn người đều có thể gán nhãn khác nhau. Việc rà soát 24/7 giảm sai số này chứ không xóa bỏ nó.

  • Bộ từ khóa vẫn định hình con số

    Truy hồi ngữ nghĩa tìm được thảo luận không chứa từ khóa, nhưng phạm vi đo vẫn bắt đầu từ bộ từ khóa và nhóm ngành được chọn. Vì vậy mỗi báo cáo cần nêu rõ khoảng thời gian, nền tảng và cách truy hồi — hai báo cáo cùng ngành nhưng khác phạm vi không so sánh trực tiếp được với nhau.

  • Nhãn tự động có độ tin cậy, không có sự chắc chắn

    Mỗi nhãn do máy gán đều kèm một độ tin cậy, và phần dưới ngưỡng được người rà soát. Điều đó thu hẹp sai số chứ không loại bỏ nó: phần trên ngưỡng vẫn là ước lượng của mô hình, và tỉ lệ đúng của từng nhóm nhãn được đo chứ không được giả định.

  • Độ phủ thay đổi theo nền tảng

    Khi một nền tảng đổi API hoặc chính sách hiển thị, độ phủ của kỳ sau có thể khác kỳ trước. Những thay đổi đáng kể được ghi chú trong báo cáo liên quan.

Áp dụng phương pháp này cho ngành của bạn

Đội ngũ phân tích của Kompa sẽ trao đổi về bộ từ khóa, khoảng thời gian đo và các nền tảng phù hợp với câu hỏi bạn đang cần trả lời.

Liên hệ đội ngũ phân tíchXem thư viện báo cáo