Phương pháp luận
Đằng sau mỗi con số là một câu nói của người dùng
Kompa công bố những con số như “80.135 thảo luận” hay “NSR 87,3%”. Trang này giải thích một “thảo luận” được tính như thế nào, những gì bị loại bỏ trước khi đếm, và công thức đằng sau từng chỉ số.
Nội dung trên trang này là phương pháp dùng chung cho mọi báo cáo Kompa phát hành.
- Thu thậpCollect
- Gom cụmCluster
- Xác thựcAuthenticate
- Hiểu nội dungUnderstand
- Kiểm chứngVerify
Một lô dữ liệu đi qua năm bước xử lý
01Thu thập
Đang quét facebook.com
Xử lý hàng triệu dữ liệu mỗi ngày
- LinhTikTokXài hai tuần rồi, pin trâu thật
- HuyDiễn đànGiá này so với bên kia thì ổn áp
- QuyênFacebookNhân viên tư vấn nhiệt tình, sẽ quay lạiTìm theo ngữ nghĩa
Thuật ngữTruy hồi ngữ nghĩa
Tìm được cả bài không nhắc tên thương hiệu
02Gom cụm
- NamFacebookGiao hàng nhanh, đóng gói cẩn thận lắm
- NamFacebookGiao hàng nhanh, đóng gói cẩn thận ạ 😍96% giống nhau
- NgọcThreadsĐặt tối qua sáng nay có hàng luôn
−1 Trùng lặp
Thuật ngữGom cụm ngữ nghĩa·Trùng lặp gần
Khác vài chữ vẫn là một thảo luận
03Xác thực
- TuấnFacebookApp hay lỗi lúc thanh toán
- shop_giare247FacebookINBOX SHOP GIÁ SỈ 0909 ***
- MaiDiễn đànTư vấn viên trả lời hơi chậm
- kèo thơm hôm nayThreadsvào bio nhận ngay 200k
−2 Spam
Đăng phối hợp cùng mẫu · cách 4 phút
Thuật ngữĐiểm xác thực·Đăng bài phối hợp
Hai tài khoản, cùng mẫu đăng, cách nhau bốn phút
04Hiểu nội dung
Bài gốcNhà mạng nào wifi ổn định nhất khu Quận 7 vậy mọi người?
BảoDiễn đàn2 giờ trước
Wifidạo nàychập chờnquá,aicũngbịhaymình mìnhvậy ta
Thuộc tính
- Chất lượng mạngWifi · chập chờn
- Độ ổn địnhdạo này · chập chờn · quá
- Vùng phủ sóngai · cũng · bị
Ý định
- Hỏi đáphay · mình mình · vậy ta
Mỗi thuộc tính một sắc thái riêng
05Kiểm chứng
Ngưỡng chuyển rà soát70%
Bảo
Wifi dạo này chập chờn quá, ai cũng bị hay mình mình vậy ta
Nhãn máy gán
Quyên
Nhân viên tư vấn nhiệt tình, sẽ quay lại
Nhãn máy gán
Truy ngược về dữ liệu gốc
Thuật ngữĐộ tin cậy·Ngưỡng chuyển người rà soát
Dưới ngưỡng tin cậy thì người đọc lại
Độ phủ dữ liệu
Dữ liệu đến từ đâu
Độ phủ 360° trải từ kênh truyền thông chính thống đến dữ liệu mở trên internet — mạng xã hội, báo chí, thương mại điện tử, phát thanh truyền hình và diễn đàn. Thảo luận về thương hiệu diễn ra ở tất cả những nơi đó, và một con số chỉ lấy từ một nơi là một con số thiếu.
20+Nền tảng thu thập
Facebook, TikTok, YouTube, Threads, diễn đàn, báo điện tử…
- 200.000+Kênh YouTube
- 1.350+Đầu báo online, báo giấy, báo in
- 200+Trang thương mại điện tử
- 50+Kênh truyền hình và radio
Độ phủ mới là một nửa. Nửa còn lại là tìm đúng thảo luận bên trong độ phủ đó: ngoài đối sánh từ khóa, hệ thống truy hồi theo ngữ nghĩa, nên một bài viết nói về thương hiệu mà không gọi đúng tên vẫn nằm trong dữ liệu.
Cùng với trang, hội nhóm và bài đăng cộng đồng trên Facebook ở khắp Việt Nam. “Nền tảng” và “nguồn” là hai đơn vị khác nhau: một nền tảng như YouTube chứa hàng trăm nghìn nguồn.
Quy trình
Từ dữ liệu thô đến một con số
Năm bước, chạy liên tục. Phần lớn dữ liệu thô không bao giờ trở thành một thảo luận được đếm — chủ yếu bị loại ở khâu trùng lặp và spam.
Xác định nguồn và truy hồi
Hệ thống xác định các nguồn liên quan đến thương hiệu, sản phẩm và bộ từ khóa được thiết lập. Ngoài đối sánh từ khóa, hệ thống còn truy hồi theo ngữ nghĩa: một bài viết nói về thương hiệu nhưng không chứa từ khóa nào vẫn được tìm thấy.
Thu thập thời gian thực
Crawler tự động thu thập từ các nguồn đã xác định theo thời gian thực. Mỗi nguồn được ghi nhận kèm cấp độ tin cậy: một đầu báo có giấy phép và một tài khoản diễn đàn ẩn danh đều được thu thập, nhưng không phải là bằng chứng ngang nhau.
Gom cụm và khử trùng lặp
Các bài gần giống nhau được gom thành một cụm theo ngữ nghĩa chứ không theo chuỗi ký tự, nên một bài đăng lại có thêm emoji, hashtag hay đổi vài chữ vẫn bị nhận ra. Một thông cáo đăng lại trên nhiều đầu báo được tính là một thảo luận với nhiều nguồn.
Xác thực nguồn
Spam, tài khoản rao bán và hành vi tự động bị loại. Các tài khoản đăng nội dung gần giống nhau trong khoảng thời gian hẹp được gom thành một nhóm phối hợp, tính một lần và báo cáo riêng. Mỗi dữ liệu mang một điểm xác thực; phần không đạt ngưỡng bị loại khỏi con số chính và được nêu rõ.
Hiểu nội dung và kiểm chứng
Mỗi thảo luận được tách từ tiếng Việt, gán thuộc tính, sắc thái theo từng thuộc tính và ý định người viết. Mỗi nhãn đi kèm độ tin cậy; dưới ngưỡng thì chuyển cho người rà soát. Mọi con số trong báo cáo đều truy ngược được về tập dữ liệu tạo ra nó.
Hệ thống thu thập
- Thu thập dữ liệu từ 20+ nền tảng
- Tự động phân loại thông tin
- Xử lý hàng triệu dữ liệu mỗi ngày
- Cập nhật real-time 24/7
- Hỗ trợ đa ngôn ngữ
- Hệ thống proxy và IP tự động
Hệ thống
Bốn tầng xử lý
Dữ liệu đi qua bốn tầng: thu thập và truy hồi theo ngữ nghĩa, hiểu nội dung tiếng Việt ở mức thuộc tính và ý định, kiểm chứng bằng độ tin cậy cùng người rà soát, và cuối cùng là cảnh báo khi có dấu hiệu bất thường.
Thu thập và truy hồi
Hệ thống lắng nghe từ kênh tin tức chính thống, diễn đàn, trang thương mại điện tử đến các nền tảng mạng xã hội. Việc truy hồi dựa trên cả bộ từ khóa lẫn ngữ nghĩa, nên thảo luận liên quan vẫn được tìm thấy khi người viết không gọi đúng tên thương hiệu.
Hiểu nội dung tiếng Việt
Tách từ, gán thuộc tính, sắc thái theo từng thuộc tính và ý định người viết. Các trường hợp đặc thù của tiếng Việt — mỉa mai, teencode, chen tiếng Anh, từ địa phương — được xử lý ở tầng này thay vì bị bỏ qua.
Kiểm chứng và rà soát
Mỗi nhãn do máy gán đều có độ tin cậy. Dưới ngưỡng, dữ liệu được chuyển cho đội ngũ rà soát 24/7. Chất lượng của từng nhóm nhãn được đo trên một bộ dữ liệu vàng tiếng Việt thay vì được mô tả bằng tính từ.
Cảnh báo và quản trị
Khi thông tin tiêu cực vượt ngưỡng hoặc xuất hiện dấu hiệu đăng bài phối hợp, hệ thống cảnh báo sớm để đội ngũ xử lý trước khi thành khủng hoảng.
Con người trong vòng lặp
Máy gán nhãn. Người rà soát.
Dưới ngưỡng tin cậy, một thảo luận không được giữ nhãn tự động mà chuyển cho người rà soát. Người rà soát không đọc lại toàn bộ dữ liệu — họ xử lý đúng phần mà hệ thống tự nhận là chưa chắc.
Nhưng con người cũng không thống nhất với nhau. Mỉa mai, tiếng lóng vùng miền và câu đa nghĩa là ba trường hợp mà hai người đọc có thể gán hai nhãn khác nhau. Vì vậy mức đồng thuận giữa những người gán nhãn được đo trên bộ dữ liệu vàng chứ không được giả định: nếu con người còn không thống nhất với nhau thì không thể đòi hỏi máy chính xác hơn mức đó.
Công thức
Mọi chỉ số đều có công thức, không ước lượng
Mọi tỉ lệ trong báo cáo của Kompa đều đến từ một công thức nêu rõ bên dưới. Kompa không phát hành điểm tổng hợp dạng hộp đen: một chỉ số độc quyền thì khách hàng không kiểm chứng được. Kéo thanh trượt để xem công thức phản ứng.
Tỉ lệ sắc thái — NSR (Net Sentiment Rate)
NSR64,0%
Thảo luận trung lập không nằm trong công thức — NSR chỉ so sánh tích cực với tiêu cực. NSR được tính cho từng thuộc tính; con số tổng là trung bình có trọng số theo lượng thảo luận của các thuộc tính.
Cơ cấu ý định
- Phàn nàn34%
- Hỏi đáp26%
- Khen18%
- So sánh12%
- Ý định mua7%
- Dấu hiệu rời bỏ3%
Tỉ trọng thảo luận theo ý định người viết: phàn nàn, khen, có ý định mua, so sánh, hỏi đáp, dấu hiệu rời bỏ. Hai thương hiệu có cùng NSR vẫn có thể có cơ cấu ý định hoàn toàn khác nhau.
Chỉ số sắc thái / thuộc tính
Dùng để so sánh sắc thái hoặc thuộc tính của một thương hiệu với mặt bằng ngành. Bằng 1 nghĩa là ngang ngành; lớn hơn 1 là cao hơn ngành.
Định vị
Ma trận sức khỏe thương hiệu
Ma trận xác định vị trí của thương hiệu dựa trên ba chỉ số social listening: tổng lượng thảo luận, tỉ lệ sắc thái (NSR) và quy mô người tham gia thảo luận.
Chọn một thuộc tính để xem NSR riêng của thuộc tính đó. Một thương hiệu có thể dẫn đầu về giao hàng và tụt lại về giá — con số tổng là trung bình có trọng số của các thuộc tính, nên nó che mất chính điều này.
- x
- Trục ngang — tổng lượng thảo luậnThang tương đối — lượng thảo luận không so sánh được giữa các ngành
- y
- Trục dọc — NSR (%)
- Kích thước bong bóng — quy mô người tham gia thảo luậnÍt người tham giaNhiều người tham gia
- α — thương hiệu đang được báo cáo
- β–θ — các thương hiệu khác trong ngành
- NSR 87,3% — con số trang này giải thích
Di chuột hoặc chạm vào một vùng để xem ý nghĩa của vùng đó.
Các thương hiệu trên biểu đồ chỉ để minh họa cách đọc ma trận, không phải số liệu từ một nghiên cứu đã công bố.
Thuật ngữ
45 thuật ngữ dùng trong mọi báo cáo
Đây là bộ thuật ngữ chuẩn của Kompa. Khi một báo cáo viết “thị phần thảo luận” hay “unique voice”, nghĩa của nó là định nghĩa dưới đây — không phải một cách hiểu khác.
Thuật ngữ trong báo cáo28
Các hội thoại có chứa từ khóa liên quan trực tiếp và gián tiếp đến đối tượng cần phân tích dữ liệu, trong các bài đăng, video, tin tức, bình luận, chia sẻ.
Tổng các cuộc hội thoại của đối tượng cần phân tích dữ liệu được tạo ra trên các nền tảng từ báo chí, diễn đàn, mạng xã hội.
Một nhóm các sản phẩm, dịch vụ, loại hình kinh doanh và tổ chức có cùng cơ cấu tổ chức, vận hành với cùng mục đích kinh doanh hoặc sản phẩm phân phối, và cùng chung tệp khách hàng.
Các từ hoặc cụm từ được sử dụng với mục đích tổng hợp dữ liệu.
Các nguồn nơi tạo ra và lưu giữ các hội thoại của đối tượng cần thu thập và phân tích dữ liệu.
Các hội thoại được thu thập đến từ các hoạt động trả phí của doanh nghiệp, từ báo chí đến các trang mạng xã hội.
Các hội thoại được đăng tải và quản lý bởi ban quản trị, cùng bình luận từ các thành viên, trên website, fanpage, kênh YouTube chính thống của doanh nghiệp.
Các thảo luận được tạo ra từ người dùng mạng một cách tự nhiên trên môi trường internet và có đề cập đến thương hiệu.
Các thảo luận được gán nhãn theo nhóm nội dung hoặc chủ đề liên quan, thể hiện đặc điểm của thông tin hoặc sự việc.
Người dùng tạo ra bài đăng, hoặc những người đưa ra các bình luận.
Tỉ lệ giữa thảo luận tích cực và tiêu cực. Thảo luận trung lập không tham gia vào phép tính.
Cảm xúc của người dùng trên các nền tảng mạng xã hội, gồm ba nhóm:
- Tích cựcPositiveThích hoặc yêu thích thương hiệu, chiến dịch.
- Trung lậpNeutralCó đề cập đến thương hiệu nhưng không thể hiện cảm xúc.
- Tiêu cựcNegativeGhét hoặc không thích thương hiệu, chiến dịch.
Dùng để so sánh sắc thái hoặc thuộc tính của một thương hiệu với mặt bằng toàn ngành. Bằng 1 là ngang ngành, lớn hơn 1 là cao hơn ngành.
Các biểu tượng thể hiện cảm xúc của người dùng trên nền tảng mạng xã hội: thích, yêu thích, buồn, giận dữ, vui vẻ.
Hành vi và xu hướng của người dùng, rút ra từ dữ liệu thu thập được.
Các chủ đề có số lượng hội thoại cao nhất.
Các người dùng tạo ra nhiều lượng hội thoại nhất trên mạng xã hội.
Các thảo luận hoặc tình huống giữa hai hay nhiều người và các tương tác của họ: thích, bình luận, chia sẻ.
Các hội thoại về hoạt động khuyến mãi online và offline.
Sức khỏe thương hiệu trên truyền thông, quyết định bởi ba chỉ số: tổng lượng thảo luận (total mentions), tỉ lệ sắc thái (NSR) và lượng người dùng tạo ra thảo luận (unique voice).
Các yếu tố then chốt đảm bảo sự thành công của hoạt động truyền thông thương hiệu.
Quá trình mà khách hàng trải nghiệm trong khi mua hàng và sử dụng sản phẩm, dịch vụ.
Các phản hồi và thảo luận trực tiếp đến thông điệp của chiến dịch.
Các phản hồi và thảo luận trực tiếp đến thương hiệu và các thông điệp chiến dịch của thương hiệu.
Chi phí khi đặt bài viết truyền thông và slot quảng cáo trên TV, radio.
Giá trị thương hiệu nhận được cho mỗi hoạt động truyền thông trên TV, slot radio và bài viết truyền thông.
Thuật ngữ phương pháp17
Cách tìm dữ liệu dựa trên ý nghĩa của câu thay vì chỉ đối sánh từ khóa. Một bài viết nói về thương hiệu mà không nhắc tên thương hiệu vẫn được tìm thấy.
Diễn ra ở bước 1 · Thu thập
Nhóm các thảo luận có cùng nội dung vào một cụm dựa trên ý nghĩa, không dựa trên việc trùng khớp từng ký tự.
Diễn ra ở bước 2 · Gom cụm
Hai thảo luận không giống nhau từng chữ nhưng cùng một nội dung — thêm emoji, thêm hashtag, đổi một vài từ. Được tính là một thảo luận.
Diễn ra ở bước 2 · Gom cụm
Một thông cáo hoặc bài viết được đăng lại trên nhiều đầu báo được tính là một thảo luận với nhiều nguồn, thay vì nhiều thảo luận riêng biệt.
Diễn ra ở bước 2 · Gom cụm
Mức độ tin rằng một thảo luận đến từ người dùng thật và độc lập. Phần không đạt ngưỡng bị loại khỏi con số chính và được nêu rõ trong báo cáo.
Diễn ra ở bước 3 · Xác thực
Nhiều tài khoản đăng nội dung gần giống nhau trong khoảng thời gian hẹp. Được gom thành một nhóm, tính một lần và báo cáo tách khỏi thảo luận tự nhiên.
Diễn ra ở bước 3 · Xác thực
Sắc thái được gán cho từng thuộc tính trong một thảo luận, không phải cho cả bài. Một bài có thể tích cực về giao hàng và tiêu cực về giá cùng lúc.
Điều người viết muốn khi đăng: phàn nàn, khen, có ý định mua, so sánh, hỏi đáp, hoặc dấu hiệu rời bỏ. Hai thương hiệu cùng NSR vẫn có thể khác hẳn nhau ở đây.
Thói quen xen tiếng Anh vào câu tiếng Việt — “ship nhanh”, “sale off”, “oke em”. Câu chen ngôn ngữ vẫn được tách từ và gán nhãn như câu thuần Việt.
Cách viết tắt và biến âm phổ biến trên mạng xã hội Việt Nam — “ko”, “dc”, “vs”, “iu”. Được chuẩn hóa về dạng đầy đủ trước khi phân tích.
Câu mang nghĩa ngược với chữ viết. Đây là trường hợp mà cả máy lẫn người đều có thể gán nhãn khác nhau, nên nó được đo riêng thay vì gộp vào sai số chung.
Diễn ra ở bước 4 · Hiểu nội dung
Nối một cách gọi trong câu về đúng đối tượng: thương hiệu, sản phẩm, đối thủ hay một người. “Shop này”, “nó”, tên viết tắt đều được nối về thực thể tương ứng.
Mức chắc chắn của hệ thống với một nhãn đã gán, tính trên thang 0–100. Đi kèm mọi nhãn tự động.
Mức độ tin cậy mà dưới đó một thảo luận được chuyển cho người rà soát thay vì giữ nhãn tự động.
Diễn ra ở bước 5 · Kiểm chứng
Tập dữ liệu tiếng Việt do người gán nhãn thủ công, dùng làm chuẩn để đo độ chính xác của hệ thống. Chất lượng mô hình được đo trên bộ này chứ không được mô tả bằng tính từ.
Diễn ra ở bước 5 · Kiểm chứng
Mức độ hai người gán nhãn độc lập cho cùng một kết quả. Nếu con người còn không thống nhất với nhau thì không thể đòi hỏi máy chính xác hơn mức đó.
Diễn ra ở bước 5 · Kiểm chứng
Mỗi con số trong báo cáo đều truy ngược được về đúng tập thảo luận đã tạo ra nó. Không có bước này thì một con số chỉ có thể tin, không thể kiểm.
Diễn ra ở bước 5 · Kiểm chứng
Chú thích dữ liệu
Mỗi biểu đồ đều đi kèm sáu thông tin này
Một con số không có phạm vi đo thì không kiểm chứng được. Đây là phần chú thích tối thiểu đi kèm mọi biểu đồ trong báo cáo Kompa.
- Thời gian đo lường
- 01/01/2026 – 26/03/2026
- Nền tảng được tính
- Facebook, TikTok, YouTube, diễn đàn, báo điện tử
- Bộ từ khóa
- 12 từ khóa thương hiệu + 34 từ khóa ngành
- Cách truy hồi
- Từ khóa + truy hồi ngữ nghĩa
- Tổng thảo luận
- 14.130
- Tỉ lệ người rà soát
- 8,4% dưới ngưỡng tin cậy, đã rà soát thủ công
Thiếu bất kỳ dòng nào trong sáu dòng trên thì con số không so sánh được với kỳ trước hay với một báo cáo khác.
Phạm vi
Những gì phương pháp này không đo được
Một phương pháp chỉ có ích khi biết rõ giới hạn của nó. Năm điều dưới đây áp dụng cho mọi báo cáo Kompa phát hành.
Chỉ dữ liệu công khai
Tin nhắn riêng tư, nhóm kín và nội dung bị xóa trước thời điểm thu thập không nằm trong dữ liệu. Một cuộc thảo luận không công khai là một cuộc thảo luận không được đếm.
Sắc thái có sai số
Mỉa mai, tiếng lóng vùng miền và câu đa nghĩa là ba trường hợp mà cả máy lẫn người đều có thể gán nhãn khác nhau. Việc rà soát 24/7 giảm sai số này chứ không xóa bỏ nó.
Bộ từ khóa vẫn định hình con số
Truy hồi ngữ nghĩa tìm được thảo luận không chứa từ khóa, nhưng phạm vi đo vẫn bắt đầu từ bộ từ khóa và nhóm ngành được chọn. Vì vậy mỗi báo cáo cần nêu rõ khoảng thời gian, nền tảng và cách truy hồi — hai báo cáo cùng ngành nhưng khác phạm vi không so sánh trực tiếp được với nhau.
Nhãn tự động có độ tin cậy, không có sự chắc chắn
Mỗi nhãn do máy gán đều kèm một độ tin cậy, và phần dưới ngưỡng được người rà soát. Điều đó thu hẹp sai số chứ không loại bỏ nó: phần trên ngưỡng vẫn là ước lượng của mô hình, và tỉ lệ đúng của từng nhóm nhãn được đo chứ không được giả định.
Độ phủ thay đổi theo nền tảng
Khi một nền tảng đổi API hoặc chính sách hiển thị, độ phủ của kỳ sau có thể khác kỳ trước. Những thay đổi đáng kể được ghi chú trong báo cáo liên quan.
Áp dụng phương pháp này cho ngành của bạn
Đội ngũ phân tích của Kompa sẽ trao đổi về bộ từ khóa, khoảng thời gian đo và các nền tảng phù hợp với câu hỏi bạn đang cần trả lời.
Giá trị của thương hiệu trên các kênh mạng xã hội.