Native Ad Data API: Truy Cập Lập Trình Vào Các Creative Native Trực Tuyến
Hầu hết thông tin tình báo quảng cáo native bị khóa sau một bảng điều khiển, vì vậy đây là cách các nhà phân tích và đội ngũ dữ liệu kéo các creative trực tuyến, nhà quảng cáo thực sự, các bước nhảy chuỗi cung ứng và landing page dưới dạng các bản ghi có cấu trúc qua API.

Nếu bạn đã từng cố gắng phân tích thực sự về quảng cáo native, bạn biết bức tường đó. Thông tin tình báo tồn tại, nhưng nó bị mắc kẹt sau một bảng điều khiển. Bạn có thể duyệt từng creative một, xem qua một số ít nhà quảng cáo, có thể xuất một file CSV đã cũ ngay khi nó tải xong. Điều bạn không thể làm là xử lý dữ liệu quảng cáo native theo cách bạn xử lý mọi bộ dữ liệu khác trong ngăn xếp của mình: truy vấn nó, kết hợp nó, lên lịch cho nó, đưa nó vào một mô hình.
Hướng dẫn này dành cho những người muốn dữ liệu, không phải bảng điều khiển. Các nhà phân tích xây dựng trình theo dõi cạnh tranh. Các đội ngũ dữ liệu làm giàu CRM. Các nhà định lượng kiểm tra ngược các góc độ creative. Và, ngày càng nhiều, các tác nhân AI thực hiện công việc đó mà không có con người trong vòng lặp. Câu hỏi rất rõ ràng. Làm thế nào để bạn lấy được các creative native trực tuyến, chuỗi cung ứng đằng sau chúng và các landing page mà chúng trỏ đến dưới dạng các bản ghi sạch, có cấu trúc qua một API?
Về quy mô, đây là hình ảnh của một chỉ mục trung lập ngay bây giờ: 589,036 creative, 5.4 triệu quan sát quảng cáo, 25,933 nhà quảng cáo riêng biệt và 926,259 landing page được chụp trên 42 mạng lưới (OpenAdLibrary, tháng 6 năm 2026). Đó là kích thước của đống cỏ khô. Công việc của một API là đưa cho bạn chính xác những cây kim bạn yêu cầu.
Một Native Ad Data API thực sự trả về gì#
Một Native Ad Data API là một điểm cuối trả về thông tin tình báo quảng cáo native dưới dạng các bản ghi máy có thể đọc được thay vì một trang web. Mỗi bản ghi bao gồm creative (hình ảnh và tiêu đề), nhà xuất bản và mạng lưới phục vụ nó, các bước nhảy chuỗi cung ứng đằng sau vị trí đặt quảng cáo, landing page mà cú nhấp chuột giải quyết đến và các tín hiệu thời gian như ngày đầu tiên và cuối cùng nhìn thấy. Bạn lọc, kết hợp và tổng hợp nó như một bảng cơ sở dữ liệu.
Định nghĩa gọn gàng đó ẩn chứa rất nhiều kỹ thuật. Không giống như một quảng cáo tìm kiếm hoặc một quảng cáo Meta nằm trong thư viện chính thức, một vị trí đặt quảng cáo native được hiển thị bởi một native ad widget, dải "Được đề xuất cho bạn" hoặc "Xung quanh web" ở cuối bài viết. Những widget đó là động, nhắm mục tiêu theo địa lý và được cá nhân hóa. Đó chính xác là lý do tại sao một lần thu thập thông tin tĩnh duy nhất sẽ bỏ lỡ hầu hết khoảng không quảng cáo. Một bộ dữ liệu thực sự phải thu thập trên nhiều khu vực địa lý và theo thời gian, sau đó loại bỏ trùng lặp để có được một creative ổn định.

Tài chính là phân khúc native lớn nhất trong chỉ mục, với 17,232 creative, chỉ đứng trước bảo hiểm (15,629) và sức khỏe (14,895). Quảng cáo trên là một ví dụ điển hình của thể loại này: một thời hạn, một cơ quan quyền lực mơ hồ và một con số đô la. Nó đã chạy được 13 ngày khi chúng tôi nhìn thấy nó lần cuối, điều này cho bạn biết nhiều hơn về khả năng sinh lời của nó so với bất kỳ nhóm tập trung nào có thể.
Bốn lớp dữ liệu, và tại sao hầu hết các công cụ chỉ cung cấp cho bạn một lớp#
Hãy nghĩ về dữ liệu quảng cáo native như bốn lớp xếp chồng lên nhau. Hầu hết các công cụ cũ chỉ hiển thị lớp trên cùng và dừng lại. Giá trị tăng lên khi bạn đi xuống.
| Lớp | Nó chụp cái gì | Tại sao nó quan trọng |
|---|---|---|
| Creative | Hình ảnh độ phân giải đầy đủ, tiêu đề, lời kêu gọi hành động | Quảng cáo thực tế, không phải hình thu nhỏ. Cung cấp cho Copy DNA và phân cụm trực quan. |
| Mạng lưới và nhà xuất bản | Mạng lưới native nào phục vụ nó, trên trang web nào | Cho phép bạn trả lời "ai đang mua quảng cáo trên trang web này?" và phân khúc theo nguồn |
| Chuỗi cung ứng | Các bước nhảy ad-tech giữa nhà xuất bản và nhà quảng cáo | Tiết lộ khoảng không quảng cáo được bán lại, các trung gian và định tuyến |
| Landing page | Pre-lander và điểm đến cuối cùng của cú nhấp chuột | Làm lộ ra nhà quảng cáo thực sự và ưu đãi đang được bán |
Bước nhảy từ lớp hai đến lớp bốn là toàn bộ cuộc chơi. Một vị trí đặt quảng cáo được phục vụ bởi một mạng lưới (Taboola, Outbrain, MGID, Revcontent, Teads, Yahoo, MSN) nhưng mạng lưới đó không phải là nhà quảng cáo. Nhà quảng cáo là bất kỳ ai ngồi ở cuối cú nhấp chuột. Chỉ riêng Taboola chiếm 157,727 creative trong chỉ mục, Outbrain thêm 84,252, MGID 49,689. Không con số nào trong số đó cho bạn biết ai thực sự đang mua. Việc theo dõi chuỗi chuyển hướng, từ phía máy chủ và không kích hoạt cú nhấp chuột thực tế trên một chiến dịch trực tuyến, là thứ biến một đống creative widget ẩn danh thành thông tin tình báo cạnh tranh mà bạn có thể hành động.
Để hiểu cơ chế định tuyến ở giữa, hãy xem chuỗi cung ứng quảng cáo native được giải thích với các dấu vết thực tế. Để kéo người mua thực sự ra từ phía sau mạng lưới phục vụ, hãy đọc cách xác định mạng lưới quảng cáo đằng sau bất kỳ quảng cáo nào.
Thời lượng là cột mà mọi người đánh giá thấp#
Trường giá trị nhất trong một bộ dữ liệu quảng cáo native không phải là creative. Đó là dấu thời gian.
Bạn không thể thấy chi tiêu của bất kỳ ai trong quảng cáo native. Bạn không cần phải thấy. Một creative tồn tại trên hàng chục trang web trong nhiều tuần đang được gia hạn vì nó chuyển đổi. Chi tiêu để lại dấu vân tay, và dấu vân tay đó là thời lượng. Trong chỉ mục hiện tại của chúng tôi, các creative được quan sát liên tục lâu nhất đã chạy khoảng 28 ngày liên tục, trần của cửa sổ quan sát của chúng tôi cho đến nay. Những tiêu đề đạt đến trần đó rất đáng nói.

"Làm Thế Nào Tôi Có Thể Tránh Nộp Thuế Khi Rút Tiền IRA?" của SmartAsset nằm ở đầu danh sách 28 ngày. Một loạt quảng cáo quiz "Chỉ Số IQ Của Bạn Là Bao Nhiêu?" từ My IQ trên Microsoft Audience Network cũng vậy, và một quảng cáo máy trợ thính từ Hidden Hearing đã chạy hai creative khác nhau đến cùng một trần. Khi cùng một nhà quảng cáo ghim nhiều biến thể ở thời lượng tối đa, đó không phải là may mắn. Đó là một ưu đãi sinh lời đang được cung cấp.
Một lưu ý đáng nói rõ ràng. "Người chiến thắng 90 ngày" mà bạn nghe thấy được trích dẫn trong giới mua phương tiện truyền thông là truyền thuyết ngành, không phải phép đo của chúng tôi. Những gì chúng tôi thực sự có thể xác minh ngày hôm nay là các lượt chạy liên tục lên đến khoảng 28 ngày cho mỗi creative. Hãy coi con số 90 ngày như truyền thuyết cho đến khi bộ dữ liệu của chính bạn đánh dấu thời gian nó.
API so với bảng điều khiển: khớp công cụ với công việc#
Không có gì sai với một bảng điều khiển cho nghiên cứu ad-hoc. Hai giao diện được xây dựng cho các công việc khác nhau, và việc trộn lẫn chúng là lý do tại sao các nhóm trả quá nhiều cho các công cụ mà họ hầu như không sử dụng.
- Sử dụng bảng điều khiển khi một con người đang làm công việc thăm dò: xem qua góc độ của đối thủ cạnh tranh, kéo một vài creative cho một bài thuyết trình, quét xem cái gì đang hot tuần này. Đây là quy trình làm việc công cụ ad spy cổ điển.
- Sử dụng API khi người tiêu dùng là một hệ thống: một công việc được lên lịch, một mô hình dbt, một kho lưu trữ tính năng, một cảnh báo Slack hoặc một tác nhân AI. Bạn muốn các bản ghi, không phải pixel, và bạn muốn chúng trên một cron.
Dấu hiệu thực tế là sự lặp lại. Nếu bạn thấy mình thủ công xuất cùng một chế độ xem mỗi thứ Hai, bạn không có vấn đề nghiên cứu. Bạn có một vấn đề tích hợp, và một API giải quyết nó. Đây cũng là nơi mà kỷ luật rộng hơn của thông tin tình báo quảng cáo đang hướng tới: ít duyệt thủ công hơn, nhiều nguồn cấp dữ liệu lập trình được kết nối trực tiếp vào các quy trình làm việc cạnh tranh và sáng tạo.
Một pipeline cụ thể#
Đây là cách một đội ngũ dữ liệu thực sự kết nối dữ liệu quảng cáo native vào một thứ gì đó hữu ích. Mô hình này giữ nguyên cho dù bạn đang theo dõi cả một phân khúc hay một đối thủ cạnh tranh.
- Xác định danh sách theo dõi. Một tập hợp các nhà quảng cáo, tên miền landing-page hoặc trang web nhà xuất bản mà bạn quan tâm. API lọc trên những thứ này để bạn không phải trả tiền để thu nạp toàn bộ internet.
- Kéo theo lịch trình. Một công việc hàng đêm truy cập điểm cuối với
last_seen >= yesterday, chỉ trả về các creative mới và vẫn còn trực tuyến. Mỗi bản ghi mang một ID ổn định, vì vậy bạn có thể upsert mà không bị trùng lặp. - Kết hợp với dữ liệu riêng của bạn. Khớp tên miền landing-page với CRM của bạn hoặc một bảng đối thủ cạnh tranh. Bây giờ mọi creative native đều được quy cho một công ty mà bạn đã theo dõi.
- Tính toán thời gian tồn tại và độ lan tỏa. Nhóm theo ID creative. Đo lường số ngày chạy (
last_seentrừfirst_seen) và số lượng nhà xuất bản riêng biệt. Các creative chạy lâu, lan tỏa rộng là những người chiến thắng của bạn, những cái đáng để mô hình hóa. - Hành động. Đẩy một bản tóm tắt hàng ngày về những người chiến thắng mới vào Slack, cung cấp các creative vào một mô hình phân cụm hoặc giao kế hoạch có cấu trúc cho một tác nhân.

Bước bốn là nơi quảng cáo native thực sự khác biệt với các kênh khác. Một creative như quảng cáo thiết bị hỗ trợ thính giác Nebroo ở trên, được quan sát trong 26 ngày, chính xác là tín hiệu mà pipeline của bạn nên tự động đánh dấu. Thời lượng chỉ có thể đọc được nếu bộ dữ liệu của bạn đánh dấu thời gian cho mọi quan sát, đó là toàn bộ lý do 5.4 triệu quan sát nằm đằng sau 589,036 creative đó. Các quan sát là chuỗi thời gian. Creative chỉ là khóa.
Điều gì phân biệt một bộ dữ liệu có thể sử dụng với một bộ dữ liệu nhiễu#
Khối lượng là số liệu tiêu đề sai. Mười triệu bản ghi cũ, loại bỏ trùng lặp kém, chỉ có mạng lưới còn tệ hơn một tập hợp nhỏ hơn nhưng mới, được quy cho và sạch. Khi bạn đánh giá một bộ dữ liệu quảng cáo native hoặc API của nó, hãy kiểm tra áp lực nó trên năm điều:
- Độ mới. Các vị trí đặt quảng cáo có được chụp trực tuyến, với ngày đầu tiên và cuối cùng nhìn thấy không? Hay đó là một bản dump định kỳ đã cũ hàng tuần?
- Độ trung thực của creative. Hình ảnh thực tế có được lưu trữ ở chất lượng đầy đủ không, hay chỉ là một hình thu nhỏ được thu nhỏ vô dụng cho phân tích trực quan?
- Độ sâu quy kết. Nó dừng lại ở mạng lưới, hay truy tìm cú nhấp chuột đến landing page cuối cùng và nhà quảng cáo thực sự?
- Phương pháp thu thập. Nó có đọc các quảng cáo công khai mà không kích hoạt cú nhấp chuột thực tế trên các chiến dịch trực tuyến không? Các cú nhấp chuột tổng hợp tiêu tiền của các nhà quảng cáo khác và làm hỏng dữ liệu của họ, và của bạn.
- Bề rộng phủ sóng. Nó có trải rộng trên các mạng lưới native chính và thu thập trên nhiều khu vực địa lý không, hay chỉ là một nhà xuất bản ở một quốc gia?

Hãy chú ý đến chi tiết trong quảng cáo pin mặt trời đó. Ở độ phân giải đầy đủ, bạn có thể đọc ưu đãi, cách đóng khung và xử lý trực quan, đó là thứ cung cấp cho phân cụm trực quan và phân tích bản sao. Một hình thu nhỏ vứt bỏ tất cả những thứ đó. Năm bài kiểm tra này cũng là thứ phân biệt minh bạch quảng cáo thực sự với một thư viện ảnh chụp màn hình có một hộp tìm kiếm được gắn vào. Quảng cáo native về mặt lịch sử đã tụt hậu so với tìm kiếm và mạng xã hội ở đây chính xác vì không có thư viện trung lập nào tồn tại, đó là câu chuyện đằng sau lý do tại sao một thư viện quảng cáo native không tồn tại cho đến bây giờ.
Tại sao quảng cáo native khó hơn, và bổ ích hơn, vẻ ngoài của nó#
Tìm kiếm và mạng xã hội có các bề mặt minh bạch chính thức, được quy định. Quảng cáo native thì không. Không có thư viện bắt buộc của chính phủ cho quảng cáo native lập trình giống như cách có cho quảng cáo chính trị trên các nền tảng lớn. Khoảng cách đó chính xác là lý do tại sao một bộ dữ liệu được xây dựng có mục đích có giá trị vượt trội. Dữ liệu là công khai. Chỉ là không phải việc của ai để tổ chức nó.
Phần thưởng cho việc giải quyết vấn đề thu thập là một nguồn cấp dữ liệu sự thật cạnh tranh mà các nhà quảng cáo không thể che giấu, bởi vì các quảng cáo đang chạy công khai cho bất kỳ ai xem. Kết hợp điều đó với truy cập lập trình và bạn có được thứ mà các công cụ spy cũ không bao giờ cung cấp: dữ liệu quảng cáo native như cơ sở hạ tầng, không phải như một trang web đích mà bạn đăng nhập. Để hiểu bối cảnh rộng hơn về cách các thư viện quảng cáo, luật pháp và công cụ phù hợp với nhau, hãy bắt đầu với trụ cột về minh bạch quảng cáo là gì và cách sử dụng nó, và thư viện quảng cáo mở được giải thích bao quát cảnh quan công cụ.
OpenAdLibrary phù hợp như thế nào#
OpenAdLibrary được xây dựng dữ liệu đầu tiên. Nó chụp các quảng cáo native công khai trực tuyến trên Taboola, Outbrain, MGID, Revcontent, Teads, Yahoo và MSN, lưu trữ creative thực ở chất lượng đầy đủ, phân loại chuỗi cung ứng và theo dõi mỗi cú nhấp chuột đến landing page mà không nhấp vào các quảng cáo trực tuyến. Cùng các bản ghi cung cấp năng lượng cho bảng điều khiển có sẵn thông qua API và một máy chủ MCP, vì vậy một nhà phân tích, một pipeline hoặc một tác nhân AI có thể kéo các creative, nhà quảng cáo thực sự, dữ liệu chuỗi cung ứng và landing page dưới dạng các bản ghi có cấu trúc, sau đó định tuyến chúng vào Copy DNA, Creative Studio hoặc Optimize.
Giá cả công khai và cố tình rẻ: $29.99/tháng, với một cấp miễn phí để duyệt 200 quảng cáo và không yêu cầu thẻ, so với các đối thủ cạnh tranh chạy từ khoảng $80 đến $400 một tháng. Đối với các đội ngũ dữ liệu, điều đó có nghĩa là bạn có thể xác thực bộ dữ liệu so với danh sách theo dõi của riêng mình trước khi viết một dòng mã tích hợp nào.
Bắt đầu miễn phí và truy vấn trực tiếp bộ dữ liệu quảng cáo native. Không cần bảng điều khiển.







