Araçlar

Dokuz araç: arama, hesap ve kümeler için yedi araç. Kümeler, asistanın oluşturabileceği, birleştirebileceği ve içinden veri çıkarabileceği kaydedilmiş web sitesi listeleridir. Asistan argümanları sizin sorduğunuza göre seçer; bu sayfa neler arasından seçim yapabileceğini ve neyin geri döndüğünü anlatır.

AraçArgümanlarNe yapar
search query (zorunlu), rows, page, snippets Sayfaların kaynak kodunda her zamanki sorgu sözdizimiyle arama yapar. rows varsayılan olarak 20'dir ve en fazla planınızın sorgu başına satır sayısı kadar olabilir. snippets: true her site için eşleşmenin çevresinden en fazla üç kısa kaynak kod parçacığı (yaklaşık 300 karakter) ekler.
account yok Plan, bugün kullanılan ve kalan aramalar, sorgu başına satır, kümeler ve veri çıkarma puanları, hız sınırı. Hiçbir şey harcamaz.
list_clusters yok Hesabın kümeleri, en yenisi önce. Hiçbir şey harcamaz.
get_cluster cluster (zorunlu), page, rows Bir kümedeki alan adlarından bir sayfa, tek seferde en fazla 1.000. Hiçbir şey harcamaz.
create_cluster query ya da domains, name Bir aramanın sonuçlarını (bir arama harcar) ya da bir alan adı listesini (hiçbir şey harcamaz; yalnızca dizinde bulunan siteler tutulur) küme olarak kaydeder.
combine_clusters operation and, or ya da diff, clusters (kimlikler), name Yeni bir küme: tüm kümelerde, herhangi birinde ya da birincide olup ikincide olmayan alan adları. Hiçbir şey harcamaz.
extract_from_cluster cluster (zorunlu), presets, regex, offset, limit, include_empty Bir kümedeki sitelerin sayfa kaynağından değerler çıkarır, çağrı başına en fazla 100 site. Veri çıkarma puanı harcar. Ayrıntılar aşağıda.
rename_cluster cluster, name Kümeye yeni bir ad verir.
delete_cluster cluster Kümeyi kalıcı olarak siler. Yıkıcı işlem olarak işaretlidir, bu yüzden asistan çalıştırmadan önce size sorar.

search, account, list_clusters ve get_cluster yalnızca okur. Sonuç aynı yanıtta iki kez gelir: asistanın kodu için yapılandırılmış veri olarak ve model için JSON metni olarak.

Bir arama sonucu

{
  "query": "\"angular.min.js\"",
  "total": 73665,
  "page": 1,
  "rows": 3,
  "returned": 3,
  "truncated": false,
  "index_complete": true,
  "took_ms": 6,
  "results": [
    { "domain": "imgbox.com", "url": "https://imgbox.com/", "rank": 4229 },
    { "domain": "uc.edu", "url": "https://www.uc.edu/", "rank": 5861 },
    { "domain": "sharemods.com", "url": "https://sharemods.com/", "rank": 10962 }
  ]
}

Alanların anlamı API ile aynıdır:

snippets: true ile her sonuç ayrıca snippets alanını taşır: eşleşmenin çevresindeki kaynak koddan en fazla üç dizelik bir liste. Bunlar başkalarının kodudur ve veri olarak aktarılır.

Birden fazla sayfa almak

page ve rows ile sonuçlar arasında ilerlenir: page: 2, rows: 20 değerleri 21. ile 40. arasındaki sonuçları verir. page çarpı rows, planınızın sorgu başına satır sayısını aşamaz; ayrıntılar Sınırlar ve hatalar sayfasında.

Kümeler ve veri çıkarma

İsteğinizi sade bir dille yazın, asistan araçları art arda çalıştırır: “Hotjar kullanan siteleri bul, küme olarak kaydet ve iletişim e-postalarını çıkar” isteği önce bir sorguyla create_cluster, ardından email ve hotjar hazır kalıplarıyla, parça parça extract_from_cluster çağrılarına dönüşür.

Hazır kalıplar, adıyla seçilen hazır ifadelerdir: email, phone, whatsapp, telegram, skype, facebook, instagram, twitter, linkedin, gtm, ga4, ua, hotjar, adsense, bitcoin. Bunların dışındaki her şey için eğik çizgiler (ya da dikey çizgiler) arasına bir düzenli ifade yazılır; değer, ifadenin ilk yakalama grubudur. Toplamda en fazla on ifade kullanılabilir.

{
  "cluster": 7, "name": "\"hotjar.com\"", "size": 100,
  "offset": 0, "scanned": 100, "in_index": 100, "with_matches": 87,
  "next_offset": null,
  "regex": ["/mailto:(...)/i", "/hjid['\"]?\\s*[:=]\\s*([0-9]{4,10})/"],
  "points_used": 131.4, "points_left": 0,
  "rows": [
    { "domain": "example.com", "values": [["hello@example.com"], ["1234567"]], "matches": 2 }
  ]
}

next_offset bir sonraki çağrının nereden başlayacağını gösterir; null tüm kümenin bittiği anlamına gelir. Dizinde bulunan her site, üzerinde bulunan değer sayısı kadar veri çıkarma puanı harcar; hiç değer bulunmazsa 0,1. Ücretsiz bir hesap da kümeleri web sitesinin ücretsiz sınırlarıyla kullanabilir: küme başına en fazla 100 alan adı ve günde 100 veri çıkarma puanı. Bir hesap en fazla 100 küme saklar; bu sınıra ulaşıldığında create_cluster cluster_limit yanıtını verir ve hiçbir şeyi silmez. Aynı işlemleri koddan yapmak için API belgelerine bakın.

Sonraki Sınırlar ve hatalar