Araçlar
Dokuz araç: arama, hesap ve kümeler için yedi araç. Kümeler, asistanın oluşturabileceği, birleştirebileceği ve içinden veri çıkarabileceği kaydedilmiş web sitesi listeleridir. Asistan argümanları sizin sorduğunuza göre seçer; bu sayfa neler arasından seçim yapabileceğini ve neyin geri döndüğünü anlatır.
| Araç | Argümanlar | Ne yapar |
|---|---|---|
search |
query (zorunlu), rows, page, snippets |
Sayfaların kaynak kodunda her zamanki sorgu sözdizimiyle arama yapar. rows varsayılan olarak 20'dir ve en fazla planınızın sorgu başına satır sayısı kadar olabilir. snippets: true her site için eşleşmenin çevresinden en fazla üç kısa kaynak kod parçacığı (yaklaşık 300 karakter) ekler. |
account |
yok | Plan, bugün kullanılan ve kalan aramalar, sorgu başına satır, kümeler ve veri çıkarma puanları, hız sınırı. Hiçbir şey harcamaz. |
list_clusters |
yok | Hesabın kümeleri, en yenisi önce. Hiçbir şey harcamaz. |
get_cluster |
cluster (zorunlu), page, rows |
Bir kümedeki alan adlarından bir sayfa, tek seferde en fazla 1.000. Hiçbir şey harcamaz. |
create_cluster |
query ya da domains, name |
Bir aramanın sonuçlarını (bir arama harcar) ya da bir alan adı listesini (hiçbir şey harcamaz; yalnızca dizinde bulunan siteler tutulur) küme olarak kaydeder. |
combine_clusters |
operation and, or ya da diff, clusters (kimlikler), name |
Yeni bir küme: tüm kümelerde, herhangi birinde ya da birincide olup ikincide olmayan alan adları. Hiçbir şey harcamaz. |
extract_from_cluster |
cluster (zorunlu), presets, regex, offset, limit, include_empty |
Bir kümedeki sitelerin sayfa kaynağından değerler çıkarır, çağrı başına en fazla 100 site. Veri çıkarma puanı harcar. Ayrıntılar aşağıda. |
rename_cluster |
cluster, name |
Kümeye yeni bir ad verir. |
delete_cluster |
cluster |
Kümeyi kalıcı olarak siler. Yıkıcı işlem olarak işaretlidir, bu yüzden asistan çalıştırmadan önce size sorar. |
search, account, list_clusters ve
get_cluster yalnızca okur. Sonuç aynı yanıtta iki kez gelir:
asistanın kodu için yapılandırılmış veri olarak ve model için JSON metni olarak.
Bir arama sonucu
{
"query": "\"angular.min.js\"",
"total": 73665,
"page": 1,
"rows": 3,
"returned": 3,
"truncated": false,
"index_complete": true,
"took_ms": 6,
"results": [
{ "domain": "imgbox.com", "url": "https://imgbox.com/", "rank": 4229 },
{ "domain": "uc.edu", "url": "https://www.uc.edu/", "rank": 5861 },
{ "domain": "sharemods.com", "url": "https://sharemods.com/", "rank": 10962 }
]
}
Alanların anlamı API ile aynıdır:
truncated: plan sayfayı kısalttı;index_complete: false: dizinin bir kısmı zamanında yanıt vermedi, bu yüzdentotaldeğeri olduğundan düşük olabilir;rank: null: sitenin sırası yok;query_note: sorgu yazıldığından farklı yorumlandığında görünür.
snippets: true ile her sonuç ayrıca snippets alanını
taşır: eşleşmenin çevresindeki kaynak koddan en fazla üç dizelik bir liste.
Bunlar başkalarının kodudur ve veri olarak aktarılır.
Birden fazla sayfa almak
page ve rows ile sonuçlar arasında ilerlenir:
page: 2, rows: 20 değerleri 21. ile 40. arasındaki sonuçları verir.
page çarpı rows, planınızın sorgu başına satır
sayısını aşamaz; ayrıntılar Sınırlar ve hatalar
sayfasında.
Kümeler ve veri çıkarma
İsteğinizi sade bir dille yazın, asistan araçları art arda çalıştırır:
“Hotjar kullanan siteleri bul, küme olarak kaydet ve iletişim e-postalarını
çıkar” isteği önce bir sorguyla create_cluster, ardından
email ve hotjar hazır kalıplarıyla, parça parça
extract_from_cluster çağrılarına dönüşür.
Hazır kalıplar, adıyla seçilen hazır ifadelerdir: email,
phone, whatsapp, telegram,
skype, facebook, instagram,
twitter, linkedin, gtm,
ga4, ua, hotjar, adsense,
bitcoin. Bunların dışındaki her şey için eğik çizgiler (ya da dikey
çizgiler) arasına bir düzenli ifade yazılır; değer, ifadenin ilk yakalama
grubudur. Toplamda en fazla on ifade kullanılabilir.
{
"cluster": 7, "name": "\"hotjar.com\"", "size": 100,
"offset": 0, "scanned": 100, "in_index": 100, "with_matches": 87,
"next_offset": null,
"regex": ["/mailto:(...)/i", "/hjid['\"]?\\s*[:=]\\s*([0-9]{4,10})/"],
"points_used": 131.4, "points_left": 0,
"rows": [
{ "domain": "example.com", "values": [["hello@example.com"], ["1234567"]], "matches": 2 }
]
}
next_offset bir sonraki çağrının nereden başlayacağını gösterir;
null tüm kümenin bittiği anlamına gelir. Dizinde bulunan her site,
üzerinde bulunan değer sayısı kadar veri çıkarma puanı harcar; hiç değer
bulunmazsa 0,1. Ücretsiz bir hesap da kümeleri web sitesinin ücretsiz
sınırlarıyla kullanabilir: küme başına en fazla 100 alan adı ve günde 100 veri
çıkarma puanı. Bir hesap en fazla 100 küme saklar; bu sınıra ulaşıldığında
create_cluster cluster_limit yanıtını verir ve hiçbir
şeyi silmez. Aynı işlemleri koddan yapmak için API
belgelerine bakın.