Extraction
L’extraction lit les pages de chaque site d’un cluster et en retire les parties qui correspondent à une expression. Un cluster de sites devient un tableau de numéros de téléphone, de comptes de réseaux sociaux, d’adresses, de noms d’extensions - tout ce que le motif capture.
Ce qui est lu
Tout ce que PublicWWW a indexé pour ces sites, pages internes comprises - et pas seulement la page d’accueil sur laquelle une recherche a trouvé une correspondance. Une coordonnée qui n’apparaît que sur une page « à propos » est quand même trouvée.
Modèles prédéfinis et motifs personnalisés
Des modèles prédéfinis existent pour ce que l’on demande le plus souvent - adresses
e-mail, numéros de téléphone -, et n’importe quelle expression régulière peut être
utilisée à la place. L’expression fonctionne de la même manière que
snipexp: dans une recherche : le
groupe capturant est ce qui se retrouve dans la colonne, et une expression qui
n’en contient pas produit des résultats vides.
|/wp-content/plugins/([\w\d\-\.\_]+)/|
Testez d’abord sur un petit cluster. L’expression peut être essayée, ajustée et essayée de nouveau en plafonnant le nombre d’enregistrements à extraire : un motif erroné ne coûte ainsi presque rien - voir les limites pour comprendre pourquoi c’est important.
Récupérer le résultat
Le tableau extrait se télécharge sous forme de fichier et s’ouvre dans un tableur. Chaque ligne correspond à un site et à ce qui y a été trouvé ; un site sans aucune correspondance reste listé, si bien que les lacunes sont visibles au lieu d’être écartées en silence.
Filtrer des recherches avec un cluster
Un cluster fonctionne aussi comme filtre dans l’autre sens. Importez votre propre liste de domaines, d’URL ou d’adresses e-mail, et utilisez-la pour réduire les résultats de recherche aux sites de cette liste - ou, par soustraction, à tous les autres.
Extraire des numéros de téléphone et des adresses e-mail présente toute la démarche, de deux recherches jusqu’à une feuille de calcul.
Suivant Limites