Page 2 sur 2

Re: Aspirateur de site

Posté : sam. 16 juin 2018 21:12
par Malynou

Dernier message de la page précédente :

Non non.
Je voudrais récupérer le site avec ses docs etc que je pourrais consulter en local.
Mais là, ça semble pas prendre les "données". Juste le "contenant".
:cry:

Re: Aspirateur de site

Posté : sam. 16 juin 2018 23:36
par mpedro
Malynou ta demande n'est pas assez précise. Si les docs correspondent à des renvois de liens externes au site ça n'est pas possible. Tu ne peux aspirer que les pages du site qui y sont hébergées liens ou pas liens. Comme en parle Arghlub.

Re: Aspirateur de site

Posté : ven. 22 juin 2018 10:01
par Malynou
Coucou les garçons !
Désolée, surbookage, ici avec l'assoc dont je fais partie.
Donc... C'est compliqué de donner de plus amples détails...
Ptêt un screenshot de ce que j'ai en ligne et de ce que je récupère en local vous aidera à m'aider (trop fort :lol: )
Voici donc, par exemple, ce que j'obtiens connectée :
Image
puis
Image
puis, en cliquant sur le premier cours "Subdivision des temps géologiques" :
Image

Et voici ce que j'ai réceptionné en local en premier cours "Subdivision des temps géologiques" : Image
C'est vide...

J'ai utilisé la commande

Code : Tout sélectionner

wget -r -p -l5 -k -E "http://adresse-du-site"
pour "aspirer".

Voilà voilà...

En espérant avoir été plus précise...

Belle journée à vous !
:B

Re: Aspirateur de site

Posté : ven. 22 juin 2018 13:39
par mpedro
Aspirer un logiciel site, plusieurs ont des scripts ou différentes méthodes pour éviter les aspirateurs mais c'est pas systématique. Essaie avec pas wget mais autre chose. Httrack il a été cité

Re: Aspirateur de site

Posté : ven. 22 juin 2018 22:01
par Christian_B
Malynou a écrit :Je voudrais récupérer le site avec ses docs etc que je pourrais consulter en local.
Mais là, ça semble pas prendre les "données". Juste le "contenant".
Je ne suis pas sûr de comprendre ce que tu appelles "les docs" d'un site ainsi que "les données" et "le contenant".
HTTrack a des possibilités de config multiples et subtiles (je n'ai pas tout compris et quelquefois j'y vais au radar). Mais les sites ont des structures et des réactions très diverses et il n'y a pas de recette miracle. Souvent par exemple les images et même certains fichiers html sont sur un domaine différent de la page d'origine. On se trouve souvent entre le risque de télécharger beaucoup trop (y compris les fichiers de divers sites auxquels renvoie le site d'origine pour des raisons de pub ou autres) et celui de ne pas avoir les fichiers que l'on veut. En pratique il faut d'abord regarder comment est fait un site, par exemple en examinant l''adresse à chaque étape dans un navigateur (y compris en faisant par exemple "Afficher l'image" si on cherche des images). Et souvent aller voir le code source d'une sélection de ce qu'on veut prendre.
Il peut être opportun de mettre plusieurs adresses de départ, par exemple une par page si un site a des pages chaînées par des boutons de type "suivant" sinon on devrait mettre une profondeur beaucoup trop grande pour passer d'une page à l'autre par HTTrack, avec un résultat souvent catastrophique. Ou encore de mettre dans la partie filtre des informations sur les domaines utilisés, etc.
La doc incorporée à HTTrack donne pas mal d'indications mais c'est rarement simple.
S'il s'agit d'un petit site "artisanal" où tout est sur un seul domaine et organisé dans une arborescence directe, ça peut marcher facilement avec un ou deux ajustements. Mais souvent il y a des complications : redirections, scripts, fichiers robots.txt (directives notamment pour les moteurs de recherche) et dans certains car des protections justement contre le chargement automatisé ...
Donc difficile de t'en dire plus sans savoir à quel genre de site tu penses.
Nota : en réalité il y a 3 versions différentes sous Linux :
- HTTrack (en mode commande, pas essayé, vu la complexité des option ce doit être infernal)
- HTTraQt : il réorganise localement les fichiers à sa manière tout en maintenant une hiérarchie et des fichiers html parfois très modifiés par rapport à ceux du site. Le plus pratique si le but est de charger des lots de fichiers. Celui que j'utilise d'habitude.
- WebHTTrack : Si j'ai bien compris il vise à créer un site local assez ressemblant au site (ou à la partie de site) parcouru. Pour autant pas identique puisque pas de php, etc comme indiqué dans les réponses précédentes. Je connais mal.