CONNEXION
  • RetourJeux
    • Sorties
    • Hit Parade
    • Les + populaires
    • Les + attendus
    • Soluces
    • Tous les Jeux
    • Gaming
  • RetourActu Gaming
    • News
    • Astuces
    • Tests
    • Previews
    • Toute l'actu gaming
  • RetourBons plans
    • Bons plans
    • Bons plans Smartphone
    • Bons plans Hardware
    • Bons plans Image et Son
    • Bons plans Amazon
    • Bons plans Cdiscount
    • Bons plans Decathlon
    • Bons plans Fnac
    • Tous les Bons plans
  • RetourJVTech
    • Actus High-Tech
    • Intelligence Artificielle
    • Smartphones
    • Mobilité urbaine
    • Hardware
    • Image et son
    • Tutoriels
    • Tests produits High-Tech
    • Guides d'achat High-Tech
    • JVTech
  • RetourCulture
    • Actus Culture
    • Culture
  • RetourVidéos
    • A la une
    • Gaming Live
    • Vidéos Tests
    • Vidéos Previews
    • Gameplay
    • Trailers
    • Chroniques
    • Replay Web TV
    • Toutes les vidéos
  • RetourForums
    • Hardware PC
    • PS5
    • Switch 2
    • Xbox Series
    • Switch
    • Pokemon pocket
    • FC 25 Ultimate Team
    • League of Legends
    • Tous les Forums
  • PC
  • PS5
  • Xbox Series
  • Switch 2
  • PS4
  • One
  • Switch
  • iOS
  • Android
  • MMO
  • RPG
  • FPS
En ce moment Genshin Impact Valhalla Breath of the wild Animal Crossing GTA 5 Red dead 2
Liste des sujets

Statistiques de post/topic ?

Diamondss
Diamondss
Niveau 10
06 février 2017 à 20:13:05

Le 06 février 2017 à 19:45:21 godrik a écrit :
c'est une mauvaise idee de parser de l'html avec des regexp (cf pumping lemma pour les details), ce que tu veux, c'est un parseur de somethingML.

Tu pourrais développer ? Puisque j'ai rien trouvé à propos de somethingML :(

Diamondss
Diamondss
Niveau 10
07 février 2017 à 14:49:38

Personne ?

TheRealMarco
TheRealMarco
Niveau 14
07 février 2017 à 14:51:13

somethingML je pense que ça fait référence à tous les Meta Language (XML, HTML, UML, ...), il doit y avoir des outils qui sont fait exprès pour parser des balises.

Diamondss
Diamondss
Niveau 10
07 février 2017 à 14:52:44

J'ai mis ça :d) https://image.noelshack.com/fichiers/2017/06/1486475557-1731-noelpush.png

TheRealMarco
TheRealMarco
Niveau 14
07 février 2017 à 15:02:20

J'ai la flemme de relire tout le topic. Je vois que tu as mis du PHP.

J'ai cherché sur google 'parser HTML PHP'
Et je suis tombé sur ça :
http://petit-dev.com/parsez-le-contenu-dun-site-avec-simple-html-dom-parser/

A partir du "chapitre" 5 tu vois comment faire avec cette bibliothèque pour accéder à une balise précise sans forcément utiliser d'expression rationnelle.

Diamondss
Diamondss
Niveau 10
07 février 2017 à 16:52:29

Le 07 février 2017 à 15:02:20 TheRealMarco a écrit :
J'ai la flemme de relire tout le topic. Je vois que tu as mis du PHP.

J'ai cherché sur google 'parser HTML PHP'
Et je suis tombé sur ça :
http://petit-dev.com/parsez-le-contenu-dun-site-avec-simple-html-dom-parser/

A partir du "chapitre" 5 tu vois comment faire avec cette bibliothèque pour accéder à une balise précise sans forcément utiliser d'expression rationnelle.

Ouais m'enfin ça m'a pas l'air plus simple qu'avec les fonctions de bases de php

godrik
godrik
Niveau 30
07 février 2017 à 17:06:52

C'est pas que c'est plus simple, c'est que c'est correcte. Parser du ML a coup de regexp n'est pas possible (cf pumping lemma). Du coup, tu peux seulement bricoler un truc. Mais probablement ca va casser a chaque changement fait par jv.com parceque ce genre de bricolage sont super sensible a l'indentation et companie.

En supposant que OP fasse du python, il y a plein de parser xml. CF stackoverflow: http://stackoverflow.com/questions/1912434/how-do-i-parse-xml-in-python

Diamondss
Diamondss
Niveau 10
07 février 2017 à 17:17:56

Je connais juste un peu de php que j'ai commencé il y a une semaine, rien de plus.. :(

Diamondss
Diamondss
Niveau 10
07 février 2017 à 18:42:05

J'ai un problème que je n'arrive pas à résoudre.

Donc pour m'entraîner je cherche à obtenir l'id de chaque topic de chaque pages d'un forum et de faire ressortir tous les id.

Le code :d) https://image.noelshack.com/fichiers/2017/06/1486489153-6193-noelpush.png

Malheureusement le résultat n'est pas celui attendu :d) https://image.noelshack.com/fichiers/2017/06/1486489433-6375-noelpush.png

Je ne comprends pas pourquoi il m'affiche 25...
25 correspond au nombre de topic par page, je ne sais pas si ça a un lien...

Mon code
<?php $page = 101; while ($page > 0) { $adresse = "http://www.jeuxvideo.com/forums/0-3007985-0-1-0-$page-0-wwe-2k17.htm"; // Adresse du forum $source = file_get_contents ($adresse); $titre = preg_match_all('<li class=\"\" data-id=\"(.*)\">', $source, $nombre); // Doit récupérer l'ID de chaque topic de la page print("Page : ".$page ."\n"); $page-=25; // Les pages d'un forum en l'occurence $page vont de 25 en 25 } $idtopic = array ($titre); // Je cherche à mettre les résultats dans un tableau foreach($idtopic as $resultat) { echo $resultat . "\n"; // Est censer m'afficher les ID de chaque topic, par exemple : 45645654 puis sur une autre ligne 454645 etc etc } ?>

Message édité le 07 février 2017 à 18:44:05 par Diamondss
LEpigeon-888
LEpigeon-888
Niveau 12
07 février 2017 à 18:57:25

Parser du ML a coup de regexp n'est pas possible (cf pumping lemma).

J'ai cherché des trucs sur pumping lemma mais je vois pas trop le rapport avec le fait de parser du fooML avec des regexp (j'ai juste lu les intros des 4 page référencées sur ce lien https://en.wikipedia.org/wiki/Pumping_lemma ), j'aimerais avoir plus d'infos là dessus si possible.

Message édité le 07 février 2017 à 18:58:08 par LEpigeon-888
LEpigeon-888
LEpigeon-888
Niveau 12
07 février 2017 à 19:11:35

J'ai peut-être compris, ce que ça veut dire c'est que par exemple récupérer le contenu du span de class "foo" dans cette phrase là :

<span class="foo">[...]</span>

N'est pas possible car l'intérieur du span pourrait être un autre span ce qui empêcherait une regex de savoir à quel "</span>" s'arrêter ?

Exemple :

<span class="foo"> [1] <span> [2] </span> [3] </span> [4] <span> [5] </span>

Avec une regexp du style <span class=\"foo\">(.*?)</span> je ne récupère que [1] et [2] alors que je veux aussi récupérer [3]. Avec <span class=\"foo\">(.*)</span> je récupère tout y compris [4] et [5] alors que je les veux pas.

Message édité le 07 février 2017 à 19:12:13 par LEpigeon-888
Diamondss
Diamondss
Niveau 10
07 février 2017 à 19:27:21

Lokilok tu t'y connais en php ou pas ? Puisque je trouve pas de solution, le problème vient de l'array je pense que j'ai sûrement mal utilité...

godrik
godrik
Niveau 30
07 février 2017 à 21:17:36

Lepigeon, oui c'est ce que dis le pumping lemma, tu ne peux pas reconnaitre des langage recursif.

Diamondss
Diamondss
Niveau 10
07 février 2017 à 22:06:20

https://image.noelshack.com/fichiers/2017/06/1486501393-5795-noelpush.png

Comment je fais pour récupérer uniquement les chiffres ?

https://image.noelshack.com/fichiers/2017/06/1486501573-9931-noelpush.png

J'ai essayé avec une boucle for mais je crois qu'il me manque quelque chose...

Sous forums
  • Aide à l'achat Mac
  • Création de sites web
  • Internet
  • Macintosh
  • Création de Jeux
  • Linux
  • Programmation
  • Steam Deck
  • Hardware
La vidéo du moment