Entwickler-Ecke
Internet / Netzwerk - Unterseiten einer Webadresse ermitteln
THF - Mo 26.01.09 17:11
Titel: Unterseiten einer Webadresse ermitteln
Wie bekommen ich alle Subdomains einer Internetadresse.
z.B.
http://www.delphi-forum.de ---> /sitemap.php, .....
GTA-Place - Mo 26.01.09 17:15
Meinst du jetzt alle Dateien / Seiten oder Subdomains? Eine Subdomain wäre maps.google.de
THF - Mo 26.01.09 17:17
GTA-Place hat folgendes geschrieben : |
| Meinst du jetzt alle Dateien / Seiten oder Subdomains? Eine Subdomain wäre maps.google.de |
Nur Unterseiten, aber keine Dateien
jaenicke - Mo 26.01.09 17:18
Dies wird nicht direkt möglich sein, du kannst höchstens alle Links auswerten. (Stichwort Crawler, Spider, ...)
THF - Mo 26.01.09 17:20
jaenicke hat folgendes geschrieben : |
| Dies wird nicht direkt möglich sein, du kannst höchstens alle Links auswerten. |
..und wie bekommt man alle Links der Seite ?
THF - Mo 26.01.09 17:27
Unsichtbar !
was ist ein
Parser ????
TIdHttp ....welche Methode ????
jaenicke - Mo 26.01.09 17:31
THF hat folgendes geschrieben : |
| was ist ein Parser ???? |
http://de.wikipedia.org/wiki/Parser ;-)
THF hat folgendes geschrieben : |
| TIdHttp ....welche Methode ???? |
Get, damit bekommst du dann den Quelltext. Beispiele gibts viele.
Diesen Quelltext musst du dann analysieren. Am besten mit einem Parser.
Dies hier hört sich z.B. danach an:
http://sourceforge.net/projects/htmlp
THF - Mo 26.01.09 18:09
Wenn ich den Quelltext habe, dann brauch ich doch nur alle Wörter suchen, die mit "www." anfangen,
und in denen die Adresse der Hauptseite (z.B...delphi-forum) enthalten ist, dann hab ich alle Links , oder ????
Webo - Mo 26.01.09 18:17
Zusätzlich noch die mit http:// weil des öfteren auch einfach nur mit http:// wasauchimmerohnewww .de verlinkt wird.
[Edit] Mir fällt noch ein, dass es ja auch die "content"-Lösung gibt (verwend ich ja selbst auch auf meine HP), wo dann irgendwo einfach nur index.php?id=13 steht und das dann z.B. auf Impressum.php verweist. Also müsstest du auch .php und .html miterkennen.
jaenicke - Mo 26.01.09 18:42
Die einzig sinnvolle Lösung ist wirklich die Links direkt zu suchen, d.h. nach dem anchor-Tag. Und das geht eben am besten mit einem echten Parser.
Natürlich ist aber auch eine Frickellösung möglich. Wenn das für deine Zwecke ausreicht, dann ist das ja auch ok. ;-)
Wobei du am Anfang aber gesagt hattest, dass du keine Dateien haben wolltest, mit www. etc. bekommst du aber auch alle Bilddateien usw. ;-)
THF - Mo 26.01.09 18:46
jaenicke hat folgendes geschrieben : |
Die einzig sinnvolle Lösung ist wirklich die Links direkt zu suchen, d.h. nach dem anchor-Tag. Und das geht eben am besten mit einem echten Parser.
Natürlich ist aber auch eine Frickellösung möglich. Wenn das für deine Zwecke ausreicht, dann ist das ja auch ok. ;-)
Wobei du am Anfang aber gesagt hattest, dass du keine Dateien haben wolltest, mit www. etc. bekommst du aber auch alle Bilddateien usw. ;-) |
....aber die Bilddateien haben meist die Endung .jpg oder .bmp , daher kann ich die auch ausschliessen.
Aber ich schau mir den Parser mal an,und probier das mal aus.
Danke
jaenicke - Mo 26.01.09 19:02
Einen einfacheren Parser gibt es auch hier.
http://delphi.icm.edu.pl/ftp/d30free/htmlprsr.zip
(Wegen der äh... äußerst ungünstigen Konstruktion der Seite, kann ich nur einen direkten Dateilink posten. Um den Eintrag zu finden kannst du hier nach htmlparser suchen:
http://dsp.href.com/)
Der oben verlinkte scheint aber schon sehr viel besser zu sein. ;-)
Christian S. - Do 12.02.09 11:08
Hallo!
Das entsprechende Thema in der DP existiert zwar nicht mehr, aber die Fragestellung und auch die Aussage, das E-Mail-Adressen ermittelt und gespeichert werden sollen, habe ich ebenfalls gelesen.
Wir werden solche Anwendungen hier in keiner Weise unterstützen, daher schließe ich dieses Thema.
Christian
Entwickler-Ecke.de based on phpBB
Copyright 2002 - 2011 by Tino Teuber, Copyright 2011 - 2026 by Christian Stelzmann Alle Rechte vorbehalten.
Alle Beiträge stammen von dritten Personen und dürfen geltendes Recht nicht verletzen.
Entwickler-Ecke und die zugehörigen Webseiten distanzieren sich ausdrücklich von Fremdinhalten jeglicher Art!