Entwickler-Ecke

Internet / Netzwerk - Unterseiten einer Webadresse ermitteln


THF - Mo 26.01.09 17:11
Titel: Unterseiten einer Webadresse ermitteln
Wie bekommen ich alle Subdomains einer Internetadresse.

z.B. http://www.delphi-forum.de ---> /sitemap.php, .....


GTA-Place - Mo 26.01.09 17:15

Meinst du jetzt alle Dateien / Seiten oder Subdomains? Eine Subdomain wäre maps.google.de


THF - Mo 26.01.09 17:17

user profile iconGTA-Place hat folgendes geschrieben Zum zitierten Posting springen:
Meinst du jetzt alle Dateien / Seiten oder Subdomains? Eine Subdomain wäre maps.google.de


Nur Unterseiten, aber keine Dateien


jaenicke - Mo 26.01.09 17:18

Dies wird nicht direkt möglich sein, du kannst höchstens alle Links auswerten. (Stichwort Crawler, Spider, ...)


THF - Mo 26.01.09 17:20

user profile iconjaenicke hat folgendes geschrieben Zum zitierten Posting springen:
Dies wird nicht direkt möglich sein, du kannst höchstens alle Links auswerten.


..und wie bekommt man alle Links der Seite ?


jaenicke - Mo 26.01.09 17:22

Wenn du die Seite auch visuell darstellen willst z.B. indem du direkt TWebBrowser und den integrierten Parser benutzt:
http://www.cryer.co.uk/brian/delphi/twebbrowser/twebbrowser_oleobject.htm#OleObject.Document.Links

Oder, wenn du das unsichtbar machen willst, die Seite also dabei nicht sichtbar sein soll, indem du TIdHttp und einen beliebigen Parser aus dem Internet benutzt.


THF - Mo 26.01.09 17:27

user profile iconjaenicke hat folgendes geschrieben Zum zitierten Posting springen:
Wenn du die Seite auch visuell darstellen willst z.B. indem du direkt TWebBrowser und den integrierten Parser benutzt:
http://www.cryer.co.uk/brian/delphi/twebbrowser/twebbrowser_oleobject.htm#OleObject.Document.Links

Oder, wenn du das unsichtbar machen willst, die Seite also dabei nicht sichtbar sein soll, indem du TIdHttp und einen beliebigen Parser aus dem Internet benutzt.


Unsichtbar !

was ist ein Parser ????

TIdHttp ....welche Methode ????


jaenicke - Mo 26.01.09 17:31

user profile iconTHF hat folgendes geschrieben Zum zitierten Posting springen:
was ist ein Parser ????
http://de.wikipedia.org/wiki/Parser ;-)

user profile iconTHF hat folgendes geschrieben Zum zitierten Posting springen:
TIdHttp ....welche Methode ????
Get, damit bekommst du dann den Quelltext. Beispiele gibts viele.

Diesen Quelltext musst du dann analysieren. Am besten mit einem Parser.
Dies hier hört sich z.B. danach an:
http://sourceforge.net/projects/htmlp


THF - Mo 26.01.09 18:09

user profile iconjaenicke hat folgendes geschrieben Zum zitierten Posting springen:
user profile iconTHF hat folgendes geschrieben Zum zitierten Posting springen:
was ist ein Parser ????
http://de.wikipedia.org/wiki/Parser ;-)

user profile iconTHF hat folgendes geschrieben Zum zitierten Posting springen:
TIdHttp ....welche Methode ????
Get, damit bekommst du dann den Quelltext. Beispiele gibts viele.

Diesen Quelltext musst du dann analysieren. Am besten mit einem Parser.
Dies hier hört sich z.B. danach an:
http://sourceforge.net/projects/htmlp


Wenn ich den Quelltext habe, dann brauch ich doch nur alle Wörter suchen, die mit "www." anfangen,

und in denen die Adresse der Hauptseite (z.B...delphi-forum) enthalten ist, dann hab ich alle Links , oder ????


Webo - Mo 26.01.09 18:17

Zusätzlich noch die mit http:// weil des öfteren auch einfach nur mit http:// wasauchimmerohnewww .de verlinkt wird.

[Edit] Mir fällt noch ein, dass es ja auch die "content"-Lösung gibt (verwend ich ja selbst auch auf meine HP), wo dann irgendwo einfach nur index.php?id=13 steht und das dann z.B. auf Impressum.php verweist. Also müsstest du auch .php und .html miterkennen.


jaenicke - Mo 26.01.09 18:42

Die einzig sinnvolle Lösung ist wirklich die Links direkt zu suchen, d.h. nach dem anchor-Tag. Und das geht eben am besten mit einem echten Parser.

Natürlich ist aber auch eine Frickellösung möglich. Wenn das für deine Zwecke ausreicht, dann ist das ja auch ok. ;-)

Wobei du am Anfang aber gesagt hattest, dass du keine Dateien haben wolltest, mit www. etc. bekommst du aber auch alle Bilddateien usw. ;-)


THF - Mo 26.01.09 18:46

user profile iconjaenicke hat folgendes geschrieben Zum zitierten Posting springen:
Die einzig sinnvolle Lösung ist wirklich die Links direkt zu suchen, d.h. nach dem anchor-Tag. Und das geht eben am besten mit einem echten Parser.

Natürlich ist aber auch eine Frickellösung möglich. Wenn das für deine Zwecke ausreicht, dann ist das ja auch ok. ;-)

Wobei du am Anfang aber gesagt hattest, dass du keine Dateien haben wolltest, mit www. etc. bekommst du aber auch alle Bilddateien usw. ;-)


....aber die Bilddateien haben meist die Endung .jpg oder .bmp , daher kann ich die auch ausschliessen.

Aber ich schau mir den Parser mal an,und probier das mal aus.

Danke


jaenicke - Mo 26.01.09 19:02

Einen einfacheren Parser gibt es auch hier.
http://delphi.icm.edu.pl/ftp/d30free/htmlprsr.zip
(Wegen der äh... äußerst ungünstigen Konstruktion der Seite, kann ich nur einen direkten Dateilink posten. Um den Eintrag zu finden kannst du hier nach htmlparser suchen: http://dsp.href.com/)

Der oben verlinkte scheint aber schon sehr viel besser zu sein. ;-)


Matze! - Mi 11.02.09 21:41

Ich weiß nicht, ob das wirklich unterstützt werden sollte:

Zitat:
Mein Program durchsucht Internetseiten nach Email-Adressen,und speichert diese dann in einer Email-Datenbank.

Quelle: Delphi-PRAXiS [http://www.delphipraxis.net/post1000156.html#1000156].

Grüße


Christian S. - Do 12.02.09 11:08

Hallo!

Das entsprechende Thema in der DP existiert zwar nicht mehr, aber die Fragestellung und auch die Aussage, das E-Mail-Adressen ermittelt und gespeichert werden sollen, habe ich ebenfalls gelesen.

Wir werden solche Anwendungen hier in keiner Weise unterstützen, daher schließe ich dieses Thema.

Christian