Robots.txt, is dit aan te raden?

Pagina: 1
Acties:

  • LeMerchant
  • Registratie: Februari 2002
  • Laatst online: 22-07-2020

LeMerchant

Da's tochnie normaaaaal!

Topicstarter
Ik wil o.a. dat de site, http://www.autorentwander.nl goed geindexeerd wordt door Google.De site waar het om gaat is nl. niet echt goed indexeerbaar. Ten eerste bestaat'ie uit frames, en ten tweede wordt er PHP gebruikt. Dat eerste is opzich al verholpen door <noframes> tags te gebruiken.

Zoals je kunt zien is er bijv. geen 'verhuizen.html' pagina
maar deze word zo aangeroepen:

http://www.autorentwander.nl/main.php?page=verhuizingen

Nu is het toch zo dat als je:

<meta NAME="ROBOTS" CONTENT="INDEX,NOFOLLOW">

De robot alleen de index ziet en die gaat indexeren?
Dit is toch niet aan te raden om dat je zo moeilijker vindbaar bent lijkt me. Maar als je nu zegt dattie alles moet gaan indexeren:


<meta NAME="ROBOTS" CONTENT="ALL">

Nu gaatie alles indexeren, maar dat gaat niet echt omdat 'ie uit php wordt opgebouwd zegmaar.

Mij werd aangeraden robots.txt te gebruiken.
Maar hoe kan ik deze en de meta tag het beste samenstellen?

Het lijkt mij dat alleen de index.html(deze moet nog een beetje aangepast worden) redelijk/goed geindexeerd kan worden.

Dus...wat kan ik het beste doen zodat deze pagina ein-de-lijk es door Google wordt gezien. En is het trouwens aan te raden elke bot toe te laten op je pagina?

  • cutter
  • Registratie: November 2000
  • Laatst online: 28-09-2025

cutter

Wannabe i7 fanboy

http://www.robotstxt.org/wc/robots.html

hier staat ook het een en ander

Verwijderd

Op woensdag 10 april 2002 15:16 schreef cutter het volgende:
http://www.robotstxt.org/wc/robots.html

hier staat ook het een en ander
hetgeen hij wil weten is daar niet te vinden, en ik vind het ook wel interessant om te weten trouwens :)

  • LeMerchant
  • Registratie: Februari 2002
  • Laatst online: 22-07-2020

LeMerchant

Da's tochnie normaaaaal!

Topicstarter
mja...ik kom er nl. ook niet echt uit. Is er echt niemand die hier in gespecialeerd is?? ;(

Verwijderd

Met behulp van de file robot.txt slaat de zoekmachine de directory waar dat bestand in staat over.

Voorbeeld van robot.txt:


User-agent: *
Disallow: /images/
Disallow: /documenten/

  • LeMerchant
  • Registratie: Februari 2002
  • Laatst online: 22-07-2020

LeMerchant

Da's tochnie normaaaaal!

Topicstarter
Op woensdag 10 april 2002 15:44 schreef juriaan het volgende:
Met behulp van de file robot.txt slaat de zoekmachine de directory waar dat bestand in staat over.

Voorbeeld van robot.txt:


User-agent: *
Disallow: /images/
Disallow: /documenten/
Dit houd toch in dat alle bots toegestaan zijn, en dat de directories 'images' en 'documenten' niet geindexeerd mogen worden he?
Maar hoe kan ik dat dan het beste doen voor http://www.autorentwander.nl ? omdat je hier geen aparte pagina's hebt zoals bijv. verhuizen.html enzo. Dus dat je eigenlijk genoodzaakt bent alleen de index.html te gaan indexeren

  • cutter
  • Registratie: November 2000
  • Laatst online: 28-09-2025

cutter

Wannabe i7 fanboy

Als iemand hier rondloopt die die wijsheid heeft kan bakken met geld verdienen, hij is dan de equivalent van de 15e eeuwse magier die lood in goud heeft weten te veranderen.

Google maakt een ranking aan de hand van de interconnectie tussen sites, hoe vaker jij voorkomt als link in andere sites hoe hoger je komt.

Robots indexeren de pagina's zoals de bezoeker ze te zien krijgt. Of ik mijn pagina in 100% html klop of php gebruik maakt denk ik niet uit... de robot volgt gewoon de links zoals iedere user ze kan volgen.

http://www.searchenginewatch.com/webmasters/features.html
http://www.pageresource.com/zine/robotstxt.htm

Robots.txt is volgens de bovenstaande literatuur een file die je gebruikt om een bot je site of een deel daar van niet te laten indexen. Bijvoorbeeld als je niet wil dat mensen rechtstreeks naar je downloadpage verwezen worden door een bot.

http://www.robotstxt.org/wc/mailing-list/0293.html

Kijk naar deze discussie bijvoorbeeld: volgens mij is er dus op die link die ik gaf wel heel veel te vinden..

Wie raadde je aan robots.txt te gebruiken en waarom eigenlijk...

  • LeMerchant
  • Registratie: Februari 2002
  • Laatst online: 22-07-2020

LeMerchant

Da's tochnie normaaaaal!

Topicstarter
Op woensdag 10 april 2002 16:01 schreef cutter het volgende:
Wie raadde je aan robots.txt te gebruiken en waarom eigenlijk...
iemand PK hosting. Ik wou weten welke webservers ze gebruikten. Ik dacht dat als ze Apache gebruikten het .htacces bestandje te gebruiken met daarin de mod rewrite functie. Maarja kwas dat dus aant uitzoeken en wist dus niet zeker of ze uberhaupt wel apache draaiden. Et bleek dus niet zo te zijn. Dus zei die dat ik robots.txt kon gebruiken.
De reden om .htacces te gebruiken is:

Ik had gelezen dat php pagina's door google moeilijk geindexeerd worden. d.m.v. die mod rewrite kon je zoiets als main.php?page=home veranderen in main/home.html. Dus dat was eigenlijk ook mn bedoeling, maar dat kon dus niet doorgaan omdat, zoals eerder gezegegd, ze geen apache draaien.

  • Bosmonster
  • Registratie: Juni 2001
  • Laatst online: 29-08 19:47

Bosmonster

*zucht*

Google negeert bestanden met een '?' derin. Dus die robots.txt zal niet zoveel uitmaken :P

Is ook wel logisch, anders zou Google iedere online database leegtrekken van dynamische websites. En vandaar ook dat T.NET '/' gebruikt ipv '?'.

  • LeMerchant
  • Registratie: Februari 2002
  • Laatst online: 22-07-2020

LeMerchant

Da's tochnie normaaaaal!

Topicstarter
sja...maar wie weet hoe et dan wel moet? ondersteunt IIS 5 ook .htacces?

  • Bosmonster
  • Registratie: Juni 2001
  • Laatst online: 29-08 19:47

Bosmonster

*zucht*

Frames en zoekmachines gaat nu eenmaal niet lekker samen (en van de redenen dat het niet an te raden is op internet). Is weinig aan te doen dan een losse zoekmachine optimalisatie te bouwen, waarin je ook rekening houdt met de URL.

Of als je server toegang hebt kun je mogelijk een andere delimiter kiezen dan ?. Of je schrijft een eigen URL-parsertje.

  • djc
  • Registratie: December 2001
  • Laatst online: 08-09-2025

djc

Op woensdag 10 april 2002 16:59 schreef LeMerchant het volgende:
sja...maar wie weet hoe et dan wel moet? ondersteunt IIS 5 ook .htacces?
Dacht het niet, maar misschien is er bij IIS weer een andere manier.

Rustacean


  • paulh
  • Registratie: Juli 1999
  • Laatst online: 22-06 15:30
Op woensdag 10 april 2002 16:58 schreef Bosmonster het volgende:
Google negeert bestanden met een '?' derin. Dus die robots.txt zal niet zoveel uitmaken :P

Is ook wel logisch, anders zou Google iedere online database leegtrekken van dynamische websites. En vandaar ook dat T.NET '/' gebruikt ipv '?'.
Crap ... google indexeerd wel pagina's met een ? erin. Een groot van mijn forum is terug te vinden op google met ? erin. Veel andere search engines doen dat idd niet.

[ZwareMetalen.com] - [Kom in aktie tegen de CO2 maffia]


  • 2
  • Registratie: November 2000
  • Laatst online: 31-03 13:52

2

Op woensdag 10 april 2002 19:43 schreef paulh het volgende:

[..]

Crap ... google indexeerd wel pagina's met een ? erin. Een groot van mijn forum is terug te vinden op google met ? erin. Veel andere search engines doen dat idd niet.
Hij indexeert ze wel maar rankt ze vrij laag (lijkt me ook logisch).


Als je een pagina met frames hebt kun je het beste dit doen:
code:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
<html>
<head>
  <title>Welkom op mijn site</title>
<frameset>
(...)
</frameset>
</head>
<body>
<p>Bladieblabladiebl <a href="index2.html">onderwerp pagina 1</a></p>
<p>Dit zo danwel niet danwel wel <a href="pagina2.html>onderwerp 2</a></p>

ETC..


</body>
</html>

Om er voor te zorgen dat al je pagina's geindexeerd worden. Of je kan natuurlijk de geframede baginpagina opgeven om te laten indexeren.

  • Olaf van der Spek
  • Registratie: September 2000
  • Niet online
Op woensdag 10 april 2002 16:58 schreef Bosmonster het volgende:
Google negeert bestanden met een '?' derin. Dus die robots.txt zal niet zoveel uitmaken :P

Is ook wel logisch, anders zou Google iedere online database leegtrekken van dynamische websites. En vandaar ook dat T.NET '/' gebruikt ipv '?'.
Oh ja?
De eerste link die google vindt voor "reaprzero" is http://xccu.sourceforge.net/cgi-bin/forum.cgi?action=17&slot=2537

Verwijderd

Hmmm, werkt er iemand bij IM&D????

  • Bosmonster
  • Registratie: Juni 2001
  • Laatst online: 29-08 19:47

Bosmonster

*zucht*

Vaag, dan waren het de andere searchengines misschien. OF Google doet het pas recent.. Zoog het toch niet uit mn grote teen :P

  • M4RTiN
  • Registratie: Augustus 2000
  • Laatst online: 24-11-2024
ik krijg trouwens vaak een melding in mn error.log van apache dat /robots.txt niet gevonden is

ik gebruik het ook dan niet , maar blijkbaar is er wel vraag naar?

  • LeMerchant
  • Registratie: Februari 2002
  • Laatst online: 22-07-2020

LeMerchant

Da's tochnie normaaaaal!

Topicstarter
Op woensdag 10 april 2002 22:16 schreef PatrickPietens het volgende:
Hmmm, werkt er iemand bij IM&D????
;)

  • LeMerchant
  • Registratie: Februari 2002
  • Laatst online: 22-07-2020

LeMerchant

Da's tochnie normaaaaal!

Topicstarter
Op woensdag 10 april 2002 21:01 schreef 2 het volgende:

[..]

Hij indexeert ze wel maar rankt ze vrij laag (lijkt me ook logisch).


Als je een pagina met frames hebt kun je het beste dit doen:
code:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
<html>
<head>
  <title>Welkom op mijn site</title>
<frameset>
(...)
</frameset>
</head>
<body>
<p>Bladieblabladiebl <a href="index2.html">onderwerp pagina 1</a></p>
<p>Dit zo danwel niet danwel wel <a href="pagina2.html>onderwerp 2</a></p>

ETC..


</body>
</html>

Om er voor te zorgen dat al je pagina's geindexeerd worden. Of je kan natuurlijk de geframede baginpagina opgeven om te laten indexeren.
Daar had ik inderdaad al aan gedacht. Maar in het geval van de website www.autorentwander.nl wil dat toch niet echt omdat je je daar geen pagina1.html, pagina2.html enz. hebt.
Dusseuh...
Op woensdag 10 april 2002 17:01 schreef Bosmonster het volgende:
Frames en zoekmachines gaat nu eenmaal niet lekker samen (en van de redenen dat het niet an te raden is op internet). Is weinig aan te doen dan een losse zoekmachine optimalisatie te bouwen, waarin je ook rekening houdt met de URL.

Of als je server toegang hebt kun je mogelijk een andere delimiter kiezen dan ?. Of je schrijft een eigen URL-parsertje.
Heb jij enig idee hoe dit moet dan, of waar er info over te vinden is????

  • 2
  • Registratie: November 2000
  • Laatst online: 31-03 13:52

2

Op donderdag 11 april 2002 09:23 schreef LeMerchant het volgende:
Daar had ik inderdaad al aan gedacht. Maar in het geval van de website www.autorentwander.nl wil dat toch niet echt omdat je je daar geen pagina1.html, pagina2.html enz. hebt.
Dusseuh...
Volgens mij begrijp je niet helemaal wat ik bedoel. Het gaat er meer om dat er in de body van de pagina met de frameset linkjes staan naar alle pagina's van je site, die worden dan op die manier gespiderd.
Op donderdag 11 april 2002 09:23 schreef LeMerchant het volgende:
Heb jij enig idee hoe dit moet dan, of waar er info over te vinden is????
http://www.google.com/search?q=search+engine+friendly+urls

  • Tomsworld
  • Registratie: Maart 2001
  • Niet online

Tomsworld

officieel ele fan :*

Tweakers.net gebruikt ook zoiets http://www.tweakers.net/ext/robot.dsp

"De kans dat een snee brood op een nieuw tapijt valt met de beboterde zijde onderaan, is recht evenredig met de prijs van het tapijt"


  • cutter
  • Registratie: November 2000
  • Laatst online: 28-09-2025

cutter

Wannabe i7 fanboy

Op donderdag 11 april 2002 11:19 schreef Tomsworld het volgende:
Tweakers.net gebruikt ook zoiets http://www.tweakers.net/ext/robot.dsp
Dat is wel iets anders: in de code van www.tweakers.net staat eeen link naar robot.dsp die link is alleen te zien voor robots niet voor users die niet de source gaan bekijken. Maar het is idd een oplossing om je pagina beter bij de zoekmachines te krijgen. Met robots.txt heeft dit helemaal niets te maken.

  • LeMerchant
  • Registratie: Februari 2002
  • Laatst online: 22-07-2020

LeMerchant

Da's tochnie normaaaaal!

Topicstarter
dus robot(met of zonder s?).dsp is net zoiets als robots.txt alleen net ff anders dus?
Toen ik robot.dsp opende zag ik heeel veeel links staan. Is dit ook de bedoeling van zo'n robot.dsp bestand, dat hier zoveel mogelijk links in komen te staan?

  • LeMerchant
  • Registratie: Februari 2002
  • Laatst online: 22-07-2020

LeMerchant

Da's tochnie normaaaaal!

Topicstarter
Op donderdag 11 april 2002 11:03 schreef 2 het volgende:
Volgens mij begrijp je niet helemaal wat ik bedoel. Het gaat er meer om dat er in de body van de pagina met de frameset linkjes staan naar alle pagina's van je site, die worden dan op die manier gespiderd.
ok das duidelijk, maar dat worden dan links zoals:
/main.php?page=pagina1
/main.php?page=pagina2

En dan zit je toch weer vast op die -?-.

  • 2
  • Registratie: November 2000
  • Laatst online: 31-03 13:52

2

Da's sowieso beter dan nix toch?

Kijk, ik zal je een beetje uitleggen over "searchengine friendly url's".

Nu gebruik je om aan je variabelen te komen waarschijnlijk $HTTP_GET_VARS of QUERY_STRING of zoiets. Wat je ook kunt doen is de "action" aan de scriptjes als volgt meegeven:

http://www.mijndomein.nl/script/action

Nu heeft de environmental variable $PATH_INFO in je script de waarde "/action".
PHP:
1
<?// Link naar script: http://www.mijndomein.nl/main.php/accesoires$action = ereg_replace("[^a-zA-Z]", "", getenv("PATH_INFO"));?>

Ik sloop de / er altijd zo af, gewoon alles dat geen letter is, is sowieso veilig dan.

Dit geeft dus het zelfde effect als
PHP:
1
<?//Link naar script: http://www.mijndomein.nl/main.php?action=accesoires$action = HTTP_GET_VARS["action"];?>

Nu ziet de searchengine niet dat het een dynamische pagina is, hij denkt dat "main" een directory is.

HTH
Pagina: 1