Jag har ett par webbplatser som skulle kunna ha adresserna http://foo.screamshot.com/ och http://bar.screamshot.com.
Dessa webbplatser är egentligen bara en fysisk webbplats, men med olika utseende beroende på vilken adress man går till. De ligger på samma server, och har två host headers som pekar på samma mapp på servern.
Det är alltså fysiskt sett en enda webbplats, med flera adresser.
Jag vill nu använda robots.txt för att låta sökmotorer indexera en av siterna, men inte den andra.
Hur gör jag detta? Hade det varit separata webbplatser så hade jag ju haft separata robots.txt-filer att tillgå, och då hade det ju inte varit något problem.
Lång historia till kort: Hur gör jag olika inställningar för olika subdomäner/domäner i en och samma robots.txt?
Om de där adresserna stämmer, kan du inte använda .htaccess (eftersom du då inte kör Apache utan IIS)... Med Apache hade du annars kunnat använda regler typ:
Nej, det är inte de adresser jag angav det gäller, men det förändrar inte så mycket. Det är IIS version 5 (f.t., kommer väl bli 6 så småningom). Vi har också lekt med tanken att låta .txt gå igenom asp-tolken för att den vägen returnera olika textinnehåll till spindlarna beroende på vilken website man besöker. Problemet är dock att då kan vem som helst ladda upp en textfil på servern och exekvera denna. Fatta vilket bövelskap folk skulle ställa till med! :)
För inte kan man låta IIS hantera en viss .txt-fil som om den vore asp, men låta resten vara?
- - - - -
URL Rewriting kan ju vara intressant. Jag ska läsa på lite mer om det.
Tack för ditt svar! :bire (y)
Mina tankar går direkt till en egen 404-sida som hanterar din request beroende på vad som finns i t.ex. servervariables. Typ att du kontrollerar om den efterfrågade resursen är "robots.txt", så kollar du domän eller valfri annan kriterie, och exekverar lite egen kod (t.ex. sprutar ut din specifika robots.txt och sätter content-type i asp) i din egen 404.asp som du har angivit i din IIS, på sajten.
Sen får du väl undantagshantera också, så inte alla 404 blir till din robots.txt, om du förstår vad jag menar. Och sen får ju inte robots.txt finnas heller, men det förstår du ju själv. ;)
Inte det bästa sättet, men det borde gå, inte sant?
Det är ju ett alternativ. Kanske inte så extremt dumt alternativ heller egentligen. 404:an använder jag på en massa läckra sätt redan, så det kanske inte är så dumt att låta den ta hand om roboterandet också. :)
Tack! :)
248 ms totalt · 4 externa anrop · v20260731065814-full.86ec41c2