.NET och RegEXP
RegExp:
Här har du en länk som förklarar hur det fungerar.
http://www.webeye.nu/default2.asp?que=asp/default.asp&exec=asp/artiklar/asp_11.asp (visserligen är det för asp men mönstren fungerar ungefär på samma sätt)
5 svar · 399 visningar · startad av clarkbones
Hallå!
Jag skall skapa ett program som läser in en webbsida och skickar en delmängd av informationen till en SQL-server databas. Informationen som skall läsas in finns i tabellform. Sidan jag läser in ifrån är en helt vanlig webbsida. Jag har ingen möjlighet att påverka denna sidas utformning.
Nu undrar jag vilken metod som är snabbast att göra detta.
Jag har några huvudalternativ.
MSXML-komponenten. Jag har bara sett lite exempelkod och det verkar ju inte så svårt att komma igång. Vet dock ej hur enkelt det är att parsa fram informationen i tabellen och bli av med alla html-taggar.
Excel. Man kan öppna en websida från Excel och med några få grepp få informationen att bli enkelt inläsbar. Har testat detta tidigare och det funkar alldeles bortsett från att det tar lite tid att läsa in sidan i Excel (antar att det inte är den mest optimerade weebläsaren). Sedan känns det inte riktigt rätt att använda Excel till en sådan här uppgift.
Webrequest i NET, har dock inte hunnit testa denna funktion, men gissar att den på något sätt kan användas.
Någon som har några kommentarer?
.NET och RegEXP
RegExp:
Här har du en länk som förklarar hur det fungerar.
http://www.webeye.nu/default2.asp?que=asp/default.asp&exec=asp/artiklar/asp_11.asp (visserligen är det för asp men mönstren fungerar ungefär på samma sätt)
Jag lekte fram något förut som använder sig av WebRequest:
Jo, det blir nog en webrequest. Men jag behöver ändra en sak. Webrequesten returnerar ju en sträng som ser ut så här i princip:
<html><head></head><body><b>En massa text</b></text></body></html>
Nu vill jag skippa alla html mark-ups och bara få fram:
En massa text.
Finns det någon metod för detta eller måste jag skapa en en egen reg exp funktion?
Låter som att RegExp blir bäst.
Ta en titt här: http://www.regexlib.com
Här finns en funktion för att rensa bort html från strängar.
Väldigt smidigt. Jag tackar för all hjälp.