http://www.urkund.se/ jämför ju texter i en databas för att förhindra fusk men hur fungerar den? Jämför den speciella nyckelord, hela meningar eller om något stycke skulle vara identiskt?
Jag skulle tippa på att man indexerar ord som inte finns med i ett "skräpordsfilter" ex. i, på, av, och, eller, man, kanske, osv
Sedan så räknar man förekomsten av dessa, och jämför med andra siter/dokument. Ju högre procent likhet desto större sannolighet är att sidan/dokumentet är plankat. Sedan så är det nog en och annan handpåläggning också kan jag tänka mig.
Detta vet jag inte, jag bara misstänker att det går till så. :)
Jag har gjort en liknande sak en gång som funkade hyfsat (den klarade av att skilja Nietzsche, The Kristet Utseende och Konfucius från varandra, iaf ;) ). Det programmet använde en extremt simpel variant av markovkedjor, där jag räknade på och jämförde samförekomster av ord (i princip jämfördes, för alla ord, sannolikheten att ord X följde direkt efter ord Y i varje dokument).
Och det är väl på ett ungefär så de flesta textmatchningsverktyg funkar, att man ser hur olika ord samförekommer. Ganska enkelt. Sen gäller det "bara" att få det att skala så att man kan söka igenom texter på ett gäng giga-/tera-/peta-/exobyte :)
268 ms totalt · 4 externa anrop · v20260731065814-full.a51de22e