Een recent bericht op de Google Security Blog beschrijft nieuwe upgrades van de spamfilters van Gmail, die Google 'een van de grootste defensie-upgrades van de afgelopen jaren' noemt. De upgrade komt in de vorm van een nieuw tekstclassificatiesysteem genaamd RETVec (Resilient Efficient Text Vectorizer). Google zegt dat dit helpt bij het begrijpen van ‘vijandige tekstmanipulatie’: e-mails gevuld met speciale tekens, emoji’s, typefouten en andere junk-tekens die voorheen leesbaar waren voor mensen, maar niet gemakkelijk te begrijpen door machines. Voorheen glipte spam vol speciale tekens gemakkelijk langs de verdedigingsmechanismen van Gmail.

Als je een idee wilt krijgen van hoe ‘tegenstrijdige tekstverwerking’ eruit ziet, vind je hier wat zich in mijn spammap bevindt:

Mijn persoonlijke ervaring is dat deze e-mails in de eerste helft van het jaar een groot probleem vormden en dat ik ze vrij vaak in mijn inbox tegenkwam. Deze RETVec-technologie-upgrade lijkt echter een verschil te hebben gemaakt, aangezien ik de afgelopen maanden helemaal geen dergelijke e-mails ben tegengekomen.

Dit soort e-mails zijn moeilijk te classificeren, omdat elk spamfilter waarschijnlijk een e-mail zal onderscheppen met de tekst 'Gefeliciteerd! Uw winnende accountsaldo is $ 1.000', maar dat is niet de werkelijke inhoud van de e-mail. De meeste letters hier zijn "homofonen" - door in de eindeloze diepten van de Unicode-standaard te duiken, kun je obscure tekens vinden die eruit zien alsof ze deel uitmaken van het reguliere Latijnse alfabet, maar dat niet zijn.

Het onderwerp "Check_Your_Account" is bijvoorbeeld vreemd vetgedrukt, niet omdat het een vetgedrukte stijl heeft, maar omdat het een Unicode-glyph gebruikt, zoals "Math Bold Capital C". Het is een wiskundig symbool dat voor mensen op de letter "C" lijkt, maar spamfilterbots zien het nauwkeurig als een wiskundig symbool en begrijpen de Engelse betekenis ervan niet. Hoe beter je naar een dergelijke e-mail kijkt, hoe erger het wordt: het teken "O" in "GEFELICITEERD" wordt vervangen door een 0, de onderstrepingsteken in "Jackpot" is zo raar dat deze niet eens kan worden gevonden in een Unicode-zoekopdracht, en veel spaties zijn vervangen door punten of onderstrepingstekens. Als gevolg hiervan geven spamfilters zich over als ze deze rommelige e-mails zien.

Google zegt dat RETVec hier is om ons te redden: "RETVec is getraind om bewerkingen op tekenniveau te weerstaan, inclusief invoegingen, verwijderingen, typefouten, homofonen, LEET-vervangingen en meer. RETVec-modellen zijn getraind op een nieuwe karakter-encoder die alle UTF-8-tekens en woorden efficiënt codeert. Als gevolg hiervan vereist RETVec geen opzoektabellen of vaste vocabulaires en draait het op meer dan 100 talen."

Efficiëntie is erg belangrijk. Andere methoden die gebruik maken van "vaste woordenschat" of homofoon "opzoektabellen" zijn tijdens runtime zeer arbeidsintensief. Stel je voor dat een of meer karakters van "gefeliciteerd" zouden worden vervangen door cijfers, wiskundige symbolen, Cyrillische letters, Hebreeuws of emoticons, dan zouden alle mogelijke spellingen en spelfouten verschijnen in een lijst die bijna eindeloos is. Google zegt dat RETVec slechts 200.000 parameters heeft, "geen miljoenen", dus hoewel de spamfilterwolk van Google groot genoeg is om alles uit te voeren, is hij klein genoeg om zelfs op lokale apparaten te draaien. RETVec is open source en Google hoopt dat het de wereld zal bevrijden van dit soort homofoonaanvallen in verschillende coderingen.

RETVec lijkt veel op de manier waarop mensen lezen te werken: het is een machine learning TensorFlow-model dat visuele ‘overeenkomst’ gebruikt om de betekenis van woorden te identificeren, in plaats van de feitelijke karakterinhoud van de woorden. De 'similarity'-demo van Google gebruikte dezelfde technologie om afbeeldingen van katten te identificeren, dus het klinkt haalbaar om er 's werelds meest geavanceerde optische tekenherkenningssysteem van te maken.

Het is duidelijk dat deze aanpak tot grote verbeteringen heeft geleid, waarbij Google stelt dat "het vervangen van de vorige tekstvectorizer in de spamclassifier van Gmail door RETVec ons spamdetectiepercentage met 38% verbeterde ten opzichte van de basislijn en het aantal valse positieven met 19,4% verminderde. Bovendien verminderde het gebruik van RETVec het TPU-gebruik van het model met 83%, waardoor de implementatie van RETVec een van de grootste defensie-upgrades van de afgelopen jaren is."

Google zei dat het "RETVec het afgelopen jaar intern heeft getest en het naar uw Gmail-account heeft uitgerold."