Strategi

Hvordan kapitalen forvaltes, hvilke krav et forslag må passere før det får penger, og hva vi har målt som ikke virker.

Bevisbyrde, utvelgelse, måling og risiko

Hva dette er

Denne siden er ikke en presentasjon av en strategi. Den er en beskrivelse av hva som må være sant før noe blir en strategi hos oss.

Rekkefølgen er med vilje. Regnestykket kommer før utvelgelsen, fordi det avgjør hva som i det hele tatt er verdt å lete etter. Målingen kommer før risikoen, fordi et risikotall fra et måleapparat man ikke kjenner svakhetene til, ikke er et risikotall.

Tallene under er fra vårt eget arbeid, og de kan etterprøves i rapporten som ligger lenket nederst. Der de peker mot at noe ikke virker, står de her av samme grunn som de står der.

01

Utgangspunktet

Passiv eksponering er standardvalget. Alt annet må fortjene plassen sin.

Hulc forvalter egen kapital. Det gir én fordel som ikke lar seg kjøpe, nemlig at ingen kan be om pengene tilbake på et ugunstig tidspunkt. Vi har ingen innløsninger å dekke, ingen kvartalsvis måling mot en referanseindeks, og ingen grunn til å handle fordi det har gått en periode uten at noe skjedde. Det gir også én begrensning som ikke lar seg forhandle bort, nemlig at faste kostnader per ordre utgjør en større andel jo mindre ordren er. Begge former strategien mer enn noen markedssyn gjør.

Antakelsen vi arbeider under, er at markedet er overveiende effisient over tid, men at avvik oppstår og i prinsippet kan utnyttes. Den andre halvdelen av setningen er den interessante, og den er også den som må testes framfor å tros. Litteraturen på området er entydig på ett punkt. Publiserte anomalier krymper etter at de er publisert. McLean og Pontiff (2016) måler avkastningen til publiserte strategier som 26 prosent lavere ut av utvalget og 58 prosent lavere etter publisering. En strategi som er kjent, er derfor ikke automatisk en strategi som virker.

Konsekvensen er en bevisbyrde som går én vei. Kapitalen ligger passivt i EØS-hjemmehørende UCITS-fond under fritaksmetoden inntil noe annet har passert et sett kriterier som ble skrevet ned før målingen ble kjørt. Aktiv eksponering er unntaket som må begrunnes, ikke standardtilstanden som må forsvares.

Det er ikke en teoretisk posisjon. Vi har testet fem strategifamilier, altså intradags mean-reversion på RSI, filtrerte varianter av den, faktor-ETF-rotasjon på europeiske markeder, absolutt momentum som trendfølging, og to enkeltaksjestrategier på amerikansk marked over 27 år med punkt-i-tid-data. Ingen av dem leverte risikojustert avkastning som overgikk en passiv referanse etter kostnader og skatt. Ingen konfigurasjon er forfremmet til drift.

Systematisk handel.
Regelbaserte strategier som kan spesifiseres fullt ut på forhånd og kjøres om igjen av en annen. Dette er området der bevisbyrden lar seg gjøre opp i tall, og det er derfor det er testet først.
Fundamental analyse.
Vurdering av enkeltselskaper på regnskap, kapitalavkastning og prising. Her lar konklusjonen seg ikke måle på samme måte, og kravet flyttes derfor over på forutsetningene, som skrives ut og prøves mot alternativer.
Risikostyring og porteføljekonstruksjon.
Hvordan posisjonene settes sammen, hvor konsentrert porteføljen får være, og hvor mye friksjon oppsettet tåler. Dette området arver forutsetningene fra de to andre, og det er der de fleste faktiske utfall avgjøres.

Målingene på denne siden er kjørt på vårt eget backtestrammeverk, med punkt-i-tid-fundamentaldata, historisk indeksmedlemskap, eksplisitt kostnadsmodell og 22 prosent skatt på realisert gevinst der den påløper. Hver måling er kjørt mot en full testsuite før tallet ble skrevet ned.

02

Regnestykket

Hva som faktisk avgjør sluttverdien, og hvorfor det sjelden er avkastningen.

Den vanligste feilen i forvaltning er å behandle avkastning som det man optimaliserer og risiko som det man tåler. Det er feil vei rundt. Sluttverdien til en portefølje følger den geometriske avkastningen, ikke den aritmetiske, og forskjellen mellom de to er en funksjon av variansen. Tilnærmet gjelder at geometrisk avkastning er lik aritmetisk avkastning minus halve variansen. To porteføljer med identisk gjennomsnittsavkastning ender derfor på ulikt sted utelukkende fordi den ene svinger mer enn den andre.

Det er ikke en lærebokspåstand her. Det er hovedfunnet i vår egen sammenligning av to enkeltaksjestrategier over 27 år. Den ene rangerer på momentum alene. Den andre rangerer på en sammensatt score av kvalitet, verdi og momentum. På 100 000 kroner i startkapital er de aritmetiske gjennomsnittene 8,06 og 8,04 prosent, altså like. Hele forskjellen i sluttverdi kommer fra andremomentet.

Annualisert snittAnnualisert volatilitetCAGRVolatilitetsdrag
Ren momentum7,68 %26,13 %4,32 %3,36 pp
Multifaktor7,89 %18,21 %6,40 %1,49 pp
S&P 5009,28 %15,11 %8,46 %0,82 pp
Månedlige avkastninger, 30. juni 1999 til 30. juni 2026, 50 000 kroner startkapital. Multifaktor tjener ikke mer enn ren momentum. Den taper mindre på veien.

Mekanismen bak dragtallet er asymmetrien i tap. Et fall på 50 prosent krever 100 prosent for å hentes inn. Et fall på 86 prosent krever 620. Momentumstrategien i tabellen over hadde tre fall av den typen, og den gamle toppen fra mars 2000 ble ikke tatt igjen før i juni 2025, altså over 25 år senere. Multifaktorstrategien falt 58 prosent fra juli 2007 til mars 2009 og lå seks og et halvt år under vann. I begge tilfellene er den årlige avkastningen et sammendrag av noe som i praksis var uutholdelig å sitte i.

Den praktiske konsekvensen er at vi leter hardere etter lavere varians enn etter høyere avkastning. Det er ikke forsiktighet. Det er at variansreduksjon er den ene av de to som faktisk lar seg oppnå med rimelig sikkerhet, mens meravkastning i vårt eget materiale forsvant hver gang den ble målt ordentlig.

Friksjon er en funksjon av størrelse, ikke av strategi

Litteraturen som motiverer systematiske strategier er i hovedsak skrevet på institusjonelle forutsetninger, der ordren er stor nok til at faste kostnader per ordre er uten betydning. Den forutsetningen holder ikke for et lite selskap. Kostnadsmodellen vår følger faktiske vilkår hos Interactive Brokers Pro, altså 0,005 dollar per aksje med et gulv på én dollar per ordre, tre basispunkter spread per side og fem basispunkter slippage per side. Det gir omtrent 16 basispunkter per rundtur pluss et gulv som binder på små ordre.

KostnadsleddRen momentum, 50kRen momentum, 100kMultifaktor, 50kMultifaktor, 100k
Kommisjon0,840 pp0,404 pp0,272 pp0,137 pp
Spread0,057 pp0,057 pp0,050 pp0,050 pp
Slippage0,636 pp0,635 pp0,423 pp0,424 pp
Sum1,533 pp1,095 pp0,745 pp0,611 pp
Årlig kostnadstrekk i prosentpoeng. Spread og slippage er proporsjonale og flytter seg ikke med kapitalen. Kommisjonen halveres, fordi gulvet på én dollar utgjør dobbelt så stor andel av en ordre på 2 500 kroner som av en på 5 000.

Legges skatten oppå, koster friksjonen ren momentum 2,5 prosentpoeng i året og multifaktor 2,1. Begge bruker altså rundt en fjerdedel av bruttoavkastningen på å eksistere. En strategi kan derfor være lønnsom brutto og ulønnsom netto utelukkende på grunn av porteføljestørrelsen, uten at noe ved strategien er endret. Det er det viktigste enkeltforholdet mellom oss og litteraturen vi leser.

Skatt er en strukturell parameter, ikke en sluttpost

Et norsk aksjeselskap betaler 22 prosent av realisert gevinst på aksjer utenfor EØS. Innenfor EØS er gevinstbeskatningen i hovedsak frafalt for selskapsinvestorer etter fritaksmetoden, jf. skatteloven paragraf 2-38. Isolert betyr det at 12 prosent brutto blir 9,36 prosent netto dersom hele gevinsten realiseres løpende utenfor fritaksmetoden. Det gjør skatt til en parameter i strategivalget og ikke til en linje som føres opp etterpå.

Bildet er samtidig mer sammensatt enn den enkle todelingen antyder, og vi skriver ut hvorfor framfor å runde det av. Storbritannia er ikke lenger medlem av EØS, og Sveits har aldri vært det. De to utgjør en betydelig andel av et bredt europeisk aksjeunivers, som dermed får en effektiv sats i størrelsesorden 7 til 8 prosent i stedet for null. Samtidig er minimumskommisjonen på europeiske børser flere ganger høyere enn på amerikanske, og britiske aksjer belastes med 0,5 prosent stamp duty ved kjøp. Rangeringen mellom markedene avhenger derfor av ordrestørrelse, og den er ikke avgjort hos oss. Den europeiske kommisjonsulempen er ikke målt, og markedsvalget står som en åpen post.

Lav betalt skatt er ikke i seg selv et godt tegn. Momentumstrategien i materialet vårt betalte 3 075 dollar i skatt der multifaktorstrategien betalte 6 934. Grunnen er at den første framførte tap i 23 av 28 år. Skatten var lav fordi den tapte penger.

03

Utvelgelse

Hva som må være sant før noe får kapital, og hvorfor det beste resultatet i et rutenett er det minst troverdige.

Utvelgelse er to forskjellige oppgaver hos oss, og de har ulike beviskrav. En regelbasert strategi lar seg spesifisere fullt ut og kjøres om igjen, og da kan kriteriene settes i tall før målingen. En enkeltselskapsvurdering lar seg ikke det, og da flyttes kravet over på forutsetningene.

Porten for en systematisk strategi

Kriteriene skrives i koden før første kjøring og endres ikke etterpå. Det er ikke formalisme. Uten forhåndsdefinerte kriterier blir enhver måling en fortelling, fordi terskelen alltid kan flyttes til der resultatet havnet. Fire krav gjelder:

Et parametersveip, ikke et punkt.
En strategi kjøres over hele rommet av rimelige parametervalg. Et enkeltresultat forteller ingenting om det er en egenskap ved konstruksjonen eller ved det tallet som tilfeldigvis ble valgt.
En deling i første og andre halvdel.
Sammenhengen mellom hva som virket i første del av perioden og hva som virket i andre, måles eksplisitt. Er den svak eller negativ, måler rutenettet regime og ikke kvalitet.
Kostnader, skatt og oppgjør i simuleringen.
Ikke som et påslag til slutt, men i hver enkelt handel, med T+1-oppgjør og skatteberegning per år.
En eksplisitt vurdering av om funnet er større enn støy.
Med et månedlig standardavvik på 3 prosentpoeng i differansen kreves langt flere enn 326 observasjoner for å påvise et par prosentpoeng. 27 år er mye i praksis og lite statistisk.

Den første strategien vår som besto en formell robusthetstest, viser samtidig hvor lite det er verdt. Faktorrotasjonen ga positiv Sharpe i 12 av 12 parameterkombinasjoner, med et standardavvik på 0,148 mot et snitt på 0,411, og verste fall innenfor terskelen. Robust per definisjonen. Men bare 4 av 12 slo kjøp-og-hold på Sharpe, gjennomsnittlig avkastning var lavere enn referansens, og korrelasjonen mellom Sharpe i første og andre halvdel var 0,25. Standardvalget vårt hadde en Sharpe på 0,82 i første halvdel og minus 0,09 i andre. Robust betydde her at strategien ikke kollapser i parameterrommet, ikke at den har en påvist fordel.

Multifaktorstrategien ble kjørt gjennom det samme apparatet, med 30 kombinasjoner av fem vektsett og tre porteføljestørrelser, med og uten sektornøytralisering. Tre av fire kriterier ble innfridd. Det fjerde ble brutt av halve rutenettet. Og den avgjørende målingen er denne. Korrelasjonen mellom Sharpe i første og andre halvdel er minus 0,72.

Minus 0,72 er ikke fravær av sammenheng. Det er en invers sammenheng. Kombinasjonen som gjorde det best i første halvdel, rangerte nummer 29 av 30 i andre. Et valg tatt midtveis i perioden ville systematisk pekt feil vei, og det er det sterkeste enkeltargumentet vi har mot å velge en konfigurasjon på historiske data.

Mekanismen er ikke støy, og den er synlig. Verdi og kvalitet ledet fra 1999 til 2012. Momentum ledet fra 2013 til 2026. Rutenettet måler i stor grad hvilket faktorregime hver halvdel tilhørte. Én kombinasjon i hele materialet slår indeksen, nemlig kvalitet pluss verdi med 25 navn, med 9,27 mot 8,46 prosent årlig og en grunnere drawdown. Den er ikke forfremmet, og grunnen er at den ble valgt etter at alle tretti var kjørt. Å plukke den ville vært å gjøre nøyaktig det materialet dokumenterer at man ikke skal gjøre.

Dette er det samme problemet som litteraturen kaller multippel testing. Harvey, Liu og Zhu (2016) gjennomgår hundrevis av publiserte faktorer og konkluderer med at en t-verdi på 2,0 ikke lenger er en meningsfull terskel når antallet forsøk er stort, og foreslår omtrent 3,0. Bailey og medforfattere (2014) formaliserer det samme som en justert Sharpe-ratio, der den forventede høyeste Sharpen fra N tilfeldige forsøk trekkes fra. Poenget er enkelt når det først er sagt. Den beste ruten i et rutenett er ikke et estimat. Den er en ordensstatistikk.

Hvordan selve scoren er bygget

Multifaktorscoren bruker åtte mål fordelt på tre blokker, altså kvalitet målt ved egenkapitalavkastning, bruttofortjeneste mot eiendeler etter Novy-Marx (2013) og gjeldsgrad, verdi målt ved fire ulike yields, og momentum målt som avkastning over tolv måneder eksklusiv siste måned. Et selskap må ha ferske verdier i tolv fundamentalfelter for i det hele tatt å bli rangert, og kvalifiseringen skjer i datalaget før strategien ser universet. Et selskap som faller ut, havner i en eksklusjonsliste med begrunnelse.

Verdi skrives som yield, ikke som multippel.
En multippel med negativ nevner snur fortegn. Et selskap som taper penger får negativ pris mot fortjeneste, og i en sortering på lavest først havner det øverst, som universets billigste selskap. Feilen er stille, og den rammer nøyaktig de selskapene et verdifilter skal luke bort. Det samme gjelder gjeldsgrad på negativ egenkapital og driftsresultat mot enterprise value når selskapet har mer kontanter enn markedsverdi. Begge settes til manglende framfor å bli lest som et kvalitetstegn.
Målene blir rangpersentiler, ikke z-scorer.
Fundamentale forholdstall har tunge haler. Én egenkapitalavkastning på 400 prosent, fra et selskap med nesten ingen bokført egenkapital, flytter både gjennomsnitt og standardavvik nok til å endre hele blokkens scorer. En rangering bryr seg om rekkefølgen og ikke om avstanden.
Rangeringen skjer innenfor bransjegruppe.
Uten det blir verdiblokka i praksis et sektorveddemål. Banker har strukturelt lav pris mot bokført egenkapital og programvare strukturelt høy, og en ren tverrsnittsrangering ville fylt porteføljen med finans i enhver periode.
Alle mål orienteres til høyere er bedre ett sted i koden.
Spredt sorteringsretning er den mest sannsynlige kilden til en fortegnsfeil som ingen test fanger, fordi et snudd fortegn gir et fullt gyldig resultat.

Valget av bransjeinndeling er begrunnet i en måling framfor i en preferanse. Ingen av de tilgjengelige klassifiseringene har historikk, så stabilitet over tid kan ikke måles direkte. Det som kan måles, er hvor mye selvstendig skjønn hver av dem inneholder, målt mot bransjekoden selskapet selv rapporterer til myndighetene. To av inndelingene er i praksis deterministiske funksjoner av den koden. Den tredje er det ikke, og 58,4 prosent av kodene fordeler seg der på flere sektorer, noe som berører 86 prosent av selskapene. Den bærer altså redaksjonelt skjønn som kan revideres uten spor, og en revisjon ville endret en historisk backtest. Valget falt på Fama-French tolv industrier, som arver kodens stabilitet og kan siteres.

Ett funn fra konstruksjonen er verdt å ta med, fordi det er den typen feil som ikke gir seg til kjenne. Blokkvektene er like i koden. De er ikke like i porteføljen. Momentum er ett enkelt mål mens kvalitet og verdi er gjennomsnitt av tre og fire mål hver, og et gjennomsnitt av flere rangeringer trekker mot midten. Målt på tvers av alle rangerte navn er hvert enkeltmål like spredt, med standardavvik 0,289, mens blokkene ikke er det, omtrent 0,19 for kvalitet, 0,20 for verdi og 0,289 for momentum. Regnet på spredningen alene tilsvarer det en effektiv vekt på omtrent 42 prosent til momentum mot 29 prosent til hver av de to andre. Lik vekt i koden var ikke lik vekt i porteføljen, og ingen hadde bestemt at den ikke skulle være det.

Enkeltselskaper

For et enkeltselskap er spørsmålet ikke om det finnes en statistisk fordel, men om forutsetningene i verdsettelsen er de vi faktisk tror på. Utgangspunktet er kapitalavkastning mot avkastningskrav. Vekst skaper bare verdi når avkastningen på investert kapital er høyere enn kapitalkostnaden. Er den lavere, ødelegger vekst verdi, og selskapet er bedre tjent med å dele ut pengene. Veksten selv er ikke en antakelse man setter fritt, den er en konsekvens av hvor mye som reinvesteres og hvor godt det reinvesteres.

Den praktiske følgen er at en kontantstrømsverdsettelse i hovedsak er en påstand om hvor lenge en meravkastning varer, ikke en påstand om neste års omsetning. Terminalverdien utgjør typisk mesteparten av verdien i en slik modell, og terminalverdien er i sin helhet en antakelse om hvor raskt konkurransen spiser fortrinnet. Vi skriver derfor ut fadeprofilen som et eget valg og viser hva verdien blir under alternative profiler, framfor å levere ett tall.

Balansen leses før resultatet. Netto rentebærende gjeld, forfallsstruktur, lånevilkår og arbeidskapitalbinding avgjør om selskapet i det hele tatt får velge tidspunkt for sine beslutninger. Og resultatkvaliteten leses mot kontantstrømmen. Sloan (1996) dokumenterte at den delen av resultatet som består av periodiseringer framfor kontanter, er systematisk mindre varig enn den delen som er kontanter. Et resultat som ikke følges av kontantstrøm er et resultat med kortere levetid, uansett hvor pent det ser ut.

04

Måling

Hvorfor de fleste backtester er feil, og hvordan feilen ser ut når den ikke gir seg til kjenne.

Et backtestresultat er i stor grad en egenskap ved måleapparatet. Det er den mest overførbare lærdommen fra arbeidet vårt, og den er også grunnen til at denne seksjonen er lengre enn seksjonen om resultater. Et apparat man kjenner svakhetene til, er mer verdt enn et resultat man ikke kan etterprøve.

Look-ahead, altså at strategien får se informasjon som ikke fantes på handelstidspunktet, har tre kilder for en strategi som opererer på enkeltaksjer. Prisdata er den åpenbare. De to andre er restatements, altså at regnskapstall senere korrigeres og at den korrigerte versjonen leses tilbake i tid, og publiseringsforsinkelse, altså at et tall gjøres tilgjengelig fra periodeslutt i stedet for fra faktisk publiseringsdato. En fjerde og beslektet feilkilde er universkonstruksjon, der selskaper som senere ble avnotert utelates fra de periodene de faktisk var indeksmedlemmer.

Rammeverket vårt håndhever dette gjennom en kontrakt. Enhver forespørsel må oppgi en beslutningsdato, kun observasjoner som var tilgjengelige på eller før den datoen returneres, kun opprinnelig rapporterte verdier er synlige, og universet bygges på historisk indeksmedlemskap. Manglende data gir eksplisitt feilmelding i stedet for tomt resultat, slik at fravær ikke kan forveksles med en gyldig observasjon.

Hva kontrakten gjør, på ett selskap

Lehman Brothers var medlem av S&P 500 til og med snapshottet 30. juni 2008 og begjærte seg konkurs 15. september samme år. På beslutningsdatoen 30. juni svarte kontrakten med en egenkapitalavkastning på 15,4 prosent, et resultat på 3 461 millioner dollar og en egenkapital på 24 832 millioner dollar. De to foregående årene ga 20,5 og 21,2 prosent. En kvalitetsrangering den dagen skulle plassert Lehman blant de bedre navnene i universet.

Det er det riktige svaret, fordi det var informasjonen som forelå. Eksempelet viser samtidig publiseringsforsinkelsen konkret. Tallene som var tilgjengelige 30. juni 2008, gjaldt regnskapsperioden som endte 29. februar og ble tilgjengelige 9. april. De var 82 dager gamle på beslutningsdatoen. Å filtrere på periodeslutt i stedet for tilgjengelighetsdato ville gitt strategien tall den ikke kunne ha sett.

Prisen på gratis data, målt

Påstanden om at gratis datakilder ikke holder til dette, er testet direkte mot et kommersielt punkt-i-tid-datasett. Utvalget er 120 tilfeldig trukne indeksmedlemmer per medlemsdato, til sammen 311 unike symboler. Andelen av datidens medlemmer som den gratis kilden i dag ikke har noe som helst på, faller monotont med alderen på medlemskapet.

MedlemsdatoUtvalgManglerAndel
30.06.20051205445,0 %
30.06.20151202420,0 %
30.06.2022120108,3 %
Mellom 92 og 96 prosent av de manglende selskapene er avnoterte. Dette er survivorship i sin reneste form.

En backtest fra 2005 bygget på den kilden ville manglet nesten halve universet, og de manglende er systematisk de som gikk dårligst. I tillegg viser kilden feil versjon av regnskapstallene. Blant de 42 observasjonene der det kommersielle datasettet selv har registrert en korreksjon, viser den gratis kilden den korrigerte verdien i 27 tilfeller, altså 64,3 prosent, og den opprinnelig rapporterte i 11. Treffene er eksakte. Kilden leverer nøyaktig det tallet selskapet oppga senere.

To feil samtidig, og begge trekker samme vei. Universet mangler taperne, og der en korreksjon finnes, vises den reviderte versjonen. Den første gir for høy avkastning. Den andre gir for gode faktorverdier. Ingen av dem gir seg til kjenne i resultatet. Begge ser ut som en bedre strategi.

Hvor mye korreksjoner betyr, er målt på datasettets egen as-reported-dimensjon. Av 91 740 regnskapsperioder har 1 321 mer enn én innsending, altså 1,44 prosent. Målt per selskap er 724 av 1 159 berørt minst én gang, altså 62,5 prosent. Kontrasten mellom de to andelene er poenget. Korreksjoner er sjeldne per periode og nesten universelle over et selskaps levetid. En backtest som leser korrigerte tall, får derfor ikke en liten og jevnt fordelt feil. Den får riktige tall for de fleste periodene, og systematisk for gunstige tall for nettopp de periodene der noe gikk galt.

Tyco Internationals resultat for kvartalet som endte 31. mars 2002 ble innsendt 15. mai som pluss 1 400 millioner dollar og korrigert 12. juni til minus 3 113 millioner. En kvalitetsfaktor beregnet på korrigerte tall ville rangert selskapet korrekt som et av universets svakeste våren 2002. Den rangeringen fantes ikke da beslutningen skulle tas.

Grønne tester som ikke tester noe

En testsuite kan være grønn på en regel den aldri utøver. Det er ikke en teoretisk bekymring, og den eneste måten å avdekke det på er å innføre kjente feil i koden med vilje, én om gangen, og verifisere at riktig test faktisk blir rød. Øvelsen er kjørt i tre runder hos oss, med 6, 13 og 11 innførte feil. I den siste runden gikk 4 av 11 gjennom uten en eneste rød test i første forsøk. Ingen av de elleve kaster feilmelding. Alle gir et gyldig, men galt, resultat.

Feil dato.
Testen på restatements besto selv når versjonsfilteret ble fjernet helt, fordi den spurte på en dato der korreksjonen ennå ikke var publisert. Regelen var utestet, med en grønn suite som sa det motsatte.
Feil oppløsning.
Mutasjonen som regnet momentum på ujustert kurs ga null røde tester. Testen fantes, men toleransen var 0,03 mens den faktiske forskjellen for testselskapet var 0,026. Riktig størrelse målt med en oppløsning som ikke skilte riktig fra galt.
Feil lag.
Testen på sektornøytralisering viste at funksjonen nøytraliserer riktig når den får sektorgrupper. Den sa ingenting om hvorvidt strategien faktisk sender grupper. En test på en ren funksjon tester funksjonen, ikke at den brukes.
Dokumentasjon mot kode.
Rutinen for årsoppgjør av skatt hentet årets realiserte gevinst ut av bøtta og solgte deretter unna nok til å dekke kravet. Gevinsten fra de salgene ble skrevet tilbake til en bøtte som allerede var tømt. Over 200 000 dollar gikk ubeskattet. Modulens egen dokumentasjon beskrev riktig oppførsel presist. Ingen sluttall så feil ut.

To lærdommer fra øvelsen er verdt mer enn feilene den fant. Antall røde tester er et dårlig mål på hvor alvorlig en feil er. Å fjerne versjonsfilteret ga én rød test, mens å filtrere på periodeslutt i stedet for tilgjengelighetsdato ga ni, og de to feilene er like ødeleggende. Den som prioriterer etter dekningstall, vil feilprioritere.

Og en aggregert kontroll kan ikke erstatte et konkret tilfelle valgt fordi det er ekstremt. Mutasjonen som beregnet markedsverdi på ujustert kurs besto den brede testen på 400 selskaper med 85 prosent treffkrav, fordi store selskaper sjelden reverssplitter. Bare den smale testen ble rød, den som kontrollerer ett selskap valgt nettopp fordi det reverssplittet med faktor 240. Halen er ikke tilfeldig. Det er nettopp små og kriserammede selskaper som reverssplitter, og feilen ville konsekvent fått dem til å se billige ut.

Den mest lærerike feilen ble ikke funnet av noen test. Porteføljemotoren traff rebalanseringsdatoen med eksakt likhet mot handelskalenderen, og falt datoen på en helg eller helligdag, ble rebalanseringen hoppet over uten logglinje. Det gjaldt 16 av 55 datoer, altså 29 prosent. Feilen ble oppdaget fordi antall rader i en resultatfil ikke stemte med antall datoer oppgitt i teksten. To ting ved den er verdt mer enn feilen selv. Den hadde retning, og gjorde momentumstrategien 1,16 prosentpoeng bedre enn den er. Og den snudde en konklusjon, fordi effekten av rangeringsbåndet ble målt til minus 0,12 prosentpoeng med 39 rebalanseringer og pluss 0,45 med alle 55. Et funn om en mekanisme er også et funn om hvor ofte mekanismen får virke.

Grensen for hva kontrollene kan si, står også skrevet. Kontrakten garanterer at et tall var kjent på beslutningsdatoen, ikke at det er riktig. Feil fortegn, feil valuta, feil skalering eller et nøkkeltall beregnet på en annen definisjon enn antatt passerer uhindret. Kvalitetskontroll av selve verdiene er en separat oppgave og en selvstendig risiko.

05

Risiko

Hva som faktisk produserer de store fallene, og hvor lite tre stressepisoder kan bære.

Risiko er ikke det samme som volatilitet, men volatilitet har en målbar pris, og den er regnet ut i seksjon 02. Det som avslutter en strategi i praksis, er likevel ikke svingningene. Det er fallet, og lengden på tiden under vann.

I materialet vårt er kilden til de store fallene identifisert, og den er ikke den man skulle tro. Vi kjørte den samme strategien i en trapp, der én mekanisme legges til om gangen, slik at bidragene lar seg skille fra hverandre.

StegVolatilitetMaks fallSharpeCAGR
Ren momentum, ingen bransjespredning31,63 %−86,23 %0,2934,32 %
Med rangering innenfor bransje24,00 %−58,23 %0,3295,11 %
Med kvalitet og verdi i tillegg21,91 %−58,00 %0,3946,40 %
Sektorbåndet alene tar volatiliteten ned 7,63 prosentpoeng og fallet opp 27,99. De fundamentale blokkene legger 2,09 og 0,24 til. Bransjespredning står for 99 prosent av forbedringen i fall og 79 prosent i volatilitet.

Det er en korreksjon av det bildet man ville tegnet uten trappen. Risikoreduksjonen som skiller multifaktor fra ren momentum kommer i hovedsak fra å spre porteføljen over bransjer, ikke fra å velge selskaper på regnskapstall. En konsentrert momentumportefølje på femten navn havner i én bransje om gangen, og det er dét som gir fall på 86 prosent.

Vi testet også om det er den faktiske bransjeinndelingen som virker, eller bare det å fordele porteføljen over tolv grupper uansett hvilke, ved å stokke gruppemerkelappene tilfeldig med fem frø og ellers kjøre identisk. Tilfeldige grupper reproduserer 19 prosent av effekten på fall og 30 prosent av effekten på volatilitet. Fire femtedeler av fallreduksjonen krever altså at gruppene faktisk er bransjer.

Den praktiske konsekvensen er den mest anvendbare enkeltopplysningen i hele arbeidet. Sektornøytralisering krever ingen fundamentaldata. Den krever bare en bransjeklassifisering utledet av en offentlig innrapportert kode, og den leverer nesten hele fallreduksjonen. Det kommersielle datasettet, som er den klart største kostnaden i oppsettet, betaler for de resterende prosentene.

Hver strategi har sin egen måte å bryte sammen på

Beholdningene i de tre stressepisodene viser at strategiene gjorde nøyaktig det de er bygget for. I juni 2000 eide momentumstrategien AMD, Sun, Micron, Oracle og Siebel, altså navnene fra dot-com rett før fallet. I juni 2008 eide den energi og kull rett før råvarekollapsen. I desember 2020 eide den vekstnavn rett før korreksjonen i 2021. Momentum kjøper det som har steget, og konsentrasjonen gjør hver episode til et fullt sammenbrudd framfor et tilbakeslag. Mønsteret er kjent i litteraturen som momentumkollaps (Daniel og Moskowitz, 2016).

Verdi og kvalitet feiler motsatt vei, og det er like instruktivt. I juni 2000 eide multifaktorporteføljen jernbane, kjemi, forsikring, industri og en avis, og falt 5,5 prosent gjennom dot-com mot indeksens 41,6. Det er den ene episoden den håndterte godt, og den forklarer nesten hele meravkastningen over 27 år. I juni 2008 eide den derimot energi og råvarer sammen med fire forsikringsselskaper, altså selskaper som var billige på regnskapstall rett før både råvarekollapsen og finanskrisen traff nettopp de sektorene. Verdiblokka pekte inn i krisen i stedet for bort fra den.

Alle fallmålene i materialet vårt hviler i realiteten på tre observasjoner, altså 2000, 2008 og 2020. Multifaktorstrategiens fortrinn ble vunnet i én av dem. Et argument som hviler på én hendelse kan ikke styrkes ved å teste flere parametre på den samme hendelsen. Det er derfor neste steg for oss er et uavhengig utvalg og ikke flere varianter.

Konsentrasjon og posisjonsstørrelse

Parametersveipet ga to mønstre som gikk igjen på tvers av vektsett. Flere navn er bedre. 25 navn ga høyest gjennomsnittlig Sharpe i alle fem vektsettene og laveste fall i fire av fem, og rekkefølgen 25 foran 15 foran 10 var streng i fire av fem. Konsentrasjonen på femten navn koster, og den koster mest i volatilitet.

Det peker mot en generell holdning til posisjonsstørrelse. Kelly-kriteriet (Kelly, 1956) gir den innsatsandelen som maksimerer langsiktig vekst når fordelingen er kjent. Fordelingen er aldri kjent. Og feilen er asymmetrisk, siden det å satse for høyt ødelegger den geometriske avkastningen raskere enn det å satse for lavt koster i tapt oppside. Vi ligger derfor godt under enhver beregnet optimal andel, og betrakter avstanden ned som betaling for estimeringsusikkerhet.

Det skillet vi bryr oss mest om, er mellom varig tap av kapital og midlertidig fall i kurs. Det første kommer av gjeld, tvungent salg, svindel eller en forretningsmodell som forsvant. Det andre går over hvis man kan sitte. Vi bruker ikke gjeld til å øke eksponering, og vi har ingen som kan tvinge oss til å selge. Det er hele grunnen til at et fall er noe vi kan tåle framfor noe vi må unngå.

06

Oppfølging

Hva som utløser en endring, og hvorfor det ikke er kursen.

Handel er en kostnad. Det følger av seksjon 02, og det gjør oppfølging til en øvelse i å la være. Under proporsjonale kostnader er den optimale rebalanseringsregelen ikke en kalender, men et bånd. Man handler når posisjonen faller utenfor et intervall, og ikke ellers (Constantinides, 1986).

Vi bruker det konkret. En eid posisjon beholdes så lenge den ligger innenfor topp 23, selv om porteføljen bare holder 15 navn. Effekten er målt. Båndet ga 0,45 prosentpoeng høyere årlig avkastning i multifaktorstrategien og 0,15 i momentumstrategien, og turnover falt fra 313 til 284 prosent. 72 posisjoner ble beholdt utelukkende fordi de lå innenfor bufferen.

Ett detaljfunn står her framfor å bli glattet bort. I momentumstrategien økte båndet skatten, fra 2 625 til 3 075 dollar, samtidig som det økte avkastningen. Det er motsatt av mekanismen man skulle vente. En nærliggende forklaring er at varianten uten bånd realiserer flere tap, som ikke utløser skatt, men mekanismen er ikke målt, og skal derfor ikke framstilles som om den var det.

Tidspunktet for en handel er også en regel og ikke en vane. Faller en rebalanseringsdato på en helg eller helligdag, rulles den fram til første påfølgende handelsdag. Framover og ikke bakover, fordi rangeringen er beregnet per snapshotdato, og å utføre den på siste handelsdag før datoen ville vært å handle på informasjon som ikke fantes ennå. Konsekvensen er at årsskiftene utføres i januar, slik at gevinsten realiseres i neste skatteår. Det er riktig, siden handelen faktisk skjer da.

Når noe skal avvikles

Kriteriet for å avvikle skrives ned samtidig med at posisjonen tas, og det er formulert som noe som kan inntreffe framfor som et kursnivå. Uten det blir enhver nedgang en fortelling om hvorfor man skal sitte, og enhver oppgang en bekreftelse. Et kursfall er i seg selv ikke ny informasjon om selskapet. Det som er ny informasjon, er at en forutsetning som ble skrevet ned, ikke lenger holder.

Det samme gjelder rapporteringen av vårt eget arbeid. En konklusjon som endrer seg, får en merknad om hva som endret seg og hvorfor. Da rebalanseringsfeilen ble rettet, snudde konklusjonen om rangeringsbåndet fortegn, og både den gamle og den nye står skrevet. Et tall uten historikken sin er vanskeligere å stole på enn et tall som har vært feil én gang og er rettet.

07

Åpne poster

Det vi ikke har målt ennå, og hva som står for tur.

En metode er bare troverdig hvis den også oppgir hva den ikke har gjort. Fire poster står åpne, og de er skrevet ned her i samme form som de står i rapporten.

Faktorregresjonen er ikke kjørt.
Den ville vist om det som er igjen av avkastning i multifaktorstrategien er eksponering mot kjente faktorer, som kan kjøpes billigere gjennom indeksfond. Den kan ikke endre hovedresultatet, siden strategien allerede taper mot referansen, men den mangler.
Den europeiske kommisjonsulempen er ikke målt.
Minimumsbeløpene og stamp duty er kjent, men det er ikke kjørt en simulering på et europeisk univers med europeiske satser. Markedsvalget står derfor som en åpen metodisk post, og terskelen for å revurdere det bør beregnes framfor å anslås.
Verdiene i datasettet er ikke kvalitetskontrollert.
Kontrakten garanterer tidspunktet, ikke innholdet. Feil fortegn, valuta eller skalering, eller et nøkkeltall beregnet på en annen definisjon enn antatt, passerer uhindret.
Bransjeklassifiseringen mangler historikk.
Tabellen er et nåsnapshot, så et selskap som byttet bransje i 2007 bærer dagens verdi også i en rebalansering fra 1999. Retningen på skjevheten er kjent, og den er dokumentert framfor rettet.

Neste steg er ikke flere varianter på de samme 27 årene. Det er et uavhengig utvalg, altså et annet univers, og for oss er det dessuten det relevante universet, nemlig europeiske noteringer under fritaksmetoden. Det mest informative der er ikke en ny multifaktorvariant, men å kjøre den samme trappen på nytt, altså ren momentum, momentum med bransjespredning, og multifaktor. Holder fordelingen mellom leddene seg, er bransjespredning et generelt funn og fundamentaldataene et dyrt tillegg. Snur den, er dette utvalget forklart.

Det som uansett følger med videre, er rammeverket. Punkt-i-tid-kontrakten, porteføljemotoren med kostnads- og skattemodellering, og valideringsmetodikken er bygget for å bære andre strategier enn de som er testet. Enhver strategi som rangerer selskaper på regnskapstall, altså kjernen i fundamental analyse, kan kjøres gjennom det samme laget og arver dermed no-look-ahead, historisk indeksmedlemskap og eksplisitt friksjon. Det er den varige leveransen fra dette arbeidet.

Grunnlaget

Alle målinger på denne siden er hentet fra vår egen delrapport om systematiske handelsstrategier, som beskriver metodikken i sin helhet, oppgir alle parametervalg og lister kildene for det som er lånt fra andre.

Les rapporten →