Excel naar Markdown: spreadsheets omzetten in tabellen waar LLM over kan redeneren
Stel een taalmodel een vraag over een spreadsheet die je in raw hebt geplakt en je krijgt vaak antwoord dat is vol vertrouwen verkeerd over welke kolom welke is. Dat is niet het model dat dom is. Een spreadsheet is dat een coördinatenraster - cel B7 bevat een getal, en niets in het bestand zegt dat dat getal bij de hoort Kolom 'Omzet 3e kwartaal'. Mensen leiden dat af uit hun positie. Plak de waarden als een wirwar en het model moet dat doen leid dit ook af uit veel slechter bewijsmateriaal.
Converteren Excel naar Markdown lost dit op door een echte pijptabel te maken: een koprij, a scheidingsteken en vervolgens gegevensrijen uitgelijnd. Dat formaat is ondubbelzinnig over het kolomlidmaatschap, en modellen verwerken het Nou, omdat Markdown tabellen overal in hun trainingsgegevens voorkomen. Als je dat wilt converteer een Excel-bestand online naar een Markdown tabel, plaats een .xlsx of .xls in het vak hierboven. Gratis, geen account, plafond van 50 MB, niets behouden.
Hoe de uitvoer eruit ziet
Een werkmap is een verzameling werkbladen, en elk werkblad wordt een eigen sectie in de uitvoer, gelabeld met de tabbladnaam van het blad. Die etikettering is belangrijker dan het klinkt: ‘Aannames’, ‘Reële cijfers uit 2024’, en "Niet bewerken" heeft een echte betekenis over hoe om te gaan met de cijfers eronder, en een model dat kan zien de tabbladnaam zal deze gebruiken.
Binnen elk blad wordt de eerste ingevulde rij behandeld als koptekst, gevolgd door het uitlijningsscheidingsteken rij, waarna elke gegevensrij wordt weergegeven met pijpscheidingstekens. Het resultaat ziet er als volgt uit in de structuur: kolom namen bovenaan, waarden eronder, één record per regel. Zodra uw gegevens deze vorm hebben, je kunt kolomgewijze vragen stellen: "welke regio's zijn met meer dan 10 procent gegroeid", "zoek rijen waar de status is geblokkeerd en eigenaar is leeg" - en het model heeft genoeg om daadwerkelijk te controleren in plaats van te raden.
Formules, waarden en wat u werkelijk krijgt
Deze verrast mensen. Een .xlsx slaat twee dingen op voor een formulecel: de formule zelf
(=SUMIF(D:D,"North",F:F)) en het laatst berekende resultaat, opgeslagen in de cache vanaf het moment dat Excel voor het laatst bestond
herberekend. Conversie leest de in de cache opgeslagen waarde. Jij krijgt 184.500, niet de SUMIF.
Dat is de juiste standaard – het getal is waar je over wilt redeneren – maar het heeft twee consequenties vasthouden. Ten eerste kan het model zien wat het antwoord is maar niet hoe het was afgeleid, dus het kan uw logica niet controleren of een gebroken bereik ontdekken. Ten tweede of een bestand is gegenereerd door een script of een export tool die formules schreef zonder Excel ooit te openen, de in de cache opgeslagen waarden ontbreken mogelijk of zijn verouderd, en die cellen kunnen leeg of verkeerd doorkomen. Open het bestand, laat het opnieuw berekenen, sla het op en converteer het. Duurt tien seconden en sluit een hele categorie van verwarring uit.
De dingen die tafels breken
Markdown tabellen zijn rigide: elke rij moet hetzelfde aantal kolommen hebben. Spreadsheets zijn daar niet rigide in allemaal. Die mismatch is waar bijna elke rommelige conversie vandaan komt.
- Samengevoegde cellen. Een samengevoegde cel slaat de inhoud ervan op in de cel linksboven van het samenvoegbereik en laat de rest werkelijk leeg. Een titel samengevoegd over A1:F1 wordt één waarde gevolgd door vijf blanco's, en als dat uw eerste rij is, wordt deze gelezen als uw koptekst. Samengevoegde categorielabels aan de zijkant van een rapport levert een waarde op voor de eerste rij van de groep en niets voor de rest.
- Kopteksten met meerdere rijen. De klassieke '2024' met drie kolommen boven 'Q1 / Q2 / Q3' layout heeft geen representatie in een Markdown tabel. Eén van die rijen wordt de koptekst en de andere wordt een gegevensrij vol kwartaalnamen.
- Lege afstandsrijen en -kolommen. Visuele ademruimte in Excel wordt lege rijen en naamloze kolommen in de uitvoer, die stilletjes tokens verbruiken en de tabel verdunnen.
- Gegevens beginnen niet bij A1. Een logo in de hoek, een briefje in rij 2 en de eigenlijke tabel beginnend bij rij 6 – de converter kan niet weten dat rijen 1 tot en met 5 decoratie waren.
- Meerdere tabellen op één blad. Drie afzonderlijke blokken naast elkaar worden één heel breed, grotendeels leeg raster.
De oplossing voor al deze problemen is hetzelfde en het is saai: maak vóór het converteren een kopie van het blad met één blad koprij bovenaan, één tabel per blad, geen samenvoegingen, geen afstandsrijen. Twee minuten opruimen is meer waard dan welke slimme prompt daarna ook.
Datums, cijfers en waarom uw mobiel 45231 zegt
Excel slaat datums niet op als datums. Het slaat een serienummer op dat de dagen vanaf een tijdperk telt, en dat ding
Zie je – 15/03/2024, of 24 maart, of vrijdag – is een weergaveformaat dat er bovenop ligt. Conversie leest de
onderliggende waarde, zodat datumkolommen als kale gehele getallen kunnen verschijnen als de opmaak niet wordt overgenomen.
Als datums van belang zijn voor uw analyse, forceer ze dan in ondubbelzinnige tekst voordat u converteert: voeg een kolom toe met
=TEXT(A2,"yyyy-mm-dd") en gebruik dat. ISO-formaat verwijdert ook het Brits-versus-Amerikaans
dag/maand-ambiguïteit die stilletjes de datumredenering verpest.
Getalnotatie werkt op dezelfde manier. Een cel met € 1.250,00 of 12,5% bevat 1250 en 0,125. Percentages aankomen als decimalen is het specifieke dat mensen laat struikelen – een model dat wordt verteld waarden boven de 10 te vinden vind niets in een kolom van 0,125s. Als de eenheid niet duidelijk is, plaats deze dan in de kolomkop in plaats van afhankelijk van het celformaat: "Groei (%)" of "Omzet (GBP)".
Breedte, tokens en weten wanneer je moet stoppen
Markdown tabellen kosten meer tokens dan dezelfde gegevens in platte vorm, omdat elke rij betaalt voor zijn scheidingstekens. Grof gezegd voegt elke kolom een pijp en wat opvulling toe aan elke afzonderlijke rij, dus een kolom van 40 kolommen Een blad met 5.000 rijen besteedt een aanzienlijk deel van zijn budget aan interpunctie voordat er ook maar één waarde wordt gelezen. Brede lakens zijn waar xlsx naar Markdown conversie gaat van nuttig naar onbetaalbaar.
Twee gewoonten houden dit onder controle. Verwijder de kolommen die u niet nodig heeft voordat u gaat converteren; de meeste exports zijn aanwezig twintig velden waar uw vraag vier raakt. En bekijk de tokenteller onder de uitvoer; het vertelt je meteen of het resultaat past in het contextvenster van uw model of dat u eerst moet filteren. Als het blad enorm groot is en de vraag geen kolomuitlijning vereist, Excel naar platte tekst is het goedkoper route, en de schakelaar bovenaan deze pagina brengt uw bestand ernaartoe.
.xlsx, .xls en CSV
Moderne .xlsx-bestanden zijn ZIP-archieven van XML – goed gestructureerd en betrouwbaar om te parseren. Legacy .xls is een binair bestand formaat uit het tijdperk van vóór 2007, en het wordt hier nog steeds afgehandeld, maar het is de moeite waard om te weten dat het uitkomt op 65.536 rijen en 256 kolommen, en dat bestanden die uit oude boekhoud- of ERP-systemen worden geëxporteerd soms op leunen eigenaardigheden die niet perfect overleven. Als u de keuze heeft, sla dan eerst opnieuw op als .xlsx.
Als uw gegevens als CSV zijn begonnen, sla Excel dan helemaal over: ga naar CSV naar Markdown in plaats daarvan. Eén minder format hop, geen risico dat Excel uw productcodes behulpzaam in datums omzet of de leidende waarden verwijdert nullen van postcodes bij import.
Veelgestelde vragen
Hoe verander ik een Excel-spreadsheet in een Markdown tabel?
Upload de .xlsx of .xls hierboven en elk blad komt terug als een pipe-tabel die u in een README, een wiki, een pull-verzoek of een modelprompt kunt plakken. Gratis, 50 MB per bestand, geen account. De koprij blijft een koprij, dus de uitlijning overleeft de reis.
Blijft de uitlijning van de koprij en kolom behouden?
Ja, en dat is de hele reden om hier Markdown te verkiezen boven platte tekst. In een pijptabel wordt bijgehouden welke waarde onder welke rubriek valt, zodat een assistent die deze leest, correct kan antwoorden "wat was het cijfer van maart voor de EMEA-regio". Maak hetzelfde vel plat tot tekst en die vraag wordt onbeantwoordbaar.
Wat gebeurt er met samengevoegde cellen en kopteksten met meerdere rijen?
Ze worden ongemakkelijk plat. Markdown pipe-tabellen hebben precies één koprij en geen concept van een cel die twee kolommen beslaat, dus een rapport met een samengevoegde banner 'Q1 2026' boven drie subkolommen verliest de banner. Spreadsheets die zijn gebouwd als schone rechthoekige gegevens worden perfect geconverteerd; vellen die er goed uitzien wanneer ze worden afgedrukt, moeten meestal handmatig worden gerepareerd.
Zal een zeer breed spreadsheet nog steeds leesbaar zijn?
Voor een machine leesbaar, voor een mens onaangenaam. Een blad met veertig kolommen wordt een pijptabel met veertig kolommen en regels van enkele duizenden tekens. Modellen analyseren het prima. Als iemand het moet lezen, transponeer het blad dan eerst in Excel of verklein het tot de kolommen die er toe doen voordat u het converteert.
Kunnen diagrammen en draaitabellen worden geconverteerd?
Nee. Diagrammen zijn tekenobjecten zonder tekst, en de uitvoer van een draaitabel wordt geconverteerd als de cellen die momenteel worden weergegeven, in plaats van als een live draaipunt. Wat je krijgt is het onderliggende raster van waarden, wat je meestal toch al aan een model wilde overhandigen.
De rest van de gereedschapskist
Spreadsheets arriveren meestal gekoppeld aan iets anders. File2Txt verwerkt elk ondersteund formaat vanaf één enkele pagina, en de buren die het waard zijn om te kennen zijn PDF naar Markdown voor financieel rapporten, PowerPoint naar Markdown voor het kaartspel waarin de nummers terechtkwamen, en JSON naar Markdown wanneer dezelfde gegevens kwam in plaats daarvan uit een API.
Aan de codekant is er de GitHub opslagplaats naar tekstconverter en een lokale mapconverter, plus Web2Txt voor webpagina's. De gids voor het voorbereiden van bestanden voor LLM's gaat breder dan spreadsheets als je het overzicht wilt.
Repo2Txt is gebouwd en onderhouden door v12hero, een onafhankelijke ontwikkelaar die native- en web-apps bouwt die privacy voorop stellen.