Chuyển PDF sang văn bản online miễn phí

Chuyển tệp PDF sang văn bản online miễn phí. Tải tệp lên và nhận ngay kết quả sạch, sẵn sàng cho LLM. Không cần đăng ký, tối đa 50 MB, không lưu tệp.

Chuyển PDF sang văn bản thuần: dành cho lúc chính định dạng mới là vấn đề

Thử chạy diff trên hai file PDF xem. Không được đâu — chúng là file nhị phân, và ngay cả một tài liệu "y hệt" được xuất lại từ cùng một nguồn cũng khác nhau từng byte vì timestamp và thứ tự object. Giờ rút văn bản ra từ cả hai rồi diff chúng, và trong hai giây bạn biết chính xác ba câu nào đã thay đổi giữa bản sửa số 11 và bản sửa số 14 của hợp đồng.

Đó chính là lý do tồn tại của việc chuyển PDF sang văn bản thuần, gói gọn trong một câu. Không phải "Markdown nhưng kém hơn" — mà là một công cụ khác cho một việc khác. Văn bản thuần là thứ bạn đưa vào classifier, đánh index trong search engine, embed vào vector store, pipe qua grep, đếm từ trên đó, hay giao cho bất cứ thứ gì coi #| là ký tự cần parse chứ không phải để bỏ qua. Thả file vào công cụ chuyển đổi phía trên và bạn có kết quả trong vài giây. Miễn phí, không cần đăng ký, giới hạn 50 MB, phía chúng tôi không lưu gì cả.

Bạn được gì khi vứt bỏ hết markup

Kết quả trích xuất văn bản thuần là các con chữ theo đúng thứ tự đọc, và không gì khác. Không ký tự cú pháp, không quy tắc escape, không mập mờ chuyện dấu sao là nhấn mạnh hay là dấu sao thật. Với một số lượng pipeline nhiều đến bất ngờ, đó không phải là sự thỏa hiệp mà là yêu cầu bắt buộc:

  • Embedding và tìm kiếm ngữ nghĩa. Chia tài liệu thành từng đoạn, embed từng đoạn, truy xuất theo độ tương đồng. Dấu gạch đứng và dấu thăng của Markdown chẳng đóng góp gì cho ngữ nghĩa nhưng vẫn chiếm chỗ trong embedding — chúng làm loãng vector. Các đoạn văn xuôi sạch truy xuất tốt hơn.
  • Classifier và topic model. Bất cứ thứ gì làm bag-of-words, TF-IDF hay phân tích n-gram sẽ vô tư coi ### là một token trừ khi bạn lọc nó ra trước. Bỏ luôn bước lọc bằng cách đừng bao giờ đưa nó vào.
  • Đánh index tìm kiếm. Elasticsearch, SQLite FTS, tsvector của Postgres — tất cả đều muốn văn bản thô trong một cột. Dùng Markdown nghĩa là thêm một bước làm sạch nữa.
  • So sánh phiên bản. Diff theo dòng chạy tốt trên văn xuôi và tệ trên bảng, vì sửa một ô trong bảng Markdown sẽ làm reflow và viết lại cả hàng.
  • Tiết kiệm token. Nếu bạn dán một tài liệu dài vào model có context window chật hẹp, mỗi dấu gạch đứng là một token bạn trả tiền mà chẳng thu về gì.

Và bạn mất gì — nên biết ngay từ đầu

Việc làm phẳng có tính phá hủy, và đó là chủ ý. Có hai mất mát đáng kể hơn cả.

Bảng bị sụp đổ. Một bảng tài chính trở thành một chuỗi con số ngăn cách bởi khoảng trắng. Các giá trị vẫn còn đủ, nhưng cột mà mỗi con số thuộc về thì không, và không prompt nào khôi phục lại được. Nếu bảng biểu chính là trọng tâm của tài liệu, bạn nên dùng PDF sang Markdown thay thế, nơi bảng dạng pipe giữ nguyên hàng và cột.

Cấu trúc phân cấp biến mất. Tiêu đề mục và câu văn ngay dưới nó trở thành hai dòng liền kề chẳng có gì phân biệt. Hỏi model "tóm tắt mục 4" và nó phải tự suy ra mục 4 bắt đầu ở đâu chỉ từ câu chữ. Với tài liệu dài có cấu trúc — spec kỹ thuật, tiêu chuẩn, hợp đồng có điều khoản đánh số — chính phép suy đoán đó là chỗ câu trả lời trật đường ray.

Nút chuyển định dạng ở đầu trang này đổi qua lại giữa text và Markdown mà vẫn giữ nguyên file bạn đã chọn, nên chuyển cả hai chiều để so sánh chỉ tốn một cú click chứ không phải upload lại.

Những điểm kỳ quặc của PDF lộ ra trong kết quả text

PDF là ngôn ngữ mô tả trang in. Nó lưu các glyph tại tọa độ cụ thể, và trích xuất nghĩa là dựng lại câu văn từ đống đó. Vài "tác phẩm phụ" sinh ra từ chuyện này, và biết trước sẽ giúp bạn khỏi mất nửa tiếng ngơ ngác:

  • Xuống dòng cứng giữa câu. PDF không có khái niệm đoạn văn tự reflow — mỗi dòng hiển thị là một khối text riêng biệt. Vậy nên một đoạn văn đến tay bạn dưới dạng sáu dòng ngắn. Đây là cái bẫy lớn nhất khi làm việc với grep và regex: tìm một cụm từ chẳng may nằm vắt qua chỗ xuống dòng và bạn nhận về không kết quả nào cho đoạn text rành rành ở đó.
  • Dấu gạch nối ngắt từ vẫn còn nguyên. Một từ tiếng Anh bị tách qua hai dòng thành "manage-" / "ment" thường vẫn nằm tách như vậy. Đáng làm một lượt tìm-và-thay trước khi đếm từ hay trích xuất từ khóa.
  • Header lặp lại và số trang chen vào giữa. Tên công ty và "Trang 14 / 88" rơi vào giữa văn bản của bạn sau mỗi vài nghìn ký tự. Đọc thì vô hại, hơi phiền khi chia đoạn, và dễ lọc bằng một dòng regex khi bạn đã nhận ra quy luật.
  • Thứ tự cột có thể lẫn lộn. Bố cục hai cột kiểu bài báo khoa học thường được duỗi thẳng đúng thứ tự, nhưng sidebar trôi nổi, đoạn trích lớn và khối footnote đôi khi rơi vào giữa đoạn văn.
  • Chữ ghép và glyph lạ. "fi" và "fl" thường là một glyph duy nhất trong các file PDF dàn trang chuyên nghiệp. Phần lớn trích xuất bình thường. Một file PDF dựng bằng font subset thiếu bảng ánh xạ Unicode chuẩn có thể cho ra thứ trông như chữ vô nghĩa — hiếm gặp, nhưng khi xảy ra thì lỗi nằm ở file chứ không phải công cụ chuyển đổi.

PDF scan không có chữ nào để trích xuất

Một file PDF scan là tấm ảnh chụp giấy được bọc trong vỏ PDF. Chẳng có gì để rút ra ngoài pixel, và nhận dạng chữ không chui vào bên trong PDF được — file chỉ toàn ảnh sẽ trả về kết quả rỗng. (Upload đúng trang đó dưới dạng JPG hay PNG thì lại đọc được bình thường; xem chuyển ảnh sang văn bản. Chính cái vỏ PDF mới là thứ cản đường.) Bài kiểm tra mất hai giây: mở file lên và thử bôi đen một câu bằng con trỏ. Chữ được bôi đen — bạn ổn. Chỉ thấy một hình chữ nhật phủ cả trang — đó là bản scan.

Với bản scan, hãy chạy OCR trước — Acrobat, Preview trên macOS và hầu hết trình đọc PDF hiện đại đều có lệnh "nhận dạng văn bản" — rồi quay lại chuyển đổi. Chênh lệch chất lượng đầu ra không hề nhỏ đâu.

Những việc thực tế mà nó giải quyết

  • Xây corpus cho RAG. Hàng trăm file PDF chính sách chuyển thành text, cắt theo ranh giới đoạn văn, rồi embed. Text là định dạng mà mọi thư viện chunking mặc định mong đợi.
  • Soát thay đổi hợp đồng. Trích xuất hai phiên bản hợp đồng, chạy diff ở cấp độ từ, và đọc chính xác những gì đã sửa thay vì tin vào một email tóm tắt.
  • Rà soát tuân thủ và quét từ khóa. Grep cả thư mục báo cáo đã trích xuất để tìm một thuật ngữ đã định nghĩa, tên nhà cung cấp, hay một cụm từ lẽ ra không được có ở đó. Tức thì, offline, không cần công cụ nào ngoài shell.
  • Phân tích độ dễ đọc và văn phong. Phân bố độ dài câu, mật độ thuật ngữ chuyên ngành, điểm cấp độ đọc — tất cả đều cần văn xuôi sạch, không lẫn token định dạng trong luồng chữ.
  • Đưa vào text-to-speech. Trình đọc màn hình hay engine TTS sẽ vô tư đọc to "thăng thăng Giới thiệu" nếu bạn đưa cho nó Markdown.
  • Kiểm tra nhanh số token. Bộ đếm dưới phần kết quả cho bạn biết tài liệu "tốn" bao nhiêu trước khi dán đi đâu đó — hữu ích hơn nhiều so với việc phát hiện qua một lỗi cắt cụt context.

Câu hỏi thường gặp

Làm sao chuyển đổi file PDF sang text miễn phí?

Thả file vào công cụ chuyển đổi ở đầu trang này và văn bản trích xuất hiện ngay bên dưới. Không tài khoản, không email, không watermark trên kết quả. Giới hạn 50 MB mỗi file và không gì được lưu lại sau khi bạn đã có văn bản. Copy trực tiếp, hoặc tải về dưới dạng .txt.

Vì sao kết quả chuyển PDF sang text ra toàn ký tự vô nghĩa?

Gần như luôn do font, không phải do công cụ. Một file PDF dựng bằng font subset không kèm bảng ánh xạ Unicode chỉ lưu chỉ số glyph mà chẳng nói chúng đại diện cho ký tự nào, nên phép trích xuất trả các chỉ số đó về dưới dạng chữ cái lộn xộn. Nếu văn bản cũng không bôi đen được trong trình đọc PDF của bạn thì vấn đề nằm ở chính file — hãy xuất lại từ tài liệu gốc.

Có chuyển PDF scan sang văn bản được không?

Không trực tiếp được. Bản scan là tấm ảnh bọc trong PDF, bên trong không có ký tự nào để rút ra, nên kết quả trả về rỗng. Hai cách xử lý: chạy "nhận dạng văn bản" trong Acrobat hoặc Preview của macOS trước rồi mới chuyển đổi ở đây — hoặc xuất trang đó ra PNG và dùng chuyển ảnh sang văn bản, công cụ có chạy OCR trên pixel thật.

Vì sao văn bản trích xuất bị ngắt dòng giữa chừng câu?

PDF không có đoạn văn tự reflow — mỗi dòng hiển thị được lưu như một khối text riêng, nên một đoạn văn đến tay bạn thành sáu dòng ngắn. Điều này cắn đau nhất với grep và regex: cụm từ nằm vắt qua chỗ xuống dòng trả về không kết quả nào. Hãy nối các dòng không kết thúc bằng dấu câu cuối câu trước khi tìm kiếm.

Nên chuyển PDF sang txt hay sang Markdown?

Sang text nếu đích đến parse từ ngữ thô — embedding, index tìm kiếm, classifier, diff. Sang Markdown nếu hình khối của tài liệu mang ý nghĩa, vì bảng dạng pipe sống sót và tiêu đề vẫn được đánh dấu. Bảng biểu là yếu tố quyết định: làm phẳng một bảng tài chính thành text và cột mà mỗi con số thuộc về sẽ mất vĩnh viễn.

File PDF của tôi có bị upload lên server không?

File được gửi tới dịch vụ chuyển đổi, xử lý xong rồi vứt bỏ — không lưu trữ, không ghi log, không đánh index, và không gì được giữ lại sau khi phản hồi trả về. Nếu bạn cần kiểu chuyển đổi mà file thật sự không bao giờ rời khỏi máy, công cụ chuyển đổi thư mục local đọc file ngay trong trình duyệt.

Phần còn lại của bộ công cụ

PDF chỉ là một trong mười ba định dạng được hỗ trợ. File2Txt xử lý được tất cả từ một lần upload, hoặc đi thẳng tới Word sang văn bản cho file DOCX, HTML sang văn bản cho trang web đã lưu, EPUB sang văn bản cho sách điện tử, hoặc ảnh sang văn bản cho ảnh chụp màn hình. Làm việc với code? Chuyển một repository GitHub sang text, một dự án GitLab, hay một thư mục local. Với trang web đang chạy, Web2Txt cào trực tiếp từ URL. Còn hướng dẫn chuẩn bị tài liệu cho LLM trình bày bức tranh tổng quát của tất cả những chuyện này.

Repo2Txt được xây dựng và duy trì bởi v12hero, một lập trình viên độc lập chuyên làm ứng dụng native và web đặt quyền riêng tư lên hàng đầu.