ZIP thành văn bản: Biến kho lưu trữ thành một kho văn bản có thể tìm kiếm được
Công cụ này được tạo ra cho một thời điểm cụ thể. Bạn có một kho lưu trữ — một bản xuất, một bản sao lưu, một gói ai đó đã gửi - đầy tài liệu với nửa tá định dạng và điều bạn thực sự cần không phải là đọc chúng. Bạn cần phải tìm kiếm trên tất cả chúng cùng một lúc. Đếm tần suất một thuật ngữ xuất hiện. Đưa rất nhiều vào một nhúng mô hình. Tìm ba tệp trong số tám mươi tệp đề cập đến một mệnh đề cụ thể.
Tải tệp ZIP lên, lấy lại một nội dung văn bản thuần túy phẳng chứa mọi thứ có thể đọc được bên trong nó. Không có tiêu đề, không có bảng ống, không có ký tự cú pháp - chỉ bằng văn xuôi, bạn có thể grep, lập chỉ mục, phân đoạn hoặc dán. miễn phí, không có tài khoản, giới hạn 50 MB trên kho lưu trữ, không có gì được lưu trữ khi bạn đã có kết quả đầu ra.
Một kho lưu trữ vào, một kho dữ liệu ra
Kho lưu trữ được giải nén, cây bên trong được duyệt và mọi tệp có phần mở rộng được hỗ trợ sẽ được chuyển đổi
với cùng một logic, nó sẽ được tải lên độc lập. Sau đó tất cả quay lại với nhau và liên tục
văn bản. Đường dẫn thư mục từ bên trong kho lưu trữ được chuyển qua, do đó bạn vẫn có thể biết rằng có nội dung nào đó đã đến
từ exports/2023/ thay vì drafts/ - nhưng bản thân đầu ra phẳng, đồng đều,
và dễ gia công cơ học.
Đối số hiệu quả tự tạo ra. Bốn mươi tài liệu được chuyển đổi riêng lẻ là bốn mươi lần tải lên và bốn mươi hoạt động clipboard. Như một người độc thân chuyển đổi tập tin hàng loạt sang văn bản, đó là một. Và bởi vì mọi thứ đều tập trung vào một đầu ra, không cần bước lắp ráp lại sau đó — không cần lo lắng về việc liệu bạn có dán tập tin 23 hai lần và bỏ qua 24.
Tại sao Văn bản phẳng lại tốt hơn Markdown cho công việc hàng loạt
Markdown kiếm được lợi nhuận khi con người đọc kết quả đầu ra hoặc khi cấu trúc tài liệu mang ý nghĩa. Đối với hầu hết những việc bạn sẽ làm với toàn bộ kho lưu trữ cùng một lúc, đều không áp dụng và việc đánh dấu sẽ trở thành chi phí chung:
- Nhúng và đường ống RAG. Chunkers làm việc trên văn xuôi. Bảng ống và điểm đánh dấu tiêu đề bị phân chia theo các ranh giới khối, làm loãng tín hiệu ngữ nghĩa trong mỗi vectơ và tiêu tốn ngân sách nên đi đến nội dung thực tế. Hầu hết các dải mã nhập Markdown đều là bước đầu tiên — hãy bắt đầu không có nó.
- Lập chỉ mục tìm kiếm. Dù bạn đang cho ăn gì, người làm mã thông báo cũng muốn những lời nói rõ ràng. Cú pháp các ký tự trở thành nhiễu mà máy phân tích phải loại bỏ.
- Phân tích từ khóa và tần số. Số thuật ngữ, sự xuất hiện đồng thời, TF-IDF, biểu thức chính quy đơn giản quét - tất cả đều sạch hơn đối với văn bản không được trang trí, không có nguy cơ dấu phân cách bảng đăng ký làm mã thông báo.
- Sự trùng lặp và khác biệt. So sánh hai chuyển đổi lưu trữ để xem những gì đã thay đổi dễ dàng hơn khi việc định dạng không thể tạo ra những khác biệt giả.
- Hiệu quả mã thông báo. Trên hàng chục tài liệu, đánh dấu cấu trúc bổ sung thêm một ý nghĩa thực sự một phần của cửa sổ ngữ cảnh của bạn. Việc bỏ nó đi sẽ giúp bạn có chỗ cho nhiều tài liệu nguồn hơn.
Lật sang ZIP tới Markdown khi điều ngược lại là đúng — khi bạn cần ranh giới rõ ràng giữa các tài liệu, khi đánh số bảng và mệnh đề quan trọng, hoặc khi bạn định tự mình đọc kết quả. Chuyển đổi định dạng ở trên cùng sẽ chuyển đổi và mang theo kho lưu trữ đã chọn của bạn, vì vậy bạn có thể tạo cả hai từ một lần tải lên và xem cái nào phù hợp với công việc.
Biết những gì trong kho lưu trữ trước khi bạn tải lên
Các định dạng được hỗ trợ chuyển đổi ở bất kỳ vị trí nào trong cây: PDF, Word, PowerPoint, Excel, HTML, CSV, JSON, XML, EPUB, RTF, MSG và hình ảnh. Lưu trữ hỗn hợp là trường hợp tiêu chuẩn. Nếu bạn muốn biết chi tiết cụ thể về cách loại cụ thể hoạt động một khi được làm phẳng, xem PDF thành văn bản, Word sang văn bản, CSV thành văn bảnhoặc bột ngọt để nhắn tin cho các tin nhắn Outlook.
Những thứ bị bỏ qua: video, âm thanh, tệp nhị phân, phông chữ và bất kỳ thứ gì nằm ngoài danh sách được hỗ trợ. Hai cái nữa những trường hợp đáng để biết trước khi bạn ngạc nhiên với kết quả đầu ra.
- Hình ảnh không được đọc bên trong kho lưu trữ. Các tệp hình ảnh sẽ tự nhận được văn bản của chúng được công nhận và trả lại. Họ không được gói vào một tệp ZIP — thẻ chuyển lô sẽ ghi chú tệp và tiếp tục, do đó, kho lưu trữ ảnh chụp màn hình hoặc trang được quét sẽ xử lý không có lỗi và cung cấp cho bạn tên tệp thay vì hơn những từ trong hình ảnh. Khi lời nói là trọng điểm, hãy trích xuất những hình ảnh đó và gửi chúng thông qua hình ảnh thành văn bản một lúc một thời gian.
- Các tệp PDF được quét có cùng một vấn đề. Một tệp PDF thực sự là một bức ảnh trên giấy không có văn bản nhúng để trích xuất. Kiểm tra một câu bằng cách cố gắng chọn một câu trong trình đọc - nếu bạn không thể, hãy chạy nhận dạng văn bản trước khi bạn nén.
- Lưu trữ lồng nhau. Một ZIP chứa các ZIP khác đáng được giải nén một cấp bằng tay trước khi tải lên.
Nơi một Corpus phẳng kiếm được tiền
- Xem xét tài liệu theo khối lượng. Gói tiết lộ hoặc xuất phòng dữ liệu trong đó lần đầu tiên câu hỏi là "điều nào trong số này đề cập đến điều tôi quan tâm" - chứ không phải "đọc cho tôi tài liệu này".
- Xây dựng nền tảng kiến thức. Sổ tay, chính sách và tài liệu quy trình của công ty, được chuyển đổi ở dạng một lần vượt qua và đưa vào hệ thống truy xuất dưới dạng sự thật cơ bản mà trợ lý sẽ trả lời.
- Hỗ trợ và xuất vé. Những cuộc trò chuyện kéo dài hàng tháng được chuyển thành văn bản mà bạn có thể chạy phân tích chủ đề hoặc yêu cầu một mô hình tập hợp lại thành các khiếu nại định kỳ.
- Tập đoàn nghiên cứu. Một thư mục gồm các giấy tờ, báo cáo và tập dữ liệu được biến thành một tập hợp văn bản để phân tích nhiều tài liệu thay vì đọc từng lần một.
- Di chuyển và kiểm tra nội dung. Trước khi chuyển bộ tài liệu sang nền tảng mới, chuyển đổi toàn bộ kho lưu trữ và tìm kiếm các tài liệu tham khảo đã chết, tên sản phẩm lỗi thời hoặc các trang trùng lặp.
- Xuất khẩu không gian làm việc. Các bản tải xuống Slack, Notion và Takeout có cấu trúc lộn xộn và đầy đủ của các thư mục lồng nhau. Làm phẳng chúng là điều làm cho chúng dễ điều khiển.
Kích thước, thứ tự và phân lô hợp lý
Giới hạn 50 MB áp dụng cho kho lưu trữ đã tải lên chứ không áp dụng cho các tệp riêng lẻ. Nén tài liệu nặng văn bản chà, rất nhiều trong số chúng phù hợp; phương tiện truyền thông không nén và sẽ ăn toàn bộ trợ cấp mà không có gì. Lột ra video và hình ảnh lớn trước khi nén.
Nếu bạn định làm việc với kho văn bản theo từng phần, hãy chia theo thư mục và nén riêng từng phần — một kho lưu trữ cho mỗi khách hàng, mỗi quý, mỗi dự án. Nó giữ mỗi đầu ra ở kích thước mà bạn thực sự có thể dán và nó giữ các tài liệu liên quan với nhau. Bộ đếm mã thông báo bên dưới đầu ra là số cần điều khiển: nó cho biết bạn ngay lập tức xem một lô có phù hợp với cửa sổ ngữ cảnh của mô hình của bạn hay cần tách hay không, trước khi bạn tìm ra một cách khó khăn.
Và nếu kho lưu trữ là một dự án mã nguồn chứ không phải là tài liệu, hãy sử dụng bộ chuyển đổi thư mục cục bộ thay vào đó. Nó mang lại cho bạn một cây hộp kiểm của thư mục để bạn có thể loại trừ các phần phụ thuộc, xây dựng đầu ra và khóa các tệp trước đó chuyển đổi - kiểm soát tải lên kho lưu trữ không thể cung cấp. Mã đã có trên máy chủ vẫn dễ dàng hơn: GitHub sang trình chuyển đổi văn bản hoạt động trực tiếp từ một URL.
Câu hỏi thường gặp
Làm cách nào để chuyển đổi tệp ZIP thành văn bản?
Tải lên kho lưu trữ ở trên. Nó được giải nén, cây bên trong được duyệt và mọi tệp có phần mở rộng được hỗ trợ sẽ được chuyển đổi và nối thành một phần văn bản thuần túy phẳng. Miễn phí, không cần đăng ký, 50 MB cho mỗi kho lưu trữ, không có gì được lưu trữ. Đường dẫn thư mục từ bên trong kho lưu trữ được chuyển qua để bạn có thể biết từng phần đến từ đâu.
Những loại tập tin nào trong kho lưu trữ được chuyển đổi?
Mười ba trang web tương tự này xử lý dưới dạng tải lên độc lập - PDF, Word, PowerPoint, Excel, HTML, CSV, JSON, XML, hình ảnh, EPUB, RTF, thư Outlook và các kho lưu trữ lồng nhau. Mọi thứ khác trong ZIP đều bị bỏ qua thay vì bị loại bỏ dưới dạng nhiễu nhị phân, do đó, việc trộn các tài liệu với video và tệp thực thi vẫn tạo ra đầu ra rõ ràng.
Nó có hoạt động trên các kho lưu trữ được bảo vệ bằng mật khẩu không?
Không. ZIP được mã hóa không có mục nào có thể đọc được cho đến khi nó được giải mã bằng mật khẩu và không có nơi nào cung cấp mật khẩu. Trước tiên hãy giải nén nó cục bộ bằng mật khẩu, nén lại mà không cần mã hóa hoặc trỏ vào trình chuyển đổi thư mục cục bộ thay vào đó là thư mục được giải nén.
Kho lưu trữ của tôi lớn hơn 50 MB — làm sao bây giờ?
Chia nó theo thư mục và chuyển đổi theo lượt hoặc bỏ qua toàn bộ kho lưu trữ: giải nén nó trên máy của bạn và sử dụng trình chuyển đổi thư mục cục bộ, không có bước tải lên, duyệt toàn bộ cây và cho phép bạn đánh dấu chính xác những tệp cần đưa vào. Đối với một bãi chứa tài liệu lớn thì đó vẫn là con đường tốt hơn.
Đây có phải là công cụ phù hợp cho kho lưu trữ mã nén không?
Không thực sự. Đối với mã nguồn, Công cụ chuyển đổi GitHub và công cụ thư mục cục bộ được xây dựng cho công việc - chúng hiển thị cho bạn cây thư mục, cho phép bạn bỏ chọn node_modules và các tệp khóa, đồng thời đếm mã thông báo khi bạn thực hiện. Trang này nhằm mục đích lưu trữ tài liệu, nơi không có cây để tỉa.
Phần còn lại của bộ công cụ
File2Txt có bất kỳ định dạng được hỗ trợ từ một trang nếu bạn không muốn chọn một trang. Có một dài hơn hướng dẫn chuẩn bị sẵn sàng các tập tin cho LLM nếu bạn muốn lý do đằng sau tất cả những điều này ở một nơi.
Repo2Txt được xây dựng và duy trì bởi v12hero, một nhà phát triển độc lập xây dựng các ứng dụng web và ứng dụng gốc ưu tiên quyền riêng tư.