Chuyển hình ảnh thành văn bản: Trích xuất chữ để sử dụng ngay
Một bản dựng không thành công. Lỗi là bốn mươi dòng dấu vết ngăn xếp trong một thiết bị đầu cuối trên máy mà bạn không thể sao chép từ đó — một bảng điều khiển từ xa, máy ảo bị khóa, ảnh chụp màn hình của đồng nghiệp được dán vào cuộc trò chuyện. Bạn có thể đọc nó hoàn toàn tốt. Bạn không thể chọn nó và việc gõ lại đường dẫn gói Java bằng tay là cách phát sinh ra lỗi chính tả.
Đó là mục đích của trang này. Tải ảnh chụp màn hình lên và văn bản trong đó được nhận dạng và trả về dưới dạng đơn giản văn bản bạn có thể dán vào tìm kiếm, trợ lý hoặc một vấn đề. OCR thực trên các pixel, không phải mô tả về tập tin. Nó đọc JPG, JPEG, PNG, GIF, BMP, TIFF, TIF và WebP. Miễn phí, không cần đăng ký, 50 MB mỗi tệp, không có gì được lưu trữ sau đó. Đó là chuyển đổi hình ảnh sang văn bản trực tuyến miễn phí trường hợp ở dạng đúng nghĩa nhất của nó: đặt một hình ảnh vào, lấy từ ra.
Vòng lặp ảnh chụp màn hình đến hộp tìm kiếm
Lý do phổ biến nhất mà mọi người cần trích xuất văn bản từ ảnh chụp màn hình là họ muốn đặt văn bản đó ở đâu đó chỉ chấp nhận văn bản. Công cụ tìm kiếm không chụp ảnh. Vấn đề của bạn cũng không tìm kiếm của trình theo dõi, trình tổng hợp nhật ký của bạn hoặc hộp nơi bạn dán ngoại lệ để hỏi mô hình đó là gì nghĩa là.
Vì vậy, vòng lặp là: chụp màn hình, chuyển đổi, dán. Mười giây và sự khác biệt là có thật - một trợ lý được giao lớp ngoại lệ chính xác và số dòng đưa ra một câu trả lời cụ thể, trong khi một cách diễn giải mơ hồ sẽ đưa ra một câu trả lời cụ thể. danh sách kiểm tra chung. Điều tương tự cũng áp dụng cho hộp thoại lỗi, đầu ra CI, thông báo cơ sở dữ liệu và báo cáo sự cố. Nếu nó xuất hiện trên màn hình dưới dạng các ký tự và bạn không thể chọn nó, đây là cách giải quyết.
Văn bản thuần túy hay Markdown? Câu trả lời trung thực
Hầu hết các trang web sẽ phát minh ra sự khác biệt đáng kể ở đây. Sự thật ít kịch tính hơn. Trên một hình ảnh đơn giản - một ảnh chụp màn hình của một đoạn văn, cửa sổ đầu cuối, ghi chú — văn bản thuần túy và Markdown hoạt động trở lại một cách hiệu quả giống hệt nhau. Văn bản được nhận dạng xuất hiện dưới dạng dòng và không có cấu trúc ẩn trong khối văn xuôi dành cho Markdown để thêm. Chọn một trong hai và bạn không mất gì cả.
Nơi nó bắt đầu đếm là khi hình ảnh hiển thị một cái gì đó có hình dạng: bảng, biểu mẫu, trang tài liệu với các tiêu đề. Markdown có thể thực hiện sự sắp xếp đó; văn bản phẳng chỉ có thể gợi ý nó bằng khoảng cách. Đối với những người đó, hình ảnh tới Markdown là tốt hơn trang. Đối với mọi thứ khác — và "mọi thứ khác" là hầu hết các ảnh chụp màn hình — văn bản thuần túy là thành phần rõ ràng hơn, bởi vì không có ký tự cú pháp nào cần loại bỏ trước khi nó đi vào tập lệnh, chỉ mục hoặc khác biệt.
Chuyển đổi định dạng ở trên cùng hoán đổi giữa hai định dạng và giữ lại tệp bạn đã chọn, vì vậy hãy thử cả hai chi phí một lần tải lên thay vì hai.
Công việc hàng ngày Điều này lặng lẽ giải quyết
- Đầu ra thiết bị đầu cuối và nhật ký. Đầu ra lệnh từ một phiên mà bạn không thể cuộn lại, hoặc một cửa sổ nhật ký được chụp trước khi nó bị xoay đi. Đưa nó vào văn bản và bạn có thể grep nó, phân biệt nó hoặc hỏi về nó.
- Ảnh chụp màn hình trò chuyện và email. Cuộc trò chuyện được chuyển tiếp dưới dạng hình ảnh thay vì văn bản là hầu hết trong số họ. Chuyển đổi một lần và bạn có thứ gì đó có thể trích dẫn và tìm kiếm được.
- Biển hiệu, nhãn mác và bao bì. Ảnh chụp biển số serial, nhãn nối dây, bảng thông số sản phẩm. Lúng túng khi gõ lại, tầm thường để chuyển đổi.
- Ghi chú viết tay. Đáng để thử, với những kỳ vọng thực tế — bản in gọn gàng đọc được nhiều tốt hơn là viết chữ thảo nhanh và bạn phải luôn kiểm tra kết quả so với bản gốc.
- Mã bạn chỉ có thể nhìn thấy, không thể sao chép. Một đoạn trong khung video, trang trình bày hoặc hình ảnh bị khóa tài liệu. Kéo nó ra dưới dạng văn bản, sau đó ghép nối nó với Kho lưu trữ GitHub dưới dạng văn bản hoặc một dự án GitLab để trợ lý có thể nhìn thấy đoạn mã và cơ sở mã của bạn cùng nhau.
- Bất cứ điều gì bạn chụp màn hình từ một trang web. Thói quen đáng bỏ - Web2Txt tìm nạp trang trực tiếp và giữ nguyên các liên kết và HTML tới Markdown xử lý một trang đã lưu. Quay lại nguồn luôn đánh bại việc đọc pixel.
Sự công nhận chạy ở đâu và nó không ở đâu
Có một quy tắc giải thích mọi chế độ lỗi đáng để biết: OCR hoạt động trên tệp hình ảnh mà bạn tải lên, không phải trên hình ảnh được chôn bên trong các tập tin khác. Một bức ảnh bên trong một thùng chứa lớn hơn sẽ bị bỏ qua, bởi vì bộ chuyển đổi đang đọc vùng chứa.
- Bản PDF được quét không trả lại kết quả gì. Tệp PDF chỉ có hình ảnh không có văn bản trong đó và OCR thì không tiếp cận các pixel thông qua trình bao bọc PDF. Sửa tại nguồn: mở trong Acrobat, Preview trên macOS, hoặc gần như bất kỳ trình đọc PDF hiện đại nào và chạy "nhận dạng văn bản" để biến nó thành một tệp PDF có thể tìm kiếm được, sau đó sử dụng PDF thành văn bản hoặc PDF sang Markdown. Đó là nhà thích hợp cho các tài liệu được quét.
- Hình ảnh bên trong ZIP được liệt kê chứ không được đọc. Chuyển đổi lưu trữ cung cấp cho bạn tên tệp và không còn gì nữa. ZIP thành văn bản là công cụ phù hợp cho một thư mục tài liệu; đối với hình ảnh, hãy giải nén chúng và tải từng hình ảnh lên.
- Không thể đọc được hình ảnh được nhúng trong Word, PowerPoint, RTF, EPUB hoặc email. Họ đi qua làm phần giữ chỗ hình ảnh ở đầu ra. DOCX được tập hợp từ ảnh chụp màn hình sẽ chuyển đổi thông qua Word sang Markdown vào văn bản xung quanh có lỗ nơi có hình ảnh. Lưu hình ảnh ra và chuyển đổi chúng ở đây.
Mang mô hình đó đi khắp nơi và bạn sẽ không bao giờ lãng phí việc tải lên: đọc một bức tranh, đưa bức tranh đó ra.
Làm việc đó với khối lượng và máy cho ăn
Văn bản thuần túy là định dạng bạn muốn khi đầu ra không dành cho con người. Văn bản được nhận dạng từ một chồng hình ảnh được ghép nối rõ ràng, phân đoạn có thể dự đoán được và nhúng mà không mang nhiễu định dạng vào vectơ — đó chính xác là những gì bạn cần khi xây dựng chỉ mục tìm kiếm trên một đống ảnh chụp màn hình hoặc chuyển chụp ảnh tài liệu lưu trữ thành một cái gì đó có thể phục hồi được.
Lộ trình thực tế là một hình ảnh cho mỗi lần tải lên, vì các kho lưu trữ bỏ qua hình ảnh, vì vậy hãy lập kế hoạch cho một vòng lặp thay vì một lô duy nhất. Bộ đếm mã thông báo bên dưới đầu ra rất hữu ích ở đây: nó cho bạn biết mỗi chuyển đổi là bao nhiêu chi phí thực tế trước khi bạn bắt đầu xếp các trang thành một lời nhắc hoặc lập ngân sách cho chiến lược chia nhỏ. Đối với tập hợp hỗn hợp — tài liệu cùng với hình ảnh — File2Txt xử lý mọi định dạng được hỗ trợ từ một nơi và một chuyển đổi thư mục cục bộ làm phẳng mặt dựa trên văn bản của dự án trong một lần.
Mang lại cho Người nhận dạng một khoảng thời gian dễ dàng
Độ chính xác tuân theo chất lượng hình ảnh đủ chặt chẽ để một vài thói quen có thể thay đổi kết quả của bạn nhiều hơn bất kỳ cài đặt nào sẽ:
- Chụp ảnh màn hình thay vì chụp ảnh màn hình. Không chói, không góc, không nhòe, không có hoa văn moiré từ màn hình.
- Cắt chặt văn bản bạn muốn. Nhiều pixel hơn cho mỗi ký tự là toàn bộ trò chơi và nó cũng dừng đầu ra chứa đầy giao diện chrome mà bạn không yêu cầu.
- Giữ hình ảnh hướng lên trên và gần như vuông góc. Các dòng xiên khó đọc hơn các dòng thẳng.
- Tránh những trường hợp khó khăn khi bạn có thể: chụp ảnh có độ phân giải thấp, văn bản đè lên ảnh, chữ viết và phông chữ trang trí và bất cứ thứ gì có một nửa bóng tối. Chúng có thể hoạt động nhưng chúng là nơi tập trung nhiều lỗi.
- Đọc lại bất cứ điều gì quan trọng. Một chữ số bị đọc sai trong số tham chiếu sẽ gây tốn kém và tốn kém, và liếc nhìn năm giây ở đầu ra sẽ bắt được nó.
Câu hỏi thường gặp
Làm cách nào để chuyển đổi JPG thành văn bản?
Thả hình ảnh vào bộ chuyển đổi ở trên. OCR chạy trên các pixel thực tế và các từ được nhận dạng sẽ trở lại dưới dạng văn bản thuần túy mà bạn có thể chọn, tìm kiếm và dán. Miễn phí, không cần đăng ký, 50 MB cho mỗi hình ảnh. Đây là trường hợp chuyển đổi jpeg sang văn bản theo nghĩa đen - hình ảnh vào, chữ ra, không có gì để cài đặt.
Nó có hoạt động với PNG và các định dạng hình ảnh khác không?
Có: JPG, JPEG, PNG, GIF, BMP, TIFF, TIF và WebP đều hoạt động. PNG là định dạng mà hầu hết các ảnh chụp màn hình đều có và đó là trường hợp tốt nhất cho OCR, vì ảnh chụp màn hình được hiển thị văn bản chứ không phải ảnh giấy - không bị mờ máy ảnh, không bị cong trang, không có ánh sáng không đồng đều để xử lý.
Nó có đọc được ghi chú viết tay không?
Thật tệ, và bạn nên cho là không. Các mô hình OCR được đào tạo chủ yếu trên bản in; Chữ viết hoa và chữ viết hoa vội vã tạo ra kết quả có vẻ hợp lý nhưng sai ở những chỗ cụ thể mà bạn không nghĩ đến việc kiểm tra. Đôi khi những chữ in hoa gọn gàng trên giấy kẻ có đường kẻ vẫn xuất hiện. Bất cứ điều gì khác đều cần hiệu đính so với bản gốc, việc này thường tốn kém hơn việc đánh máy lại.
Tại sao hình ảnh của tôi quay lại với các ký tự sai?
Độ phân giải, gần như luôn luôn. OCR cần khoảng 300 dpi tương đương để tách các hình dạng tương tự và dưới mức đó rn sụp đổ vào m, 1 và l trao đổi và 0 trở thành O. Một bức ảnh điện thoại được chụp gần hơn hoặc một ảnh chụp màn hình được chụp ở kích thước cửa sổ đầy đủ thay vì thu nhỏ sẽ khắc phục được hầu hết vấn đề.
Tôi có thể lấy văn bản từ ảnh của trang tài liệu không?
Có, và nó hoạt động tốt hơn mọi người mong đợi — nhưng trước tiên hãy làm phẳng trang. Giữ máy ảnh song song với tờ giấy thay vì nghiêng một góc, lấy ánh sáng đều, không có bóng trên văn bản và lấp đầy khung bằng trang. Các bức ảnh bị keystoned hoặc bị che bóng sẽ mất toàn bộ dòng và OCR sẽ không báo cáo lỗi khi điều đó xảy ra.
Hình ảnh có được lưu trữ ở bất kỳ đâu sau khi chuyển đổi không?
Không. Nó được gửi để nhận dạng, xử lý và loại bỏ sau khi văn bản được trả về — không được lưu trữ, không được sử dụng để đào tạo, không được lập chỉ mục. Không có tài khoản nào được đính kèm và không có bản sao nào được giữ lại từ phía chúng tôi.
Mọi thứ khác ở đây
Hình ảnh nằm cùng với mười hai định dạng được hỗ trợ khác, tất cả đều có thể truy cập được từ File2Txt. Có cái dài hơn viết về việc chuẩn bị sẵn sàng các tệp cho LLM nếu bạn muốn đối số chung hơn là đối số cụ thể của hình ảnh.
Repo2Txt là sản phẩm độc lập của v12hero, tập trung vào quyền riêng tư và các công cụ chuyển đổi dễ kiểm tra.