Index File Contents for Search

그래서 이 문제를 조사해 보고, AI를 활용해 최적의 방법을 구현하기 위한 와이어프레임을 작성했습니다. 몇 가지 아이디어가 떠오르는데요. Apache TIKA를 사용하면 이미지 포함, 텍스트가 있는 거의 모든 파일 형식을 OCR로 처리할 수 있습니다. 이는 자체 호스팅 옵션이기도 합니다. 그리고/또는: Gemini Flash 1.5(예를 들어)를 사용해 OCR을 수행할 뿐만 아니라, 확인하고 분석된 이미지를 설명한 데이터를 PostgreSQL 테이블/열에 게시하여 검색할 수 있도록 할 수 있습니다. 물론 첨부파일/업로드가 있는 모든 게시물을 다시 처리하려면 상당한 양의 토큰이 초기에 필요하지만, 이는 가장 유용할 것입니다. 결국 가격만큼의 가치를 얻는 것일까요?

1개의 좋아요