Skip to content

[Feature] PDF 불러오기 기능 추가해주세요 #5

Description

@revfactory

아래처럼 바로 붙여 넣을 수 있게 다듬어봤습니다.

PDF 불러오기 및 마크다운 변환 기능 추가 제안

💡 무엇을 제안하시나요

PDF 파일을 불러와 마크다운 형식으로 변환할 수 있는 기능을 제안합니다.

🤔 동기 / 해결하려는 문제

현재는 문서를 마크다운으로 활용하려면 사용자가 PDF 내용을 직접 복사하거나 별도의 변환 도구를 사용해야 합니다.
PDF도 바로 불러와 마크다운으로 변환할 수 있다면, 기존 문서 자료를 더 쉽게 편집하고 재사용할 수 있습니다.

특히 다음과 같은 상황에서 유용할 것 같습니다.

  • PDF로 배포된 문서를 마크다운으로 정리하고 싶을 때
  • 보고서, 매뉴얼, 논문, 가이드 문서를 마크다운 기반 워크플로우에서 재사용하고 싶을 때
  • HWP/마크다운 변환 기능과 함께 다양한 문서 포맷을 지원하고 싶을 때

🎯 제안하는 해결책

PDF 파일을 업로드하거나 불러오면, 텍스트 내용을 추출하여 마크다운 형식으로 변환하는 기능을 추가하면 좋겠습니다.

예상 동작은 다음과 같습니다.

  1. 사용자가 PDF 파일을 선택합니다.
  2. PDF 내 텍스트를 추출합니다.
  3. 제목, 문단, 목록 등 가능한 구조를 마크다운 형식으로 변환합니다.
  4. 변환된 결과를 기존 마크다운 편집 영역에서 확인하고 수정할 수 있습니다.

가능하다면 다음 항목도 함께 지원되면 좋겠습니다.

  • PDF 페이지별 텍스트 추출
  • 제목/본문/목록 구조 추정
  • 표가 있는 경우 마크다운 테이블로 변환
  • 이미지나 스캔 PDF의 경우 OCR 지원 여부 안내
  • 변환 실패 또는 일부 누락 시 사용자에게 경고 표시

🔀 대안

대안으로는 사용자가 외부 PDF-to-Markdown 변환 도구를 사용한 뒤 결과를 직접 가져오는 방식이 있습니다.

하지만 이 경우 다음과 같은 불편함이 있습니다.

  • 별도 도구를 찾아야 함
  • 변환 결과를 다시 복사/붙여넣기 해야 함
  • 도구마다 변환 품질이 다름
  • 서비스 내부의 기존 문서 변환 흐름과 연결되지 않음

따라서 애플리케이션 내부에서 PDF 불러오기와 마크다운 변환을 지원하는 것이 사용자 경험 측면에서 더 좋을 것 같습니다.

📚 참고 자료

유사한 기능을 제공하는 도구 예시는 다음과 같습니다.

  • PDF 문서를 Markdown으로 변환하는 오픈소스 도구들
  • Pandoc 기반 문서 변환 워크플로우
  • OCR 기반 PDF 텍스트 추출 도구
  • Markdown 편집기에서 제공하는 문서 import 기능

🌐 영향 범위

  • 기존 사용자에게 breaking change
  • 새로운 의존성 필요
  • HWP/마크다운 변환 동작 변경
  • 데이터베이스 스키마 변경
  • 기타: PDF 파싱 및 OCR 지원 여부 검토 필요

🛠 구현 의향 (선택)

  • 직접 PR을 제출할 수 있습니다
  • 메인테이너와 협업해서 구현하고 싶습니다
  • 제안만 합니다

제목은 PDF 불러오기 및 마크다운 변환 기능 추가 정도가 적절합니다.

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or request

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions