MedResearcher

iomgaa/MedResearcher

Fork 0

Commit Graph

Author	SHA1	Message	Date
iomgaa	76c04eae4a	feat: 优化信息提取系统并行处理和错误重试机制 - info_extractor.py: 添加文档并行处理线程数配置参数 - papers_crawler.py: 优化默认参数配置和数据文件路径 - src/crawler.py: 精确化MIMIC-IV关键词搜索和扩大爬取范围 - src/extractor.py: 实现并行文档处理、提取重试机制和内容预处理 - src/parse.py: 小幅优化解析逻辑主要改进： 1. 支持多线程并行处理文档，提升提取效率 2. 增加API调用重试机制，提高稳定性 3. 优化论文内容预处理，去除无关信息 4. 完善进度跟踪和错误日志记录	2025-08-26 22:19:28 +08:00
iomgaa	099159dfb7	feat: 新增PDF解析功能模块 - pdf_parser.py: PDF解析主程序，支持命令行参数和并发处理 - src/parse.py: PDF解析核心模块，提供PDFParser类 * 支持OCR API调用，将PDF转换为Markdown格式 * 内置HTTP会话管理、连接池优化和重试机制 * 支持并发处理和详细进度显示 * 完善的错误处理和日志记录功能	2025-08-24 15:07:42 +08:00

Author

SHA1

Message

Date

iomgaa

76c04eae4a

feat: 优化信息提取系统并行处理和错误重试机制

- info_extractor.py: 添加文档并行处理线程数配置参数
- papers_crawler.py: 优化默认参数配置和数据文件路径
- src/crawler.py: 精确化MIMIC-IV关键词搜索和扩大爬取范围
- src/extractor.py: 实现并行文档处理、提取重试机制和内容预处理
- src/parse.py: 小幅优化解析逻辑

主要改进：
1. 支持多线程并行处理文档，提升提取效率
2. 增加API调用重试机制，提高稳定性
3. 优化论文内容预处理，去除无关信息
4. 完善进度跟踪和错误日志记录

2025-08-26 22:19:28 +08:00

iomgaa

099159dfb7

feat: 新增PDF解析功能模块

- pdf_parser.py: PDF解析主程序，支持命令行参数和并发处理
- src/parse.py: PDF解析核心模块，提供PDFParser类
  * 支持OCR API调用，将PDF转换为Markdown格式
  * 内置HTTP会话管理、连接池优化和重试机制
  * 支持并发处理和详细进度显示
  * 完善的错误处理和日志记录功能

2025-08-24 15:07:42 +08:00

2 Commits