MCP fetcher ที่โฮสต์เองสำหรับการวิจัยเว็บและการดึงข้อมูลของตัวแทน
master-fetch, โดย Dondai1234, เป็นเซิร์ฟเวอร์ Model Context Protocol ที่ให้เอเจนต์ AI เข้าถึงเนื้อหาเว็บสดในท้องถิ่นสำหรับบริบทของโมเดลและการวิจัย มันดึงหน้าเว็บและส่งคืนข้อความที่ถูกทำความสะอาดและผลการค้นหาในขณะที่จัดการกับไซต์ที่มี JavaScript หนาแน่นและกำแพงต่อต้านบอท แอปนี้เน้นการทำงานที่ไม่มีการกำหนดค่า, การทำงานที่ไม่มีคีย์ และการประมวลผลเอกสารบนอุปกรณ์ นักพัฒนาและผู้ใช้ AI ที่มีความสามารถสูงจะได้รับท่อส่งการดึงข้อมูลส่วนตัวที่โฮสต์ด้วยตนเองสำหรับการปรับ localization, การนำเข้าเอกสาร, และเวิร์กโฟลว์การวิจัยที่ขับเคลื่อนโดยเอเจนต์。
คุณสามารถใช้มันทำงานอะไรได้บ้าง?
master-fetch ทำหน้าที่เป็นเครื่องมือดึงข้อมูลที่จัดเตรียมเนื้อหาที่อ่านได้ให้กับโมเดลที่อยู่ด้านล่าง โดยมุ่งเน้นไปที่การทำให้ข้อความ AI เป็นภาษาท้องถิ่นและงานวิจัย ผลลัพธ์ทั่วไป ได้แก่ การดึงเอกสารสำหรับการแปล การเก็บข้อมูลจากเว็บเพจสำหรับสตริงที่แปลแล้ว และการจัดทำแผนที่เนื้อหาของไซต์สำหรับคำสั่งของโมเดล ประเภทงานที่ใช้ได้จริง:
- ดึงข้อมูลและทำความสะอาด HTML สำหรับการป้อนข้อมูลของโมเดล
- การเก็บข้อมูลทั่วทั้งไซต์ผ่านแผนผังเว็บไซต์
- การแปลง PDFs และภาพเป็นข้อความสำหรับการนำเข้า
ผลลัพธ์ที่ดึงมามีความน่าเชื่อถือและสะอาดแค่ไหน?
เครื่องมือนี้ผลิตข้อความที่ถูกลบออกและพร้อมสำหรับโมเดลโดยใช้ Trafilatura และ lxml เพื่อลบโฆษณาและเนื้อหาที่ไม่จำเป็น และสามารถส่งออก Markdown หรือข้อความธรรมดาที่เหมาะสมสำหรับบริบทของคำสั่ง สำหรับเอกสารที่มีภาพมาก จะใช้ท่อ OCR ที่ใช้ ONNX ในท้องถิ่นเพื่อดึงตัวอักษร โครงการนี้ยังรวมถึงขั้นตอนการจัดอันดับใหม่ในท้องถิ่นที่จัดเรียงผลการค้นหาใหม่ ซึ่งช่วยให้จัดลำดับความสำคัญของหน้าเว็บที่ดึงมาได้ที่เกี่ยวข้องที่สุดสำหรับการบริโภคของตัวแทน
คุณควรคาดหวังการป้อนข้อมูลและขีดจำกัดการทำงานอะไรบ้าง?
การป้อนข้อมูลที่ยอมรับได้รวมถึง URLs แผนผังเว็บไซต์สำหรับการเก็บข้อมูลเชิงลึก และ PDFs หรือภาพที่อัปโหลดสำหรับ OCR การติดตั้งต้องการสภาพแวดล้อม Python 3.10+ และแพ็คเกจ (pip install hound-mcp) และการดึงข้อมูลแบบซ่อนตัวสามารถใช้ไบนารี Chrome หรือ Chromium ในท้องถิ่นได้ตามต้องการ เซิร์ฟเวอร์ทำงานร่วมกับโฮสต์ MCP เช่น Claude Desktop, Cursor และ OpenCode และการค้นหาทำงานโดยไม่ต้องใช้คีย์ API ภายนอกโดยพึ่งพาการเก็บข้อมูลในท้องถิ่นและตรรกะการจัดเส้นทาง
มันเหมาะกับการทำงานของนักพัฒนาหรือไม่โดยไม่มีภาระหนัก?
การออกแบบมุ่งเป้าไปที่นักพัฒนาและผู้ใช้ AI ที่มีความสามารถซึ่งสามารถโฮสต์เองและรวมจุดสิ้นสุด MCP เข้ากับสแต็คของตัวแทน นักพัฒนาจึงได้ดำเนินการปรับระดับอัตโนมัติระหว่างโหมด HTTP การเรนเดอร์เบราว์เซอร์ และโหมดซ่อนตัวเพื่อเพิ่มการดึงข้อมูลที่ประสบความสำเร็จจากไซต์ที่ถูกป้องกัน และชุมชนได้บันทึกถึงจุดแข็งของการปรับระดับอัตโนมัตินี้ เนื่องจากบริการทำงานทั้งหมดในท้องถิ่น ทีมที่ให้ความสำคัญกับการควบคุมข้อมูลสามารถรวมเข้ากับท่อในบ้านที่มีอยู่สำหรับการสร้างบริบทของโมเดลได้
ใครควรนำไปใช้และใครควรมองหาที่อื่น
master-fetch เป็นทางเลือกที่มุ่งเน้นไปที่นักพัฒนาสำหรับทีมที่สร้างการวิจัยหรือท่อส่งข้อมูลที่ขับเคลื่อนด้วยเอเจนต์และสามารถดำเนินการเซิร์ฟเวอร์ที่โฮสต์ด้วยตนเอง มันเหมาะสำหรับกลุ่มที่ให้ความสำคัญกับการควบคุมวัสดุที่ดึงมาและสามารถรักษาบริการที่ใช้ Python ได้ องค์กรที่ไม่มีความสามารถด้านวิศวกรรมในบ้านหรือผู้ที่ชอบบริการการดึงข้อมูลที่จัดการแล้วควรพิจารณาทางเลือกอื่นที่ลบความรับผิดชอบในการโฮสต์ออกไป