deepseek-visionary เพิ่ม OCR และบริบทภาพให้กับตัวแทน MCP
deepseek-visionary จาก Xlight เป็นเซิร์ฟเวอร์ MCP และปลั๊กอินที่ให้ตัวแทน AI แบบข้อความเท่านั้นมีข้อมูลภาพ ทำให้สามารถทำการระบุตำแหน่งข้อความที่อิงจากภาพและ OCR ภายในกระบวนการทำงานของตัวแทน เครื่องมือนี้เชื่อมต่อโมเดลภาษา-ภาพ DeepSeek กับโฮสต์ Model Context Protocol ดึงข้อความที่ฝังอยู่ และผลิตคำอธิบายที่มีโครงสร้างสำหรับการบริโภค LLM ในลำดับถัดไป ความสามารถหลักรวมถึงคำอธิบายภาพ JSON/markdown การวิเคราะห์ OCR ผสมผสานกับภาษา-ภาพ และความเข้ากันได้หลายโฮสต์ ซึ่งมุ่งเป้าไปที่นักพัฒนาและนักวิจัยที่รวมการประมวลผลภาพเข้ากับท่อ MCP.
คุณสามารถใช้มันทำงานอะไรได้บ้าง?
Visionary แปลงทรัพย์สินทางสายตาเป็นข้อความที่อ่านได้โดยเครื่องและข้อมูลเมตาที่มีรายละเอียดเพื่อให้ตัวแทนสามารถดำเนินการตามเนื้อหาภาพ มันถูกสร้างขึ้นสำหรับงานต่างๆ เช่น การปรับแต่งข้อความ UI, การถอดเสียงเอกสาร, และการสร้างคำอธิบายภาพสำหรับโมเดลภาษา ผลลัพธ์ที่เป็นรูปธรรม รวมถึงการถอดเสียง OCR และคำอธิบาย JSON หรือ markdown ที่มีโครงสร้างซึ่งเชื่อมต่อโดยตรงกับคำสั่ง LLM หรือสคริปต์อัตโนมัติ เวิร์กโฟลว์ทั่วไปจะจับคู่ข้อความที่ถูกดึงออกมากับท่อการแปลหรือเครื่องมือการอนุญาต
ผลลัพธ์สำหรับการแปลและ OCR มีความแม่นยำแค่ไหน?
โครงการนี้โฆษณาการรู้จำอักขระด้วยแสงที่มีความแม่นยำสูงและรวม OCR นั้นเข้ากับคำอธิบายโมเดลภาษา-ภาพเพื่อเพิ่มบริบท ความแม่นยำขึ้นอยู่กับแบ็กเอนด์และโมเดลที่เลือก เนื่องจากเซิร์ฟเวอร์สนับสนุนผู้ให้บริการวิสัยทัศน์หลายรายและโมเดลเว็บเนทีฟที่เข้าถึงได้ผ่านเส้นทางเบราว์เซอร์อัตโนมัติ ผลลัพธ์ที่มีโครงสร้างมีเป้าหมายเพื่อลดข้อผิดพลาดในการแยกวิเคราะห์โดยการจัดเตรียม JSON หรือ markdown ที่สะอาดสำหรับการประมวลผลในขั้นตอนถัดไป
มันต้องการการตั้งค่าทางเทคนิคหรือไม่และมันเข้ากับเวิร์กโฟลว์ของนักพัฒนาอย่างไร?
Visionary ทำงานเป็นส่วนประกอบเซิร์ฟเวอร์ Node.js และรวมเข้ากับโฮสต์ที่เข้ากันได้กับ MCP ดังนั้นการตั้งค่าจึงคาดหวังสภาพแวดล้อมการพัฒนา โฮสต์ที่รองรับรวมถึง Claude Desktop, Zed, Cursor, และ DeepSeek Harness เมื่อใช้เป็นปลั๊กอินเนทีฟ การจัดการเซสชันอัตโนมัติสำหรับการเข้าถึงวิสัยทัศน์เว็บเนทีฟและโหมดเซิร์ฟเวอร์ MCP แบบสแตนด์อโลนช่วยให้นักวิศวกรสามารถฝังส่วนประกอบลงในท่อของตัวแทนที่มีอยู่โดยไม่ต้องเขียนโค้ดโฮสต์ใหม่
ทีมควรพิจารณาอะไรเกี่ยวกับแบ็กเอนด์และการจัดการข้อมูล?
โครงการนี้มีตัวเลือกแบ็กเอนด์หลายตัว: การกำหนดค่าสามารถใช้ CLI ของ visionary-server เพื่อเข้าถึงโมเดลวิสัยทัศน์เว็บเนทีฟโดยไม่ต้องใช้คีย์ API มาตรฐาน หรือเชื่อมต่อกับข้อมูลประจำตัว API อย่างเป็นทางการสำหรับบริการของผู้ขาย Xlight ยังใช้การสำรองหลายโฮสต์เพื่อให้การประมวลผลภาพสามารถดำเนินต่อไปได้หากผู้ให้บริการหลักไม่สามารถเข้าถึงได้ ทีมควรวางแผนการจัดการตัวเชื่อมและทดสอบแบ็กเอนด์ที่เลือกสำหรับประเภทเนื้อหาที่ต้องการ
เหมาะสำหรับทีมพัฒนาที่ให้คุณค่ากับเครื่องมือที่ตรวจสอบได้และได้รับการสนับสนุนจากชุมชน
โครงการนี้ถูกโฮสต์บน GitHub และถูกอ้างถึงบ่อยครั้งในรายการชุมชนของ MCP และ DeepSeek Harness ดังนั้นมันจึงเหมาะสำหรับทีมที่วางแผนจะปรับตัวเชื่อมต่อหรือตรวจสอบโค้ดการประมวลผล ในฐานะเคล็ดลับที่เป็นประโยชน์ ให้รวมการตรวจสอบจากมนุษย์ในทุกท่อส่งการแปลที่ใช้ข้อความที่สร้างขึ้น สำหรับนักพัฒนาที่ต้องการสะพานเชื่อมภาพที่เป็นเนทีฟของ MCP พร้อมการมองเห็นจากชุมชน โครงการนี้เป็นทางเลือกที่เหมาะสม