AgentsRoom รองรับ Ollama แล้ว: รันโมเดลท้องถิ่นข้างคลาวด์
Ollama ตอนนี้เป็นผู้ให้บริการใน AgentsRoom รันโมเดลโอเพนซอร์สท้องถิ่นเช่น Llama, Qwen, Gemma และ DeepSeek ข้างเอเจนต์คลาวด์ และตั้งค่าการเลือกท้องถิ่นหรือคลาวด์บนแต่ละเอเจนต์ที่สามารถสลับได้ระหว่างการสนทนา
Ollama ตอนนี้เป็นผู้ให้บริการที่รองรับใน AgentsRoom คุณสามารถกำหนดโมเดลโอเพนซอร์สในเครื่องให้กับตัวแทนใดก็ได้ รันมันบนบอร์ดเดียวกับ Claude, Codex, Grok Build และ Mistral Vibe และสลับระหว่างการสนทนาโดยไม่สูญเสียบริบทของคุณ น้ำหนักเปิดที่คุณรู้จักแล้ว Llama, Qwen, Gemma, DeepSeek และอื่นๆ ตอนนี้รายงานตัวเองในห้องของคุณ
Ollama ไม่เหมือนกับผู้ให้บริการอื่นๆ ที่เราได้เพิ่มเข้าไป มันไม่ใช่ตัวแทนอีกหนึ่งตัวที่คุณจะเดิมพัน มันเป็นประตูสู่แคตตาล็อกโมเดลโอเพนซอร์สทั้งหมด ที่รันบนฮาร์ดแวร์ของคุณเอง โดยไม่มีค่าใช้จ่ายต่อโทเค็นและเป็นส่วนตัวโดยค่าเริ่มต้น
Ollama คืออะไร
Ollama เป็นรันไทม์โอเพนซอร์สฟรีที่ดาวน์โหลดและรันโมเดลภาษาขนาดใหญ่บนเครื่องของคุณ คำสั่งหนึ่ง ollama pull qwen3-coder จะดึงโมเดลมา ollama run จะให้บริการมันบนจุดสิ้นสุดในเครื่องที่ http://localhost:11434 มันเปิดเผย API ที่เข้ากันได้กับ OpenAI ซึ่งเป็นเหตุผลที่ตัวแทนการเขียนโค้ดสามารถพูดคุยกับมันได้โดยไม่ต้องใช้การเชื่อมต่อพิเศษ และมันสามารถใช้งานได้บน macOS, Windows และ Linux
มันยังรองรับการเรียกเครื่องมือ ซึ่งเป็นสิ่งที่ตัวแทนการเขียนโค้ดต้องการเพื่อแก้ไขไฟล์และรันคำสั่งแทนที่จะเพียงแค่สนทนา ห้องสมุดโมเดลอ่านเหมือนกับว่าเป็นใครเป็นใครในน้ำหนักเปิด: Llama, Qwen, Gemma, DeepSeek, Mistral, Phi และอื่นๆ ขนาดที่ตรงกับอะไรก็ตามตั้งแต่แล็ปท็อปไปจนถึง GPU ของเวิร์กสเตชัน
สองข้อเท็จจริงจะพาไปยังส่วนที่เหลือของบทความนี้ โมเดลรันบนเครื่องของคุณ ดังนั้นไม่มีสิ่งที่คุณพิมพ์ข้ามเครือข่าย และการอนุมานในเครื่องไม่มีค่าใช้จ่ายต่อโทเค็น ทุกอย่างด้านล่างนี้เป็นผลมาจากสองสิ่งนี้
ทางเลือกในเครื่องกับคลาวด์ที่ทุกคนยอมรับ
จนถึงตอนนี้การตัดสินใจเป็นแบบสองทาง ไปทั้งหมดในคลาวด์และคุณจะได้การวิเคราะห์ที่ทันสมัย แต่ทุกคำสั่งและไฟล์ที่คุณสัมผัสจะถูกส่งไปยัง API ของบุคคลที่สามและถูกคิดค่าใช้จ่ายตามโทเค็น ไปทั้งหมดในเครื่องและคุณจะได้ความเป็นส่วนตัวและไม่มีค่าใช้จ่าย แต่คุณต้องละทิ้งโมเดลที่แข็งแกร่งที่สุดในปัญหาที่ต้องการมันจริงๆ ทีมส่วนใหญ่เลือกเลนหนึ่งและอยู่ในนั้น
การแบ่งประเภทนี้เป็นเท็จ เพราะโค้ดเบสไม่ใช่การทำงานประเภทเดียว การเปลี่ยนชื่อสัญลักษณ์ในสี่สิบไฟล์ การเขียนการทดสอบเบื้องต้น การสรุปความแตกต่าง การร่างข้อความคอมมิต: ไม่มีสิ่งใดที่ต้องการโมเดลที่ทันสมัย และหลายอย่างนั้นเกี่ยวข้องกับโค้ดที่คุณไม่อยากส่งไปที่ไหน การปรับโครงสร้างสถาปัตยกรรมที่ซับซ้อนอาจต้องการเครื่องยนต์ขนาดใหญ่ การจ่ายราคาคลาวด์ที่ทันสมัยสำหรับโค้ดเบื้องต้น หรือการจำกัดงานที่ยากด้วยโมเดลที่เล็กเกินไป เป็นภาษีที่คุณต้องจ่ายสำหรับการมองว่าการเลือกเป็นแบบทั้งหมดหรือไม่มีอะไรเลย
ใน AgentsRoom การเลือกในเครื่องหรือคลาวด์คือการปรับระดับ ไม่ใช่การสลับ
AgentsRoom ให้ตัวแทนแต่ละตัวมีผู้ให้บริการและโมเดลของตัวเองอยู่แล้ว การเพิ่ม Ollama หมายความว่าตอนนี้ตัวแทนแต่ละตัวสามารถนั่งอยู่ที่ใดก็ได้ในระดับจากในเครื่องไปยังคลาวด์ และคุณตั้งค่าได้ต่อแต่ละตัวแทน ต่อแต่ละงาน
ระดับนั้นคือหมายเลขโมเดลโดยตรง พิมพ์ qwen3-coder:30b และตัวแทนจะรัน Qwen ในเครื่องผ่าน Ollama บนฮาร์ดแวร์ของคุณ ฟรี หากเพิ่มคำต่อท้าย :cloud glm-4.6:cloud ตัวแทนเดียวกันจะรันโมเดลนั้นผ่านการสมัครสมาชิก Ollama Cloud แค่คำต่อท้ายเดียวสามารถย้ายตัวแทนจาก GPU ของคุณไปยังตัวที่โฮสต์โดยไม่ต้องแตะต้องอะไรในการตั้งค่า
เนื่องจาก AgentsRoom รักษาบริบทของคุณข้ามการสลับผู้ให้บริการ ระดับนั้นจึงสามารถเคลื่อนไหวระหว่างการสนทนาได้เช่นกัน เริ่มตัวแทนด้วยโมเดลในเครื่อง ให้มันทำงานผ่านส่วนที่เป็นกลไกของงาน จากนั้นสลับไปยังโมเดลคลาวด์สำหรับขั้นตอนเดียวที่ต้องการการวิเคราะห์ที่ลึกกว่า AgentsRoom สร้างสรุปการส่งต่อของไฟล์ที่ถูกสัมผัส ความก้าวหน้า และกิจกรรมของเซสชัน เพื่อให้โมเดลคลาวด์สามารถรับช่วงต่อจากจุดที่โมเดลในเครื่องหยุดลง กลับไปเมื่อส่วนที่ยากเสร็จสิ้น
วิธีการใช้งาน
หากคุณรัน AgentsRoom อยู่แล้ว แทบไม่มีอะไรใหม่ให้เรียนรู้:
- ติดตั้ง Ollama จาก
ollama.comและดึงโมเดล:ollama pull qwen3-coder:30bโมเดล Qwen Coder เป็นค่าเริ่มต้นที่แข็งแกร่งสำหรับโค้ด เครื่องขนาดเล็กสามารถรัน 7B ได้อย่างสบาย และ GPU ขนาด 24GB สามารถจัดการกับ 30B ได้ด้วยหน้าต่างบริบทขนาดใหญ่ - ในการตั้งค่า AgentsRoom เลือก Ollama เป็นผู้ให้บริการ ไม่ว่าจะเป็นค่าเริ่มต้นของคุณหรือต่อหนึ่งตัวแทน
- สร้างตัวแทน กำหนดบทบาทให้มัน และในฟิลด์โมเดลพิมพ์หมายเลขโมเดลของ Ollama ใช้
qwen3-coder:30bเพื่อรันในเครื่อง หรือเพิ่ม:cloudเพื่อรันผ่าน Ollama Cloud - ส่งคำสั่ง ตัวแทนจะสร้างกระบวนการ
ollama runที่แท้จริงในโฟลเดอร์โปรเจ็กต์ของคุณและสตรีมผลลัพธ์แบบสด เช่นเดียวกับที่มันขับเคลื่อนผู้ให้บริการอื่นๆ
เคล็ดลับจากสนาม: Ollama ตั้งค่าโมเดลใหม่ให้มีหน้าต่างบริบทขนาดเล็ก สำหรับการทำงานของตัวแทน ให้เพิ่มขึ้นเพื่อให้ตัวแทนสามารถถือส่วนจริงของที่เก็บข้อมูลของคุณในมุมมอง ไม่ใช่แค่ข้อความไม่กี่ข้อความล่าสุด
เศรษฐศาสตร์ของฝูงชนฟรีและส่วนตัว
AgentsRoom ถูกสร้างขึ้นเพื่อรันตัวแทนในขนาน: บอร์ดของพวกเขา แต่ละตัวทำงานในงานของตัวเอง แต่ละตัวมีจุดสถานะ ในผู้ให้บริการคลาวด์ ความขนานนั้นมาพร้อมกับการคิดค่าใช้จ่าย เพราะตัวแทนหกตัวทำงานพร้อมกันคือหกบิลโทเค็นที่เพิ่มขึ้นพร้อมกัน ในโมเดล Ollama ในเครื่อง ค่าใช้จ่ายเพิ่มเติมของโทเค็นคือศูนย์ สร้างฝูงชน ให้มันทำงานทั้งบ่าย และบิลเดียวคือค่าไฟฟ้า
นั่นเปลี่ยนสิ่งที่ความขนานหมายถึง เมื่อแต่ละตัวแทนถูกคิดค่าใช้จ่าย คุณจะต้องควบคุมมัน เมื่อมันฟรี คุณสามารถให้ความเอื้อเฟื้อในทางที่มีประโยชน์: ตัวแทนในเครื่องที่เฝ้าดูการเบี่ยงเบนของลินต์ หนึ่งที่ทำให้บันทึกการเปลี่ยนแปลงเป็นปัจจุบัน หนึ่งที่ร่างการทดสอบสำหรับฟังก์ชันใหม่ทุกตัว ทั้งหมดทำงานในพื้นหลังโดยไม่มีค่าใช้จ่ายเพิ่มเติมในขณะที่ตัวแทนคลาวด์ที่คิดค่าใช้จ่ายของคุณยังคงถูกสงวนไว้สำหรับงานที่ต้องการมันจริงๆ หากการรันตัวแทนหลายตัวพร้อมกันเป็นสิ่งใหม่สำหรับคุณ เราเขียนเกี่ยวกับรูปแบบนี้ใน การรันตัวแทนการเขียนโค้ดในขนาน
ความเป็นส่วนตัวที่คุณไม่ต้องโต้แย้ง
สำหรับทีมหลายทีม ปัจจัยที่ตัดสินใจไม่ใช่ค่าใช้จ่าย แต่เป็นที่ที่โค้ดไป อุตสาหกรรมที่มีการควบคุม งานของลูกค้าภายใต้ NDA โค้ดเบสภายในที่กฎหมายไม่อนุญาตให้ใกล้ API ของบุคคลที่สาม: การอนุมานในเครื่องตอบคำถามก่อนที่จะถูกถาม เพราะโมเดลรันบนเครื่องและคำสั่งไม่เคยข้ามเครือข่าย ไม่มีอะไรให้ตรวจสอบ ไม่มีข้อตกลงการประมวลผลข้อมูล ไม่มีข้อกำหนดการอยู่อาศัยของข้อมูล
AgentsRoom เหมาะสมกับท่าทีนี้ตั้งแต่ต้นจนจบ โมเดลในเครื่องเก็บโค้ดของคุณไว้ในเครื่อง และการซิงค์ของ AgentsRoom ระหว่างเดสก์ท็อปและโทรศัพท์ของคุณได้รับการเข้ารหัสแบบ end-to-end ดังนั้นการดูแลฝูงชนจากข้ามห้องจะไม่ทำให้ความเป็นส่วนตัวที่โมเดลในเครื่องเพิ่งซื้อให้คุณหายไป หากการปฏิบัติตามเป็นเหตุผลที่คุณกำลังอ่านสิ่งนี้ การรวมกันนั้นคือจุดประสงค์ และมันเข้ากันได้ดีกับแนวทางในบันทึกของเราเกี่ยวกับ การเขียนโค้ดตามอารมณ์และการปฏิบัติตาม GDPR
รูปแบบไฮบริดจึงเกิดขึ้นเอง: ส่งงานส่วนตัวและจำนวนมากไปยังโมเดลในเครื่อง ยกระดับเฉพาะการวิเคราะห์ที่ยากและไม่ละเอียดอ่อนไปยังคลาวด์ และให้ระดับจัดการการส่งต่อ คุณจะได้พลังงานที่ทันสมัยในที่ที่มันสร้างรายได้ และความเป็นส่วนตัวในเครื่องในทุกที่อื่น
ทำไมมันถึงสำคัญ
AgentsRoom ไม่เคยเป็นลูกค้าสำหรับโมเดลหรือผู้ขายเพียงหนึ่งเดียว มันเป็นห้องควบคุมสำหรับการรันตัวแทนที่เหมาะสมสำหรับแต่ละงาน ข้างๆ กัน ภายใต้สายตาคู่หนึ่ง Ollama ขยายสัญญานั้นในลักษณะเฉพาะ: มันไม่ใช่ตัวแทนคลาวด์อีกหนึ่งตัวที่จะเชื่อมต่อ มันคือระบบนิเวศน้ำหนักเปิดทั้งหมด บนเงื่อนไขของคุณ ราคาเป็นศูนย์และเป็นส่วนตัวโดยค่าเริ่มต้น
ในเครื่องสำหรับคนจำนวนมาก คลาวด์สำหรับคนไม่กี่คน และระดับเพื่อย้ายตัวแทนใดๆ ระหว่างทั้งสอง ดาวน์โหลด AgentsRoom เชื่อมต่อ Ollama และทำให้ห้องเต็มไปด้วยโมเดลโอเพนซอร์สทำงาน ดู ตารางความเข้ากันได้ของผู้ให้บริการทั้งหมด หรืออ่านเพิ่มเติมเกี่ยวกับ การสนับสนุนหลายผู้ให้บริการ และวิธีการสลับระหว่างการสนทนารักษาบริบทของคุณให้สมบูรณ์
ดาวน์โหลด AgentsRoom
เรียกใช้ AI agents ของคุณ (Claude, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe, Kimi Code) ในทุกโปรเจกต์ของคุณจากหน้าต่างเดียว
แอปคู่หู: ตรวจสอบตัวแทนของคุณได้ทุกที่
นำของคุณเอง: Claude, Codex, Antigravity CLI, หรือผู้ให้บริการ AI อื่น ๆ
ส่งข้อบกพร่องและคำขอไปยังแบ็คล็อกสาธารณะของคุณโดยตรง
มองเห็น AgentsRoom ในการทำงาน