Claude 5.1 เปิดตัวแล้ว! โมเดลที่แข็งแกร่งที่สุดในโลก
chaincatcherต้นฉบับ ติดตาม AI's Machine Heart
เพิ่งเปิดตัว Anthropic ได้เปิดตัวโมเดลรุ่นถัดไป Claude Fable 5.1 และ Claude Mythos 5.1
Anthropic อ้างว่า Claude Fable 5.1 เป็นหนึ่งในโมเดลที่เปิดให้ใช้สาธารณะที่ทรงพลังที่สุด ออกแบบมาสำหรับการให้เหตุผลที่ซับซ้อน งานที่ใช้เวลานาน และเวิร์กโฟลว์เอเจนต์ Claude Mythos 5.1 แสดงถึงการสำรวจขอบเขตความสามารถที่สูงขึ้นของพวกเขา
สิ่งสำคัญที่ต้องทราบคือแม้ว่าทั้งสองจะมีความสามารถโมเดลพื้นฐานเดียวกัน แต่มีการใช้มาตรการความปลอดภัยที่แตกต่างกันสำหรับสถานการณ์การใช้งานที่แตกต่างกัน
Fable 5.1 เปิดให้ผู้ใช้ทั่วไป นักพัฒนา และองค์กรใช้ ในขณะที่ Mythos 5.1 มุ่งเป้าไปที่พันธมิตรในโดเมนที่มีความเสี่ยงสูงที่ผ่านการตรวจสอบแล้ว โดยมีการควบคุมการเข้าถึงที่เข้มงวดกว่า
กล่าวอีกนัยหนึ่ง ตัวหนึ่งรับผิดชอบงานในโลกจริง ส่วนอีกตัวถูกเก็บไว้ในสภาพแวดล้อมที่ควบคุมอย่างเข้มงวดกว่า นี่อาจเป็นการสำรวจรูปแบบอนาคตของผลิตภัณฑ์ AI ของ Anthropic: โมเดลที่แข็งแกร่งที่สุดอาจไม่จำเป็นต้องให้ทุกคนในรูปแบบเดียวกัน
แถลงการณ์อย่างเป็นทางการระบุว่าโมเดลทั้งสองนี้แสดงถึงความก้าวหน้าที่สำคัญในความสามารถของซีรีส์ Claude และแสดงให้เห็นว่าพวกเขายังคงพัฒนาการปรับใช้ที่ปลอดภัยในขณะที่เพิ่มความสามารถของโมเดล 
ในฐานะโมเดลที่ "แข็งแกร่งที่สุดบนพื้นผิว" Fable 5.1 ยังคงทำผลงานได้น่าประทับใจ ข้อมูลอย่างเป็นทางการแสดงให้เห็นว่า Fable 5.1 มีประสิทธิภาพเหนือกว่า Fable 5 รุ่นเรือธงก่อนหน้าในการทดสอบมาตรฐานหลายรายการ 
อย่างไรก็ตาม ด้วยความสามารถที่มากขึ้น ราคากลับลดลง Anthropic ระบุว่า Fable 5.1 ยังคงราคาพื้นฐานเท่าเดิม ในขณะที่ค่าใช้จ่ายในการอ่านแคชลดลง 75% เมื่อเทียบกับ Fable 5 ในการใช้งานจริง สิ่งนี้ช่วยลดต้นทุนโดยรวมของโมเดลสำหรับเวิร์กโหลดทั่วไปประมาณ 25% สำหรับเวิร์กโหลดที่มีความเป็นเอเจนต์สูง ต้นทุนสามารถลดลงได้สูงสุด 45% 
ดูเหมือนว่าแม้แต่โมเดลที่ทรงพลังที่สุดก็ยังให้ความสำคัญกับความคุ้มค่า
มาดูรายละเอียดกัน
ระดับล่างไล่ตามรุ่นก่อนหน้า Fable 5.1 เน้น "ความคุ้มค่า"
แทนที่จะเพียงแค่รีเฟรชกระดานผู้นำ Anthropic ต้องการเน้นในครั้งนี้ว่า Fable 5.1 สามารถทำงานที่ก่อนหน้านี้ต้องใช้ระดับสูงของ Fable 5 ได้ด้วยต้นทุนการอนุมานที่ต่ำกว่า
จากการทดสอบอย่างเป็นทางการ Fable 5.1 มีประสิทธิภาพใกล้เคียงหรือเกินกว่า Fable 5 ที่ความเข้มข้นการอนุมานต่ำถึงปานกลาง Claude Code ใช้ความเข้มข้นการอนุมานสูงเป็นค่าเริ่มต้น ในขณะที่ Claude Cowork และ Claude .ai ใช้ความเข้มข้นปานกลางเป็นค่าเริ่มต้น ช่วยให้ผู้ใช้ปรับระหว่างความเร็ว ต้นทุน และประสิทธิผลตามความซับซ้อนของงาน
โดยเฉพาะ Fable 5.1 ได้คะแนน 52.6% ในมาตรฐานเอเจนต์วิจัยทางวิทยาศาสตร์ Terminal - Bench - Science 0.1 มากกว่าสองเท่าของ Fable 5 ที่ 24.7%; ใน Terminal - Bench 4.0 Fable 5.1 ทำได้ 55.8% และ Mythos 5.1 ที่มีความสามารถมากกว่าทำได้ 60.9%
ในงานความรู้ การทำงานกับคอมพิวเตอร์ และการทดสอบกระบวนการทางธุรกิจ โมเดลใหม่ก็แสดงการปรับปรุงเช่นกัน คะแนน AutomationBench เพิ่มขึ้นจาก 17.1% ของ Fable 5 เป็น 31.4% และ CursorBench 3.2.0 ดีขึ้นจาก 70.5% เป็น 73.4% 
ในการทดสอบมาตรฐานหลายรายการ คะแนนของ Fable 5.1 สูงกว่า Fable 5 โดยการปรับปรุงที่สำคัญที่สุดเห็นได้ในเอเจนต์วิจัยทางวิทยาศาสตร์และความสามารถด้านเวิร์กโฟลว์ธุรกิจ 
ในการทดสอบ Terminal - Bench 4.0 ทั้ง Fable 5.1 และ Mythos 5.1 มีประสิทธิภาพเหนือกว่า Mythos 5 รุ่นก่อนหน้าที่ความเข้มข้นการอนุมานต่างกัน 
ในการทดสอบ Terminal - Bench - Science 0.1 Fable 5.1 ได้คะแนนสูงสุด 52.6% มากกว่าสองเท่าของ Fable 5
Anthropic เชื่อว่าการเปลี่ยนแปลงที่สำคัญใน Fable 5.1 คือความเต็มใจที่มากขึ้นในการติดตามสาเหตุของปัญหา ทำให้เหมาะสำหรับการทำงานที่ซับซ้อนซึ่งใช้เวลานานหลายชั่วโมงหรือหลายสิบชั่วโมง
บริษัทการลงทุน Millennium พบในการทดสอบว่าโค้ดภายในชิ้นหนึ่งขัดข้องประมาณหนึ่งครั้งต่อการรันหนึ่งล้านครั้ง ปัญหานี้รบกวนทีมวิศวกรรมมาสี่ถึงห้าปี และโมเดลอื่นไม่สามารถระบุสาเหตุได้ Fable 5.1 ระบุปัญหาได้ว่าเป็นบั๊กในไลบรารีโปรแกรมของบุคคลที่สามโดยการถอดประกอบไลบรารีของผู้จำหน่ายภายนอกและเปรียบเทียบไฟล์ core dump
Ramp ยังให้ Fable 5.1 รันต่อเนื่องเป็นเวลา 38 ชั่วโมง หลังจากพบว่าผลลัพธ์การเรียนรู้ของเครื่องเดิมได้รับผลกระทบจากข้อผิดพลาดในการติดป้ายกำกับ โมเดลได้แก้ไขปัญหาอย่างอัตโนมัติและเริ่มการทดลองหกชุดพร้อมกัน ในที่สุดก็รวบรวมผลลัพธ์ใหม่และคำแนะนำที่ตามมา
จากการเขียนโค้ดสู่การทำวิจัยทางวิทยาศาสตร์
ในการเปิดตัวครั้งนี้ Anthropic ใช้ส่วนสำคัญในการพูดถึงประสิทธิภาพของ Fable 5.1 และ Mythos 5.1 ในการวิจัยทางวิทยาศาสตร์
ในการทดลองออกแบบโปรตีน นักวิจัยให้ Mythos 5.1 เรียกใช้เครื่องมือออกแบบและพับโปรตีนโอเพนซอร์ส จากนั้นส่งการออกแบบที่สร้างขึ้นไปยังสถาบันภายนอกสองแห่งเพื่อตรวจสอบเชิงทดลอง
สำหรับโปรตีนเป้าหมายสามชนิด ความสัมพันธ์ในการจับของลิแกนด์ที่ออกแบบโดย Mythos 5.1 สูงถึงสิบเท่าของโซลูชันที่ดีที่สุดในการแข่งขันออกแบบโปรตีนที่เกี่ยวข้องของ Adaptyv Bio เมื่อเผชิญกับโปรตีนเป้าหมายสิบสองชนิด อัตราการพบลิแกนด์ที่มีประสิทธิภาพของโมเดลเข้าใกล้ 50% ในขณะที่ระดับทั่วไปในอุตสาหกรรมที่ Anthropic ให้ไว้คือ 10% ถึง 15%
Fable 5.1 ยังใช้ภาพเรดาร์ที่เก็บโดยยานอวกาศ Magellan ของ NASA เมื่อกว่า 30 ปีที่แล้วเพื่อสร้างแผนที่ระดับความสูงความละเอียดสูงใหม่สำหรับประมาณหนึ่งในสามของพื้นผิวดาวศุกร์ 
ภาพเรดาร์ของดาวศุกร์ที่ถ่ายโดยยานอวกาศ Magellan ของ NASA มีภูเขาไฟโล่ขนาดเล็กเส้นผ่านศูนย์กลางประมาณ 15 กิโลเมตรอยู่ตรงกลาง
แผนที่เดิมสามารถแสดงรายละเอียดได้ที่มาตราส่วน 10 ถึง 20 กิโลเมตร ในขณะที่แผนที่ใหม่ปรับปรุงความละเอียดเป็น 2 ถึง 3 กิโลเมตร โดยความแม่นยำในการวัดความสูงดีขึ้นสูงสุด 25% Anthropic วางแผนที่จะเผยแพร่แผนที่นี้ภายใต้ใบอนุญาตแบ่งปันความรู้สำหรับภารกิจในอนาคต เช่น VERITAS ของ NASA และ EnVision ขององค์การอวกาศยุโรป
ในสาขาชีววิทยาเชิงคำนวณ Mythos 5.1 ปรับปรุงความเร็วในการรันของโมเดลการเรียนรู้เชิงลึกด้านโปรตีนและจีโนมโอเพนซอร์สเจ็ดตัวได้สูงสุด 2.5 เท่าโดยการเขียนเคอร์เนล GPU แบบกำหนดเองและแคชผลลัพธ์กลาง ในขณะที่รักษาผลลัพธ์ที่สอดคล้องกัน ในงานวิเคราะห์จีโนมทั้งหมดบางงาน คาดว่าจะลดต้นทุน GPU ลง 30% ถึง 60% 
หลังจากปรับแต่งโมเดลโปรตีนและจีโนมโอเพนซอร์สเจ็ดตัว ความเร็วในการอนุมานของ Mythos 5.1 เพิ่มขึ้น 1.4 ถึง 2.5 เท่า
Anthropic มีเป้าหมายที่จะใช้กรณีเหล่านี้เพื่อแสดงให้เห็นว่าโมเดลกำลังพัฒนาจากการจัดระเบียบข้อมูลและเขียนโค้ดไปสู่การเสนอวิธีแก้ปัญหา รันเครื่องมือ และส่งมอบผลการวิจัยที่สามารถตรวจสอบเชิงทดลองได้
ราคาแคชลดลง 75% งานเอเจนต์ถูกลงสูงสุด 45%
นอกเหนือจากประสิทธิภาพ ราคาคือการเปลี่ยนแปลงที่ตรงที่สุดใน Fable 5.1
ราคาอินพุตและเอาต์พุตของ Fable 5.1 ไม่ได้ปรับ ยังคงอยู่ที่ $10 ต่อล้านโทเค็นและ $50 ตามลำดับ แต่ราคาอ่านแคชลดลง 75% เหลือ $0.25 ต่อล้านโทเค็น
การอ่านแคชหมายถึงโมเดลนำบริบทที่ประมวลผลแล้วกลับมาใช้ใหม่ สัดส่วนอาจจำกัดในคำถาม-คำตอบทั่วไป แต่ในงานเอเจนต์ที่ต้องอ่านโค้ดเบส บทสนทนาประวัติ และผลลัพธ์ของเครื่องมือซ้ำๆ แคชมักเป็นต้นทุนหลัก
ตามการคำนวณของ Anthropic จากข้อมูลการใช้งานจริงในเดือนสิงหาคม 2026 ต้นทุนโดยรวมของการรันงานทั่วไปด้วย Fable 5.1 ต่ำกว่า Fable 5 ประมาณ 25% สำหรับงานเอเจนต์ที่ซับซ้อนที่มีบริบทยาวและการเรียกเครื่องมือบ่อย การลดต้นทุนอาจสูงถึงประมาณ 45% 
หลังจากการลดราคาอ่านแคช ต้นทุนของงานทั่วไปด้วย Fable 5.1 ลดลงประมาณ 25% ในขณะที่ต้นทุนของงานที่มีความเป็นเอเจนต์สูงลดลงสูงสุดประมาณ 45%
Fable 5.1 พร้อมใช้งานแล้วบน Claude .ai, Claude Code และ Claude API และยังให้บริการผ่าน AWS, Google Cloud และ Microsoft Azure นักพัฒนาสามารถเรียกโมเดลใหม่ผ่าน claude - fable -5-1
กลไกป้องกันการกลั่นที่แข็งแกร่งขึ้น
Fable 5.1 และ Mythos 5.1 ใช้โมเดลพื้นฐานเดียวกันจริงๆ ความแตกต่างหลักคือข้อจำกัดด้านความปลอดภัย
Fable 5.1 เปิดให้ผู้ใช้ทั่วไปและองค์กรอย่างเต็มที่ Mythos 5.1 มีข้อจำกัดด้านความปลอดภัยทางไซเบอร์และวิทยาศาสตร์ชีวภาพที่ผ่อนคลายกว่า และปัจจุบันมีให้เฉพาะบุคคลและสถาบันที่ผ่านการตรวจสอบแล้ว
ในด้านความปลอดภัยทางไซเบอร์ Fable 5.1 สามารถช่วยผู้ใช้ค้นหาช่องโหว่ของซอฟต์แวร์ได้แล้ว แต่ยังไม่สามารถสร้างโปรแกรมโจมตีได้โดยตรง งานแบบใช้สองทาง เช่น การทดสอบเจาะระบบ การสร้างช่องโหว่ และการสแกนช่องโหว่จากไฟล์ไบนารี อาจยังต้องส่งต่อไปยังโมเดลที่มีข้อจำกัดเข้มงวดกว่า
หลังจากการปรับปรุง กลไกการป้องกันความปลอดภัยทางไซเบอร์เวอร์ชันใหม่ลดผลบวกลวงลงประมาณ 60% เมื่อเทียบกับ Fable 5 อัตราผลบวกลวงสำหรับกลไกความปลอดภัยทางชีวภาพในคำถามชีววิทยาพื้นฐานและการแพทย์ก็ลดลง 85% ในขณะที่ความสามารถขั้นสูงที่เกี่ยวข้องกับการวิจัยวิทยาศาสตร์ชีวภาพเปิดผ่านโปรแกรมตรวจสอบ Mythos 5.1 เป็นหลัก
Anthropic ยังเปิดตัว Enterprise Frontier Safeguards องค์กรสามารถเก็บข้อมูลในโครงสร้างพื้นฐานคลาวด์ที่ควบคุมได้ โดยองค์กรรับผิดชอบการตรวจสอบด้วยตนเองเป็นค่าเริ่มต้น จึงได้ผลความเป็นส่วนตัวแบบ "เก็บข้อมูลเป็นศูนย์" เกือบทั้งหมดในขณะที่ยังคงความสามารถในการตรวจสอบความปลอดภัย กลไกนี้มีแผนจะเริ่มใช้เป็นระยะตั้งแต่ฤดูใบไม้ร่วงนี้
สำหรับการกลั่นโมเดลขนาดใหญ่ Fable 5.1 ยังเพิ่มข้อจำกัดใหม่ บัญชี API ที่สร้างหลังจากวันนั้นจะไม่สามารถแก้ไขบริบทก่อนหน้าในการสนทนาหลายรอบด้วยตนเองในขณะที่ยังคงบันทึกความคิดทางประวัติศาสตร์ของ Claude ไว้ Anthropic ระบุว่าการเปลี่ยนแปลงนี้มีจุดประสงค์หลักเพื่อบล็อกวิธีการสกัดความสามารถที่เป็นที่รู้จักกันทั่วไป
นอกจากนี้ เพื่อให้เป็นไปตามข้อกำหนดของกฎหมายปัญญาประดิษฐ์ของสหภาพยุโรป เอาต์พุตข้อความของ Fable 5.1 จะรวมลายน้ำที่มองไม่เห็น Anthropic ยังเริ่มทดสอบ API การตรวจจับในขนาดเล็ก โดยเริ่มแรกเปิดให้หน่วยงานกำกับดูแล สื่อ องค์กรตรวจสอบข้อเท็จจริง และสถาบันวิจัย
สุดท้าย ชาวเน็ตพูดถูก นกที่ตื่นเช้าได้ใช้ 5.1 ก่อน 
เนื้อหานี้จัดทำขึ้นโดยมีวัตถุประสงค์เพื่อแจ้งข้อมูลและให้ความรู้เท่านั้น และไม่ถือว่าเป็นคำแนะนำด้านการลงทุนที่เกี่ยวข้องกับ BTCC แต่อย่างใด BTCC ใช้ความพยายามอย่างเต็มที่ แต่ไม่สามารถรับประกันความจริงแท้ ความถูกต้อง หรือความเป็นต้นฉบับของเนื้อหาข้างต้นได้