ยินดีต้อนรับสู่ยุค AGI: OpenAI เปิดตัว GPT-6 Astra
chaincatcherบทความโดย Tencent Tech เสี่ยวจิง
"ยินดีต้อนรับสู่ยุค AGI"
Greg Brockman ผู้ร่วมก่อตั้งและประธานของ OpenAI กล่าวสรุปการเปิดตัว GPT-6 Astra ด้วยประโยคนี้
เมื่อวันที่ 3 กันยายน ตามเวลาท้องถิ่นสหรัฐอเมริกา OpenAI ได้เปิดตัว GPT-6 Astra อย่างเป็นทางการ เมื่อเทียบกับโมเดลก่อนหน้าที่เน้นการตอบคำถาม สร้างเนื้อหา และเรียกใช้เครื่องมือเป็นหลัก Astra ก้าวไปอีกขั้นด้วยความสามารถในการทำงานต่อเนื่องจนเสร็จสมบูรณ์ ตั้งแต่รับคำสั่ง ใช้งานซอฟต์แวร์ ไปจนถึงปรับการดำเนินการตามผลลัพธ์ นี่เป็นหนึ่งในเหตุผลที่ OpenAI ประกาศเข้าสู่ "ยุค AGI" อีกครั้ง
OpenAI วางตำแหน่ง Astra เป็น "โมเดลที่ใช้คอมพิวเตอร์ได้เก่งที่สุดในโลก" ความสามารถนี้ขยายจากงานง่าย ๆ เช่น การท่องเว็บ อีเมล และสเปรดชีต ไปสู่ซอฟต์แวร์เฉพาะทางอย่าง Power BI, KiCad และ FreeCAD เริ่มเข้าสู่เวิร์กโฟลว์ที่ซับซ้อนมากขึ้น เช่น การวิเคราะห์ข้อมูล การออกแบบเชิงวิศวกรรม การทดสอบซอฟต์แวร์ และการแก้ไขปัญหา
ในวิดีโอสาธิตของ OpenAI Astra สามารถเริ่มจากภาพกราฟิกง่าย ๆ แล้วทำงานต่อเนื่องจนเสร็จ เช่น เกม 3D และหน้าเว็บผลิตภัณฑ์ OpenAI ยังให้ตัวอย่างการออกแบบแผงวงจร การสร้างโมเดลด้วย Blender เอกสารทางกฎหมาย Excel และการวิเคราะห์ทางวิทยาศาสตร์ 
ผลการทดสอบมาตรฐานหลายรายการที่ OpenAI เผยแพร่แสดงให้เห็นว่าการพัฒนาขีดความสามารถมุ่งเน้นไปที่งานที่ต้องดำเนินการต่อเนื่อง เช่น การใช้งานคอมพิวเตอร์ การเขียนโค้ดระยะยาว การออกแบบเชิงวิศวกรรม และการวิจัยทางวิทยาศาสตร์ Astra ทำคะแนนได้ 100% ใน ExploitBench และทำผลงานเหนือกว่ารุ่นก่อนหน้าอย่างมีนัยสำคัญในการทดสอบการใช้งานคอมพิวเตอร์และ CAD
ปัจจุบัน Astra เปิดให้บางองค์กรใช้งานแล้ว และจะทยอยเปิดให้ผู้ใช้ ChatGPT Plus, Pro, Business และ Enterprise ในอีกไม่กี่วันข้างหน้า นอกจากนี้ยังสามารถใช้งานผ่าน OpenAI API และ Amazon Bedrock ได้ ราคา API มาตรฐานอยู่ที่ 10 ดอลลาร์สหรัฐต่อโทเคนขาเข้า 1 ล้านโทเคน และ 50 ดอลลาร์สหรัฐต่อโทเคนขาออก 1 ล้านโทเคน ซึ่งสูงกว่า GPT-5.6 Sol 2.5 เท่า
01 สอน AI ให้ "ใช้คอมพิวเตอร์" ก่อน
การเปลี่ยนแปลงที่ใหญ่ที่สุดที่ Astra เน้นคือ "การใช้คอมพิวเตอร์" ในอดีต ผู้ใช้ต้องเชื่อมต่อ AI เข้ากับซอฟต์แวร์เฉพาะเพื่อทำงานให้เสร็จ องค์กรต้องพัฒนา API ปลั๊กอิน ระบบค้นหา และตัวเชื่อมต่อต่าง ๆ เพื่อให้โมเดลเรียกใช้เครื่องมือภายในได้
Astra พยายามข้ามขั้นตอนบางอย่าง โดยสามารถมองเห็นหน้าจอคอมพิวเตอร์และใช้เมาส์ คีย์บอร์ด และเบราว์เซอร์ในการทำงาน ตัวอย่างที่ OpenAI ให้ไว้ ได้แก่ การกรอกแบบฟอร์มออนไลน์ การอัปเดตบันทึกลูกค้าใน CRM การจัดตารางนัดหมาย การค้นหาเว็บ และการรวบรวมผลการค้นหาเป็นอีเมลหรือเอกสาร
นอกจากนี้ยังสามารถเปิด Python notebook เพื่อวิเคราะห์ข้อมูลทางวิทยาศาสตร์ ประมวลผลข้อมูลใน Power BI ใช้ KiCad และ FreeCAD ในการออกแบบเชิงวิศวกรรม สร้างเว็บไซต์และทดสอบส่วนหน้า ติดตั้งซอฟต์แวร์ ตรวจสอบข้อผิดพลาด และจัดการปัญหาที่ปรากฏบนหน้าจอ
OpenAI สาธิต Astra ทำงานจัดวาง PCB ใน KiCad โมเดลเริ่มจากแผนภาพวงจรอิเล็กทรอนิกส์ วางชิ้นส่วนบนแผงวงจร แล้วเดินสายทองแดงให้เสร็จ กระบวนการทั้งหมดถูกย่อให้เหลือ 15 วินาที สำหรับวิศวกร งานที่เคยต้องทำด้วยมือเหล่านี้ ตอนนี้โมเดลสามารถทำแทนได้ 
อีกตัวอย่างหนึ่งคือการสร้างโมเดล 3D ใน Blender และ Unreal Engine 5 Astra สร้างบ้านใน Blender ก่อน แล้วแปลงโมเดลเป็นฉากที่เดินชมได้ใน Unreal Engine 5 เพื่อให้นักออกแบบและลูกค้าสามารถเข้าไปดูพื้นที่ล่วงหน้าได้ 
OpenAI ยังสาธิตสถานการณ์การพัฒนาเกม Excel Power BI ระบบส่งกำลังรถยนต์ เอกสารทางกฎหมาย และแบบฟอร์ม 1040
ในการทดสอบชุดข้อมูลย่อยแบบออฟไลน์ OSWorld 2.0 Astra ได้คะแนน 72.6% ส่วน GPT-5.6 Sol ได้ 65.7% หลังจากจำลองความหน่วงตามจริง OpenAI พบว่า Astra ใช้เวลาเฉลี่ยประมาณ 40 นาทีต่อภารกิจ ในขณะที่ GPT-5.6 Sol ใช้เวลาประมาณ 75 นาที ลดเวลาลงประมาณ 47%
ใน Agents' Last Exam Astra ได้คะแนน 59.3% GPT-5.6 Sol ได้ 53.6% และ Claude Opus 5 ได้ 55.5% นอกจากนี้ ในการตั้งค่าคะแนนสูงสุด Astra ใช้โทเคนขาออกน้อยกว่า Claude Opus 5 ประมาณ 65%
คะแนน ScreenSpot-Pro สูงถึง 92.7% ในขณะที่ GPT-5.6 Sol ได้ 76.9%
ความเร็วก็เพิ่มขึ้นเช่นกัน OpenAI อัปเดตเฟรมเวิร์ก Codex พร้อมกัน เมื่อใช้ร่วมกับ Astra ความเร็วในการทำงานให้เสร็จในการทดสอบ Mind2Web สูงถึง 1.9 เท่าของประสบการณ์ GPT-5.6 Sol ในปัจจุบัน
การสาธิตอย่างเป็นทางการยังรวมถึงสถานการณ์ในชีวิตประจำวันหลายอย่าง เช่น การค้นหากุมารแพทย์ การหาอพาร์ตเมนต์ การนัดหมายกับ DMV (กรมการขนส่งทางบก) การหาขนมคาร์โบไฮเดรตต่ำ และการวิเคราะห์โรงเรียนอนุบาล ในการสาธิต Astra ทำงานหนึ่งอย่างเสร็จภายใน 2 นาที 54 วินาที
Matt Shumer นักลงทุนและผู้ปฏิบัติงานด้าน AI แชร์ประสบการณ์บน X เขาให้ Astra สร้างโลกใน Unreal Engine แล้วเพิ่มเอเจนต์ที่เหมือนมนุษย์ซึ่งขับเคลื่อนโดย Astra เพื่อให้เอเจนต์เหล่านี้อยู่ร่วมกัน

หนึ่งวันต่อมา เขาได้ยินเสียงจากห้องนั่งเล่นขณะอยู่ในห้องนอน ตอนแรกคิดว่ามีคนบุกรุกอพาร์ตเมนต์ ต่อมาพบว่าเสียงมาจากเอเจนต์ Astra เหล่านั้นที่เริ่มสื่อสารกันเอง
ประสบการณ์นี้ยังไม่เสถียรนัก แต่ Shumer คิดว่าผลลัพธ์ที่เอเจนต์ AI หลายตัวเข้าสู่โลกเสมือนเดียวกันและโต้ตอบกันเองได้นั้นน่าทึ่งพอสำหรับเขา
Silas Alberti รองประธานอาวุโสฝ่ายวิจัยของ Cognition กล่าวว่าบริษัทวางแผนที่จะรวม Astra เข้ากับเฟรมเวิร์ก Devin ในวันเปิดตัว ในการทดสอบภายใน Astra มีพัฒนาการอย่างมากในด้านการใช้คอมพิวเตอร์ การเขียน และความเข้าใจฐานโค้ด การเข้าใจวิดีโอชัดเจนขึ้น และรายงานกระชับขึ้น
02 จากเขียนโค้ดสู่การทำงานทั้งหมดให้เสร็จ
หลังจากความสามารถในการใช้คอมพิวเตอร์เพิ่มขึ้น ขอบเขตงานที่ Astra ครอบคลุมก็ขยายกว้างขึ้น OpenAI วางตำแหน่งให้เป็นโมเดลสำหรับวิศวกรรมซอฟต์แวร์ งานวิชาชีพ และการวิจัยทางวิทยาศาสตร์ มันสามารถจัดการงานที่ยาวขึ้นและปรับทิศทางการทำงานตามการเปลี่ยนแปลงของงาน
ความสามารถนี้เห็นได้ชัดเป็นพิเศษในการทดสอบการเขียนโค้ด
ในการทดสอบ Terminal-Bench 4.0 Astra ได้คะแนน 57.9% GPT-5.6 Sol ได้ 37.3% และ Claude Fable 5.1 ได้ 55.8%
ใน DeepSWE v1.1 Astra ได้คะแนน 74.1% GPT-5.6 Sol ได้ 72.7% ในงานย้ายฐานข้อมูลภายใน Astra ได้ 63.9% GPT-5.6 Sol ได้ 42.7%
Astra ยังนำการปรับปรุงสำหรับงาน Codex ระยะยาวมาใช้
ในอดีต เมื่องานยาวเจอข้อจำกัดของหน้าต่างบริบท โมเดลมักต้องบีบอัดงานก่อนหน้าเป็นบทสรุป ซึ่งมักทำให้รายละเอียดสูญหาย เช่น เหตุใดการแก้ไขบางอย่างจึงล้มเหลว หรือชิ้นส่วนบางอย่างเคยเจอปัญหาอะไรมาก่อน
Astra สามารถเก็บข้อมูลสำคัญระหว่างการทำงานของ Codex และเรียกค้นในบริบทถัดไปได้ ข้อความและผลลัพธ์ของเครื่องมือในช่วงแรกยังคงค้นหาได้ ทำให้โมเดลสามารถค้นพบความต้องการ ผลการทดสอบ และบันทึกการทำงานของเครื่องมือก่อนหน้านี้ได้อีกครั้ง
การเปลี่ยนแปลงคล้ายกันนี้เกิดขึ้นในงานวิชาชีพ ในการทดสอบ BenchCAD Astra ได้คะแนนการทับซ้อนทางเรขาคณิต 95.9% GPT-5.6 Sol ได้ 83.3% และ Claude Fable 5.1 ได้ 84.3% ใน BrowseComp Astra ได้ 91.5% GPT-5.6 Sol ได้ 90.4% ในการทดสอบ OpenScore String Quartets Astra ได้ 0.84 GPT-5.6 Sol ได้ 0.19 
OpenAI ยังสาธิตความสามารถของ Astra ในการสร้างงานนำเสนอ สเปรดชีต และเอกสาร
เมื่อให้สไลด์บางส่วนจากเทมเพลตงานนำเสนอของ OpenAI มันสามารถสร้างงานนำเสนอใหม่ตามน้ำเสียง เค้าโครง และโครงสร้างเดิมได้ มันยังจัดการการคัดเลือกข้อมูลในงาน OpenAI กล่าวว่า Astra ได้รับการฝึกพิเศษให้สามารถนำบริบทสำคัญเข้าสู่ผลลัพธ์สุดท้าย ลดการทำงานซ้ำซ้อน 
เมื่อคำสั่งงานไม่สมบูรณ์ Astra ยังตัดสินใจได้ว่าเมื่อใดควรถามผู้ใช้ หากข้อมูลที่ขาดหายไปส่งผลต่อผลลัพธ์สุดท้าย มันจะถามคำถามที่เจาะจง หากข้อมูลที่ขาดหายไปไม่กระทบต่อทิศทางหลัก มันสามารถทำงานต่อและตั้งสมมติฐานที่สมเหตุสมผล ใน Codex แม้ผู้ใช้ยังไม่ตอบกลับ โมเดลก็สามารถทำงานส่วนอื่นต่อได้ เมื่อเจอการตัดสินใจสำคัญ มันจะรอการยืนยันจากผู้ใช้
Niko Grupen ผู้อำนวยการฝ่ายวิจัยประยุกต์ของ Harvey กล่าวว่าในการทดสอบงานกฎหมายช่วงแรก Astra แยกแยะเอกสารและบันทึกที่มีอยู่ได้ชัดเจนขึ้น ระบุสมมติฐานที่ไม่มีหลักฐานสนับสนุนได้ง่ายขึ้น และเปลี่ยนช่องว่างข้อมูลเป็นข้อเสนอแนะการร่างที่เฉพาะเจาะจง
John Crepezzi จากทีมผู้ช่วย AI ของ Jane Street ชี้ว่า Astra ทำผลงานโดดเด่นในการทดสอบการเขียนโค้ดภายใน เมื่อใช้สำหรับการเขียนโค้ดแบบเอเจนต์ สไตล์การสื่อสารของมันเข้าใจง่ายสำหรับนักพัฒนา และโค้ดที่สร้างขึ้นต้องการการแก้ไขน้อยกว่าเพื่อให้ถึงคุณภาพระดับการผลิต
สาขาวิทยาศาสตร์เป็นอีกจุดเน้นหนึ่ง ใน FrontierMath Tier 4 v2 Astra ได้คะแนน 80.5% ความแม่นยำ 97.6% GPT-5.6 Sol ได้ 83.0% GPQA Diamond ได้ 96.0% GPT-5.6 Sol ได้ 94.6% 
การทดสอบ Terminal-Bench Science 0.1 ประเมินกระบวนการวิจัยทางวิทยาศาสตร์ รวมถึงการวิเคราะห์ข้อมูล การจำลอง และการปรับโมเดล Astra ได้คะแนน 64.6% Claude Fable 5.1 ได้ 52.6% GPT-5.6 Sol ได้ 22.4%
ในการประยุกต์ใช้ทางวิทยาศาสตร์ที่ OpenAI สาธิต Astra สามารถเข้าสู่ซอฟต์แวร์วิทยาศาสตร์เฉพาะทาง ตรวจสอบคุณภาพการจัดลำดับ สร้างภาพการแปรผันของยีน และตัดสินใจทิศทางการวิเคราะห์ถัดไปตามข้อมูล
เมื่อรวมการให้เหตุผลทางวิทยาศาสตร์และการใช้งานคอมพิวเตอร์ โมเดลสามารถทำงานในสภาพแวดล้อมซอฟต์แวร์ที่นักวิจัยใช้อยู่เดิมได้โดยตรง
Greg Burnham จาก Epoch AI ซึ่งเชี่ยวชาญด้านการประเมินความสามารถ กล่าวในงานเปิดตัวว่าการเปลี่ยนแปลงนี้คือการสิ้นสุดของยุคหนึ่งและการเริ่มต้นของอีกยุคหนึ่ง OpenAI เน้นว่าคุณค่าของ Astra ได้ขยายจากการตอบคำถามทางวิทยาศาสตร์ไปสู่การมีส่วนร่วมในเวิร์กโฟลว์ทางวิทยาศาสตร์โดยตรง 
03 ยิ่งเก่ง ยิ่งต้องมีเกณฑ์ความปลอดภัยสูงขึ้น
Astra ยังมีแง่มุมที่พิเศษมากอีกอย่างหนึ่งในครั้งนี้: ความปลอดภัยทางไซเบอร์
ใน ExploitBench Astra ได้ 100% GPT-5.6 Sol ได้ 78.5% ใน ExploitGym Astra ได้ 42.4% GPT-5.6 Sol ได้ 30.3%

OpenAI ยังสร้างการทดสอบภายในครอบคลุมช่องโหว่ล่าสุดระหว่างเดือนมิถุนายนถึงสิงหาคม 2026 ในการทดสอบนั้น อัตราการรันโค้ดตามอำเภอใจของ Astra สูงกว่า GPT-5.6 Sol อย่างมีนัยสำคัญ และใช้โทเคนขาออกน้อยกว่า ระหว่างการทดสอบ Astra ยังค้นพบช่องโหว่ zero-day ที่ไม่รู้จักมาก่อนสองรายการ OpenAI กล่าวว่าได้เปิดเผยต่อผู้ดูแลที่เกี่ยวข้องแล้ว
การทดสอบ SRE-Bench วัดความสามารถในการวิศวกรรมย้อนกลับไฟล์ไบนารีของซอฟต์แวร์โดยไม่มีซอร์สโค้ดและเข้าใจตรรกะหลัก Astra แก้ปัญหาได้ 88.0% ของงานในการลองครั้งเดียว และ 99.2% หลังลองสี่ครั้ง ในขณะที่ GPT-5.6 Sol ได้ 55.9% และ 68.7% ตามลำดับ
การเพิ่มขีดความสามารถยังนำมาซึ่งข้อกำหนดด้านความปลอดภัยใหม่ OpenAI กล่าวว่า Astra ถึงเกณฑ์สำคัญในกรอบความพร้อมด้านความปลอดภัยทางไซเบอร์แล้ว โมเดลสามารถค้นพบช่องโหว่ซอฟต์แวร์ที่ไม่รู้จักมาก่อน และอาจสร้างห่วงโซ่การโจมตีช่องโหว่เพิ่มเติมได้
ดังนั้น Astra เวอร์ชันปัจจุบันจะปฏิเสธการทำงานด้านความปลอดภัยทางไซเบอร์ระดับสูง เช่น การสร้าง proof-of-concept สำหรับช่องโหว่ OpenAI วางแผนที่จะค่อย ๆ ขยายสิทธิ์การเข้าถึงให้ผู้ป้องกันที่เชื่อถือได้ผ่าน Daybreak สำหรับการตรวจสอบช่องโหว่ การวิเคราะห์มัลแวร์ และวิศวกรรมการตรวจจับ
ในด้านการจัดแนว OpenAI ยังให้ข้อมูลที่น่าสนใจ ในการทดสอบมาตรฐานความปลอดภัยการใช้งานคอมพิวเตอร์ภายใน อัตราพฤติกรรมไม่เหมาะสมของ Astra อยู่ที่ 2.4% GPT-5.6 Sol อยู่ที่ 22.0% หลังจากเพิ่ม AutoReview Astra อยู่ที่ 1.8% GPT-5.6 Sol อยู่ที่ 4.5% ในการทดสอบมาตรฐานการหลบเลี่ยงภายใน Astra ได้คะแนน 0.00% GPT-5.6 Sol ได้ 0.29%
ในการทดสอบ honeypot ของ ExploitGym Astra ได้ 0% GPT-5.6 Sol ได้ 48.2% การทดสอบนี้สังเกตว่าโมเดลพยายามหลบเลี่ยงข้อจำกัดเนื่องจากความยากของงานหรือไม่ ในการทดสอบมาตรฐานภาพหลอนภายใน Astra ได้ 4.2% GPT-5.6 Sol ได้ 12.2% 
OpenAI กล่าวว่า Astra ปรับปรุงความเข้าใจขอบเขตงาน การจัดการคำสั่งที่คลุมเครือ และการอธิบายความสามารถให้ผู้ใช้ฟัง ความน่าจะเป็นของภาพหลอนด้านความสามารถอยู่ที่ประมาณหนึ่งในสามของ GPT-5.6 Sol

อย่างไรก็ตาม OpenAI ยอมรับปัญหาหนึ่ง: ยิ่งโมเดลเก่งขึ้น การตรวจสอบกระบวนการให้เหตุผลอาจยิ่งยากขึ้น Jakub Pachocki หัวหน้านักวิทยาศาสตร์เชื่อว่าความสามารถของโมเดลในการแก้ปัญหาที่ซับซ้อนขึ้นด้วยโทเคนการให้เหตุผลภาษาธรรมชาติที่น้อยลง หมายความว่ามนุษย์ยากขึ้นที่จะตัดสินว่าโมเดลกำลังทำอะไรอยู่จริงจากกระบวนการให้เหตุผลที่เป็นข้อความ
ดังนั้น OpenAI จึงรวมการตรวจสอบการจัดแนวที่ไม่ถูกต้องไว้ในการปรับใช้ Astra ระบบจะตรวจสอบการให้เหตุผลและการกระทำของโมเดล หากตรวจพบพฤติกรรมที่ไม่ได้รับอนุญาต ก็สามารถหยุดงานชั่วคราวได้
กลไกนี้อาจส่งผลกระทบจริง งานที่ถูกต้องตามกฎหมายบางครั้งอาจช้าลง หยุดชั่วคราว หรือหยุดไปเลย ใน ChatGPT หรือ Codex ผู้ใช้อาจต้องยืนยันเพื่อดำเนินการต่อ ในเวิร์กโฟลว์ API งานที่ถูกตั้งค่าสถานะอาจหยุดทันที
ดังนั้น เมื่อ Astra เปิดตัว จึงเกิดการเปลี่ยนแปลงที่เป็นจริงมาก: เมื่อ AI เริ่มได้รับสิทธิ์การใช้งานคอมพิวเตอร์มากขึ้น ความกังวลขององค์กรก็ขยายจาก "โมเดลจะตอบผิดหรือไม่?" ไปสู่ "โมเดลสามารถทำอะไรได้บ้าง เข้าถึงอะไรได้บ้าง และต้องหยุดเมื่อใด?"
OpenAI ยังกล่าวถึงว่า Astra เป็นโมเดลแรกที่ใช้ DBU มากกว่า 100,000 หน่วยในการฝึกก่อนบนโครงสร้างพื้นฐาน Stargate Aidan Clark รองประธานฝ่ายวิจัยของ OpenAI กล่าวว่าจากผลการประเมินในขั้นตอนการฝึกก่อน การก้าวกระโดดของความสามารถของ Astra มากกว่าการพัฒนาของ GPT-5.6 Sol เมื่อเทียบกับรุ่นก่อนหน้า
OpenAI ให้เหตุผลว่าการเปลี่ยนแปลงนี้มาจากการผสมผสานระหว่างการฝึกก่อนขนาดใหญ่และการเรียนรู้แบบเสริมกำลัง โดยเน้นการฝึกไปที่การเชื่อมโยงข้อมูล การทำงานที่ยาวขึ้น และการทำงานต่อเนื่องในสภาพแวดล้อมที่ซับซ้อน
04 แพงขึ้น แต่ "เก่งขึ้น"
ราคาของ Astra ก็เปลี่ยนแปลงอย่างมีนัยสำคัญ
ราคามาตรฐานของ OpenAI API อยู่ที่ 10 ดอลลาร์สหรัฐต่อโทเคนขาเข้า 1 ล้านโทเคน และ 50 ดอลลาร์สหรัฐต่อโทเคนขาออก 1 ล้านโทเคน ก่อนหน้านี้ GPT-5.6 Sol อยู่ที่ 4 ดอลลาร์สหรัฐต่อโทเคนขาเข้า 1 ล้านโทเคน และ 20 ดอลลาร์สหรัฐต่อโทเคนขาออก 1 ล้านโทเคน ราคาทั้งขาเข้าและขาออกเพิ่มขึ้น 2.5 เท่า
การอ่านและเขียนแคชคิดค่าบริการแยกกัน OpenAI ยังมีโหมดเร็ว ความเร็วสูงสุด 2.5 เท่าของการประมวลผลมาตรฐาน ราคาเป็นสองเท่าของโหมดมาตรฐาน

เมื่อดูราคาโทเคนเพียงอย่างเดียว Astra แพงกว่าอย่างเห็นได้ชัด อย่างไรก็ตาม OpenAI หวังให้องค์กรคำนวณต้นทุนด้วยวิธีที่ต่างออกไป Brockman เชื่อว่าเมื่อโมเดลเป็นเหมือนเอเจนต์มากขึ้น ต้นทุนต่อโทเคนก็ยากที่จะสะท้อนต้นทุนจริงได้อย่างแม่นยำ โทเคนของโมเดลหนึ่งอาจถูก แต่ถ้าต้องลองซ้ำและแก้ไขโดยมนุษย์ ต้นทุนสุดท้ายในการทำงานให้เสร็จอาจสูงกว่า
ข้อมูลของ OpenAI ก็สนับสนุนการประเมินนี้ ในการทดสอบ Terminal-Bench Science 0.1 Astra ได้คะแนน 64.6% Claude Fable 5.1 ได้ 52.6% ประมาณการว่าต้นทุน API ลดลง 31% ในการตั้งค่าต้นทุนต่ำ Astra ได้ 61.1% ผลลัพธ์ที่ดีที่สุดของ GPT-5.6 Sol คือ 22.4% ประมาณการว่าต้นทุน API ลดลง 27%
ใน BenchCAD Astra ได้คะแนน 95.9% ประมาณการว่าต้นทุน API ต่ำกว่า GPT-5.6 Sol ประมาณ 43% และต่ำกว่า Claude Fable 5.1 ประมาณ 86% ใน Terminal-Bench 4.0 Astra ได้ 57.9% GPT-5.6 Sol ได้ 37.3% Claude Fable 5.1 ได้ 55.8% OpenAI ประมาณการว่าต้นทุนต่อภารกิจต่ำกว่าประมาณ 9% และ 63% ตามลำดับ
ข้อมูลจาก Artificial Analysis ซึ่งเป็นหน่วยประเมินบุคคลที่สามนำเสนอมุมมองอีกแบบหนึ่ง

GPT-6 Astra ได้คะแนน 61.2 ใน Artificial Analysis Intelligence Index ใกล้เคียงกับ GPT-5.6 Sol ที่ 60.9 แต่ใช้โทเคนขาออกน้อยกว่าประมาณ 10% เนื่องจากราคาเพิ่มขึ้น 2.5 เท่า ต้นทุนต่อภารกิจจึงสูงกว่า GPT-5.6 Sol ประมาณ 75%
ใน Artificial Analysis Coding Agent Index Astra ได้คะแนน 67.0 ใกล้เคียงกับ Claude Fable 5 ที่ 67.2 และ Claude Opus 5 ที่ 68.1 Artificial Analysis เห็นว่าในสภาพแวดล้อม Codex Astra ลดโทเคนที่ต้องใช้ในการทำงานให้เสร็จอย่างมีนัยสำคัญ ที่ระดับความพยายามสูงสุด ต้นทุนต่อภารกิจใกล้เคียงกับ GPT-5.6 Sol เมื่อเทียบกับ Claude Fable 5 ต้นทุนในการทำงานคล้ายกันน้อยกว่าครึ่งหนึ่ง
อย่างไรก็ตาม Astra ไม่ได้นำหน้าในการทดสอบทั้งหมด ข้อมูลของ Artificial Analysis แสดงว่ามันลดลงประมาณ 80 Elo ใน GDPval-AA v2 และมีการถดถอยบางส่วนในการทดสอบ τ³-Banking, SciCode และ AA-LCR Humanity's Last Exam เพิ่มขึ้นประมาณ 6 คะแนน
นี่เป็นจุดที่น่าสังเกตในการเปิดตัว Astra ครั้งนี้ OpenAI ไม่ได้เปิดเผยคะแนนของ Astra ใน GDPval GDPval เป็นการทดสอบที่ OpenAI ใช้衡量ประสิทธิภาพทางเศรษฐกิจในโลกจริง ครอบคลุม 44 อาชีพและ 1,320 งาน รวมถึงการสรุปเอกสารทางกฎหมาย การออกแบบเชิงวิศวกรรม สเปรดชีต งานนำเสนอ การสนับสนุนลูกค้า และแผนการดูแล
จากความสามารถที่ Astra แสดงให้เห็น GDPval มีความเกี่ยวข้องอย่างมากกับสถานการณ์งานวิชาชีพที่มันเน้น แต่ OpenAI ไม่ได้รวมคะแนนนี้ไว้ในข้อมูลการเปิดตัวหลัก
ดังนั้น ความสามารถในการทำงานในโลกจริงของ Astra ในปัจจุบันจึงสะท้อนผ่านผลลัพธ์จาก Agents' Last Exam, BenchCAD, AutomationBench, งานออกแบบภายใน และงานวิทยาศาสตร์ข้อมูลเป็นหลัก

ท้ายที่สุด Astra จะกลายเป็นพนักงาน AI ที่องค์กรเต็มใจใช้ในระยะยาวหรือไม่ ขึ้นอยู่กับต้นทุน ความเร็ว ความแม่นยำ และจำนวนครั้งที่ต้องให้มนุษย์เข้ามาแทรกแซงเมื่อทำงานจริง
ส่วนคำถามว่า Astra เป็น AGI หรือไม่ Brockman ตอบอย่างตรงไปตรงมา เขาเชื่อว่า AGI ไม่มีมาตรฐานที่ยอมรับกันทั่วไป การที่ Astra เข้าเกณฑ์ AGI หรือไม่ยังถกเถียงกันได้ อย่างไรก็ตาม หากระบบหนึ่งสามารถรับงานจำนวนมากในการท่องเว็บ การใช้งานคอมพิวเตอร์ การเขียนโปรแกรม คณิตศาสตร์ วิทยาศาสตร์ กฎหมาย และงานวิชาชีพอื่น ๆ ได้แล้ว การกล่าวว่ามันเข้าสู่ยุค AGI แล้วก็ไม่ใช่เรื่องไร้เหตุผล
Sam Altman ซีอีโอของ OpenAI ยังบรรยาย Astra ว่าเป็นโมเดลที่เปิดศักราชใหม่ของการเป็นผู้ประกอบการ การค้นพบทางวิทยาศาสตร์ และการสร้างสรรค์

จินลู่ นักเขียนรับเชิญ มีส่วนร่วมในบทความนี้ด้วย
เนื้อหานี้จัดทำขึ้นโดยมีวัตถุประสงค์เพื่อแจ้งข้อมูลและให้ความรู้เท่านั้น และไม่ถือว่าเป็นคำแนะนำด้านการลงทุนที่เกี่ยวข้องกับ BTCC แต่อย่างใด BTCC ใช้ความพยายามอย่างเต็มที่ แต่ไม่สามารถรับประกันความจริงแท้ ความถูกต้อง หรือความเป็นต้นฉบับของเนื้อหาข้างต้นได้