Gemini 3.8 Live เปิดตัว AI เสียง คิดและทำงานแบบเรียลไทม์

Share on Line Share on Facebook Share on X
Gemini 3.8 Live เปิดตัว AI เสียง คิดและทำงานแบบเรียลไทม์

Google เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking เพิ่มฟีเจอร์สำหรับการสนทนาด้วยเสียงมุ่งยกระดับความสามารถของ Voice Agent ให้สามารถพูดคุยกับมนุษย์ได้เป็นธรรมชาติมากขึ้น พร้อมรับรู้ข้อมูลจากภาพ ให้เหตุผลกับงานที่ซับซ้อน และเรียกใช้เครื่องมือหรือ API ทำงานเบื้องหลังโดยไม่จำเป็นต้องหยุดบทสนทนา

สรุปข่าว

Google เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking เพิ่มฟีเจอร์สำหรับการสนทนาด้วยเสียงมุ่งยกระดับความสามารถของ Voice Agent ให้สามารถพูดคุยกับมนุษย์ได้เป็นธรรมชาติมากขึ้น พร้อมรับรู้ข้อมูลจากภาพ ให้เหตุผลกับงานที่ซับซ้อน และเรียกใช้เครื่องมือหรือ API ทำงานเบื้องหลังโดยไม่จำเป็นต้องหยุดบทสนทนา

Google เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking เพิ่มฟีเจอร์สำหรับการสนทนาด้วยเสียงมุ่งยกระดับความสามารถของ Voice Agent ให้สามารถพูดคุยกับมนุษย์ได้เป็นธรรมชาติมากขึ้น พร้อมรับรู้ข้อมูลจากภาพ ให้เหตุผลกับงานที่ซับซ้อน และเรียกใช้เครื่องมือหรือ API ทำงานเบื้องหลังโดยไม่จำเป็นต้องหยุดบทสนทนา

Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking ต่างกันอย่างไร ?

Google แบ่งบทบาทของ AIใหม่ทั้งสองรุ่นค่อนข้างชัดเจน โดย Gemini 3.8 Live เน้นการรองรับการใช้งานในวงกว้าง ประสิทธิภาพด้านต้นทุน และการสนทนาที่ลื่นไหล ขณะที่ Gemini 3.8 Live Extended Thinking ถูกออกแบบมาสำหรับงานที่ซับซ้อนกว่าและต้องใช้การให้เหตุผลแบบหลายขั้นตอน

Gemini 3.8 Live จึงเหมาะกับสถานการณ์ที่ต้องการ Voice Agent ซึ่งสามารถรองรับผู้ใช้จำนวนมาก ขณะที่ยังรักษาความเร็วในการตอบสนองและต้นทุนให้เหมาะสม ส่วน Gemini 3.8 Live Extended Thinking เพิ่มความสามารถด้านการคิดวิเคราะห์ในระดับที่สูงขึ้น โดยสามารถคิดและพูดไปพร้อมกันระหว่างจัดการกับงานที่ซับซ้อน

หนึ่งในความสามารถสำคัญของ Gemini 3.8 Live คือการเรียกใช้เครื่องมือและ API แบบเบื้องหลัง หรือ Asynchronous Function Calling ซึ่งหมายความว่า AI ไม่จำเป็นต้องหยุดการสนทนาเพียงเพราะกำลังดำเนินงานบางอย่างอยู่ ตัวอย่างเช่น หากผู้ใช้สั่งให้ AI ตรวจสอบข้อมูลหรือดำเนินการบางอย่าง Gemini สามารถรับทราบคำสั่งและเริ่มทำงานผ่านเครื่องมือที่เกี่ยวข้อง ขณะเดียวกันก็ยังสามารถพูดคุยกับผู้ใช้ต่อได้ เมื่อกระบวนการเบื้องหลังเสร็จสิ้น AI จึงสามารถนำผลลัพธ์กลับมาสานต่อบทสนทนาได้

Google มองว่าความสามารถนี้มีความสำคัญต่อการสร้าง Voice Agent ที่ต้องทำงานจริง เพราะลดปัญหาช่วงเงียบระหว่างที่ AI กำลังประมวลผลหรือรอระบบภายนอกตอบกลับ นอกจากนี้ Gemini 3.8 Live ยังสามารถรับข้อมูลภาพเกือบแบบเรียลไทม์ ทำให้ AI ไม่ได้เข้าใจเพียงสิ่งที่ผู้ใช้พูด แต่สามารถนำสิ่งที่ผู้ใช้กำลังแสดงให้เห็นมาเป็นบริบทประกอบการตอบด้วย เช่น การดูข้อมูลบนหน้าจอ การทำความเข้าใจสิ่งของ หรือการช่วยผู้ใช้ทำงานที่มีองค์ประกอบด้านภาพ

Gemini 3.8 Live ยังรองรับการสนทนาใน 97 ภาษา และสามารถตรวจจับรวมถึงสลับภาษาระหว่างการสนทนาได้โดยอัตโนมัติ ทำให้ผู้ใช้ไม่จำเป็นต้องกำหนดภาษาสำหรับแต่ละช่วงของบทสนทนาอย่างตายตัว Google ระบุว่าโมเดลยังได้รับการออกแบบให้จัดการข้อมูลที่ต้องการความแม่นยำ เช่น รหัสยืนยัน หมายเลขเคลม และข้อมูลทางเทคนิค ซึ่งเป็นรายละเอียดที่มีความสำคัญสำหรับ Voice Agent ที่นำไปใช้งานในระบบบริการลูกค้าและธุรกิจ

สำหรับงานที่มีความซับซ้อนมากขึ้น Google เปิดตัว Gemini 3.8 Live Extended Thinking ซึ่งเพิ่มความสามารถด้านการให้เหตุผลหลายขั้นตอนเข้าไปในระบบสนทนาแบบเรียลไทม์ จุดเด่นคือตัว AI สามารถคิดและพูดไปพร้อมกัน แทนที่จะหยุดการสนทนาเพื่อประมวลผลจนเสร็จแล้วจึงตอบกลับ

ในระหว่างที่กำลังคิดหรือดำเนินงาน AI สามารถใช้ข้อความเสียงสั้น ๆ เช่น “Let me check that…” หรือ “ขอฉันตรวจสอบเรื่องนั้นก่อน...” เพื่อบอกให้ผู้ใช้ทราบว่าระบบกำลังดำเนินการอยู่ จากนั้นสามารถรายงานความคืบหน้าของงานหลายขั้นตอนผ่านเสียงระหว่างที่กระบวนการยังทำงานอยู่เบื้องหลัง ตัวอย่างการใช้งาน เช่น การเปลี่ยนภาพร่างให้กลายเป็น React Component การจัดการกระบวนการจองที่มีหลายขั้นตอน รวมถึงการสร้างแผนธุรกิจและชุดเครื่องมือด้านการตลาดจากคำสั่งเสียง โดย AI สามารถทำงานเหล่านี้ต่อเนื่องโดยไม่จำเป็นต้องตัดบทสนทนา

Google รายงานว่า Gemini 3.8 Live Extended Thinking ได้คะแนน 82.6 คะแนน และขึ้นเป็นอันดับ 1 ใน Artificial Analysis Speech to Speech Quality Index ซึ่งเป็นการประเมินคุณภาพการสื่อสารแบบเสียงต่อเสียง ในด้านการทำงานของ AI Agent โมเดลทำคะแนนได้ 68.6% ใน τ-Voice และ 35.1% ใน Sierra’s τ-Voice Banking Benchmark ขณะที่การทดสอบด้านการให้เหตุผลจากข้อมูลเสียงใน Big Bench Audio ทำได้ 97.7%

ส่วน Gemini 3.8 Live ได้อันดับ 2 ใน Speech Agent Arena ซึ่งเป็นการประเมินที่เกี่ยวข้องกับความพึงพอใจของผู้ใช้งานต่อระบบ Speech Agent โดย Google ยังวางตำแหน่งโมเดลนี้ให้เป็นตัวเลือกที่เน้นประสิทธิภาพและต้นทุนสำหรับการใช้งานในวงกว้าง อย่างไรก็ตาม ตัวเลขดังกล่าวเป็นผลการทดสอบที่ Google อ้างอิงจาก Benchmark แต่ละประเภท จึงควรพิจารณาวิธีการทดสอบ ชุดข้อมูล และเกณฑ์การประเมินของแต่ละ Benchmark ร่วมด้วย ไม่ควรนำคะแนนแต่ละรายการมาเปรียบเทียบโดยตรงโดยไม่ดูบริบทของการทดสอบ

Google เดินหน้าสร้างระบบนิเวศ Voice Agent สำหรับนักพัฒนา

Google เปิดให้ Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking เข้าถึงผ่าน Gemini Live API ซึ่งช่วยให้นักพัฒนาสามารถนำความสามารถด้านเสียงแบบเรียลไทม์ไปสร้างแอปพลิเคชันและ Voice Agent ของตัวเอง แพลตฟอร์มอย่าง Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel และ Vision Agents รองรับการทำงานร่วมกับ Gemini Live API โดยแพลตฟอร์มเหล่านี้ช่วยจัดการโครงสร้างพื้นฐานด้านการสตรีมเสียงและสื่อแบบเรียลไทม์ ทำให้นักพัฒนาสามารถมุ่งเน้นไปที่การออกแบบประสบการณ์ผู้ใช้ได้มากขึ้น

Google ยังระบุถึงความร่วมมือกับบริษัทอย่าง Salesforce, Genspark และ Lumeris ซึ่งกำลังให้ความสนใจในความสามารถของโมเดลใหม่ โดยเฉพาะเรื่องความหน่วงต่ำ ความต่อเนื่องของบทสนทนา และความสามารถในการเรียกใช้เครื่องมือ Google ระบุเพิ่มเติมว่า Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking มีราคาเริ่มต้นสำหรับนักพัฒนาที่ 0.005 ดอลลาร์ต่อนาทีสำหรับเสียงขาเข้า และ 0.018 ดอลลาร์ต่อนาทีสำหรับเสียงขาออก ซึ่งเป็นหนึ่งในปัจจัยที่ช่วยให้สามารถนำ Voice Agent ไปขยายการใช้งานในระดับใหญ่ได้

Google ไม่ได้จำกัด Gemini 3.8 Live ไว้สำหรับนักพัฒนาเท่านั้น แต่กำลังทยอยนำโมเดลเข้าสู่ผลิตภัณฑ์ของบริษัทด้วย Gemini 3.8 Live เริ่มเปิดให้ใช้งานผ่าน Gemini API และ Google AI Studio สำหรับนักพัฒนา ขณะที่ฝั่งองค์กรสามารถทดลองใช้งานผ่าน Gemini Enterprise ในรูปแบบ Private Preview และผู้ใช้ทั่วไปสามารถเข้าถึงความสามารถดังกล่าวผ่าน Search Live

สำหรับ Gemini 3.8 Live Extended Thinking นอกจาก Gemini API และ Google AI Studio แล้ว ยังเริ่มนำไปใช้กับ Gemini Live รวมถึง Google Workspace โดยสมาชิก Google AI Pro และ Ultra สามารถใช้งานใน Docs ส่วนสมาชิก Google AI สามารถใช้งานความสามารถดังกล่าวใน Gmail และ Keep ตามเงื่อนไขของแต่ละบริการ

Google ยังเปิดตัวประสบการณ์อย่าง Docs Live, Gmail Live และ Keep Live เพื่อให้ผู้ใช้สามารถทำงานกับข้อมูลและเอกสารผ่านการสนทนาด้วยเสียงได้มากขึ้น

ที่มาข้อมูล : Google

ที่มารูปภาพ : Google