กลับไปฟีด
Getnotes
Getnotes30 ก.ค.
GetNotes

สร้าง AI คุยด้วยเสียงแบบเรียลไทม์บนเครื่องตัวเองได้แล้ว GitHub Daily วันนี้ขอแนะนำ speech-to-speech จาก Hugging Face โปรเจกต์ Open Source สำหรับสร้าง Voice Agent ที่ฟังเสียง คิดคำตอบ และพูดกลับได้แบบเรียลไทม์ โดยสามารถเลือกให้โมเดลบางส่วนหรือทั้งระบบทำงานบนเครื่องของคุณเองได้ ระบบแบ่งการทำงานเป็น 4 ส่วนที่เปลี่ยนโมเดลได้อิสระ • VAD — ตรวจจับว่าเราเริ่มและหยุดพูดเมื่อไร • STT — แปลงเสียงพูดเป็นข้อความ • LLM — คิดและสร้างคำตอบ • TTS — เปลี่ยนคำตอบกลับเป็นเสียงพูด จุดที่นำไปใช้ได้จริง • สร้าง AI Receptionist รับสายหรือตอบคำถามลูกค้า • ทำผู้ช่วยเสียงภายในเว็บไซต์หรือแอป • สร้าง Voice Agent สำหรับอุปกรณ์หรือหุ่นยนต์ • เชื่อมต่อ OpenAI, Hugging Face, OpenRouter หรือเซิร์ฟเวอร์ LLM ของตัวเอง • เปลี่ยนโมเดลเสียงและโมเดลภาษาได้ตามเครื่องที่มี • รองรับ OpenAI Realtime-compatible WebSocket API จึงนำ Client เดิมมาปรับใช้ได้ง่ายขึ้น เหมาะกับใคร • Developer ที่อยากสร้างแอปคุยด้วยเสียง • ทีมที่ต้องการควบคุมข้อมูลเสียงมากขึ้น • คนที่อยากทดลอง Local AI บน Mac, CPU หรือเครื่องที่มี GPU • ธุรกิจที่กำลังทำระบบตอบคำถามด้วยเสียง • Creator ที่อยากสร้าง AI Character หรือ AI Companion ลองใช้ยังไงวันนี้ ติดตั้งผ่าน Python: pip install speech-to-speech ตั้งค่า API Key ของโมเดลภาษาที่ต้องการ แล้วเริ่มเซิร์ฟเวอร์: export OPENAI_API_KEY=your_api_key speech-to-speech สำหรับคนที่ต้องการรัน Local มากขึ้น สามารถเชื่อม LLM ผ่าน llama.cpp หรือ vLLM แล้วใช้โมเดล STT และ TTS ภายในเครื่องได้ หมายเหตุ: ตัวโปรเจกต์เป็น Open Source แต่ค่าใช้จ่ายจริงขึ้นอยู่กับโมเดลและผู้ให้บริการ API ที่คุณเลือก หากใช้กับงานบริการลูกค้า ควรทดสอบความแม่นยำ การขัดจังหวะระหว่างสนทนา และการจัดการข้อมูลส่วนบุคคลก่อนใช้งานจริง #Getnotes #GitHubDaily #SpeechToSpeech #VoiceAI #VoiceAgent #LocalAI #OpenSource

สร้าง AI คุยด้วยเสียงแบบเรียลไทม์บนเครื่องตัวเองได้แล้ว GitHub Daily วันนี้ขอแนะนำ speech-to-speech จาก Hugging Face โปรเจกต์ Open Source สำหรับสร้าง Voice Agent ที่ฟังเสียง คิด...
1

คอมเมนต์

0 ความคิดเห็นในโพสต์นี้

ฟีดทั้งหมด
G
คุยแบบสุภาพและช่วยกันต่อยอด

ยังไม่มีคอมเมนต์

เป็นคนแรกที่เริ่มคุยใต้โพสต์นี้ได้เลย