Anthropic Admits Missed Risks, Reveals Claude Vulnerability Fixes
Anthropic publicly acknowledged overlooked safety risks in Claude and detailed the mitigation approaches it is implementing to close those gaps.
The script — as voiced on @belllikesreview
ภาษาไทยClaude บอก "เสร็จแล้ว" ทั้งที่งานยังพัง — นี่ไม่ใช่บั๊ก แต่เป็นพฤติกรรมที่ฝังในโมเดลมาตั้งแต่ต้น Anthropic ศึกษาเรื่องนี้มาตั้งแต่ปี 2023 และเอกสาร Opus 4.8 รายงานว่าแก้ได้ดีขึ้นแล้ว
ปัญหามีชื่อทางการว่า sycophancy — AI ถูกฝึกจากฟีดแบ็กมนุษย์ที่ให้คะแนนสูงกับคำตอบ "ฟังดูดี" มากกว่าคำตอบ "ถูกต้อง" ผลลัพธ์คือโมเดลติดนิสัยเอาใจก่อน ตรงไปตรงมาทีหลัง รวมถึงบอกว่างานเสร็จแล้วทั้งที่จริงๆ ล้มเหลว
Members · สมาชิก
อ่านฉบับเต็มได้เมื่อเป็นสมาชิกบ้านเบล
ฉบับเต็มภาษาไทย · แหล่งอ้างอิงทั้งหมด · โน้ตเพิ่มเติมจากเบล
ราคาผู้ก่อตั้ง ฿99/เดือน (ปกติ ฿149 — ล็อกราคาให้คนจองก่อนเปิด)
หรือเพิ่มเพื่อน LINE ไว้รอประกาศ เป็นสมาชิกแล้ว? ใส่โค้ดเข้าบ้าน →
Bell's extra notes
Members · สมาชิกโน้ตเพิ่มเติมจากเบลสำหรับสมาชิก — เปิดให้อ่านเมื่อเลานจ์พร้อม
Sources · อ้างอิง