0

OpenAIopenai.com

OpenAI công bố MentalHealthBench: hơn 80 chuyên gia tâm lý chấm điểm cách AI hỗ trợ sức khỏe tinh thần

by githot

0 up · 0 down

Source

https://openai.com/index/introducing-mentalhealthbench

Open source

External link shared by a user. githot does not verify the content of the destination.

Note from the sharer

MentalHealthBench là bộ đánh giá mở gồm 1.215 cuộc hội thoại tổng hợp, mô phỏng cách mọi người thật sự tâm sự với AI: từ chuyện tình cảm, áp lực công việc thường ngày cho tới những tình huống khẩn cấp. Dữ liệu trải đều người lớn, thiếu niên 13–17 tuổi, người chăm sóc và cả bác sĩ lâm sàng, bằng nhiều ngôn ngữ khác nhau. Điểm đáng giá nhất là cách chấm: hơn 80 nhà tâm lý và bác sĩ tâm thần từ 22 quốc gia viết tiêu chí riêng cho từng cuộc trò chuyện, mỗi tiêu chí từ −10 đến +10 điểm. Ví dụ, AI được cộng điểm khi hỏi người dùng đang cần giúp gì, nhưng bị trừ điểm khi phán xét vội hay tự đoán cảm xúc của người khác. Mỗi bộ tiêu chí phải được ít nhất hai chuyên gia đồng thuận. Kết quả cho thấy còn rất nhiều việc phải làm: mô hình tốt nhất là GPT-6 Astra cũng chỉ đạt 57,3%, tiếp theo là GPT-6 Sol (53,9%) và Claude Opus 5.5 (52,4%). Bất ngờ là câu trả lời do chính chuyên gia viết tay chỉ được 38,5%, vì họ trả lời rất ngắn như khi ngồi nói chuyện trực tiếp: ít lỗi nhưng cũng ít điểm cộng. Khi hỏi thêm 44 người dùng thật, họ coi trọng lời khuyên cụ thể và giọng điệu ấm áp, còn chuyên gia ưu tiên hỏi thêm bối cảnh và thận trọng trước khi kết luận; hai bên chỉ trùng nhau khoảng một phần tư trọng số tiêu chí. Theo nhóm tác giả, điểm yếu lớn nhất của các mô hình hiện nay là biết hỏi thêm khi cần và đánh giá đúng mức độ khẩn cấp. Dù vậy, AI không thay thế được bác sĩ hay người thân. Nếu bạn đang gặp khó khăn, hãy tìm đến người bạn tin tưởng hoặc chuyên gia. Bài báo đầy đủ: https://cdn.openai.com/ctf-cdn/MentalHealthBench_A_Comprehensive_Benchmark_of_AI_Capabilities_in_Realistic_Mental_Health_Conversations.pdf

Comments

No comments yet. Start the discussion.