פיילוט AI בעבודה: שעות שנחסכו לא מוכיחות שהאיכות עלתה

|כותב: מערכת QUASA|5 דק׳ קריאה| 1
פיילוט AI בעבודה: שעות שנחסכו לא מוכיחות שהאיכות עלתה

כדי למדוד פרודוקטיביות של AI בעבודה, בחרו משימות מוגדרות והשוו את ביצועיהן עם הכלי ובלעדיו. מדדו את הזמן עד לתוצר מאושר, את איכות התוצר, את העבודה שנדרשה לתיקונו ואת הסיכונים שהתגלו. שעות שעובדים מרגישים שחסכו הן נתון שימושי, אבל החלטה על הרחבת הפיילוט צריכה להישען על התוצאה הסופית.

לפני שמתחילים, כתבו מה נחשב הצלחה עבור המשימה: טיפול בפנייה שהסתיים בלי פתיחה חוזרת, למשל, או טיוטה שאושרה אחרי בדיקה מקצועית. הגדירו גם מה יחייב עצירה, כגון הזנת מידע שאסור להעביר לכלי. ההבחנה הזאת מאפשרת לזהות כלי שמאיץ את הטיוטה הראשונה אך מוסיף עבודה בהמשך.

הגדירו יחידת עבודה שאפשר להשוות

הפיילוט צריך להתחיל במשימה חוזרת שיש לה התחלה, נקודת סיום ותוצר שניתן לבדוק. ״כתיבה״ או ״שירות לקוחות״ הן קטגוריות רחבות מדי: הן כוללות משימות בדרגות קושי שונות. בחרו, למשל, סוג מוגדר של מענה לפנייה, סיכום מסוג קבוע או הכנת טיוטה לפי דרישות ידועות. תעדו מראש אילו משימות ייכנסו למדגם ואילו יוחרגו ממנו.

אספו קו בסיס מאותה משימה כפי שהיא מתבצעת כיום. לכל יחידת עבודה רשמו את משך הביצוע, זמן הבדיקה, סבבי התיקון ומצב התוצר לאחר אישור. מדידה של זמן הכתיבה בלבד תחמיץ עבודה שעברה לעורך, למנהל או לצוות אחר. כשהמשך משתנה מאוד בין משימות קלות למורכבות, סמנו גם את רמת המורכבות כדי שלא תייחסו לכלי שינוי שנובע מהרכב העבודה.

בנו קבוצת השוואה לפני חלוקת הגישה

השוו עובדים שמבצעים משימות דומות באותה תקופה, כאשר חלקם מקבלים גישה לכלי וחלקם ממשיכים בתהליך הרגיל. אם אפשר להקצות גישה באקראי בתוך אותו תפקיד, מצמצמים את הסיכוי שהבדלים מוקדמים בין העובדים יכתיבו את התוצאה. כשזה אינו אפשרי, התאימו בין הקבוצות לפי ניסיון, עומס וסוג משימה, ותעדו הבדלים שנותרו.

שמרו ככל האפשר על אותם כללי הקצאת עבודה, בדיקה ואישור בשתי הקבוצות. אם קבוצת ה-AI מקבלת גם הכשרה חדשה או תהליך אישור מקוצר, אי אפשר לייחס את כל הפער לכלי עצמו. השוו גם את השינוי ביחס לקו הבסיס, ולא רק את התוצאה הסופית של קבוצות שעשויות להיות שונות מלכתחילה. אם עובדים יכולים לבחור מתי להשתמש בכלי, רשמו מתי השתמשו בו בפועל: גישה ושימוש הם נתונים שונים.

מלאו גיליון פיילוט שסופר את כל העבודה

גיליון קצר מספיק, בתנאי שכל שורה מייצגת יחידת עבודה אחת וכוללת אותם שדות בשתי הקבוצות. הפרידו בין זמן העבודה של מי שיצר את התוצר לבין זמן הבדיקה והתיקון של אחרים, ואז חברו אותם. לצורך ספירת זמנים ותקלות אפשר להשתמש במזהה פנימי, בלי להעתיק לגיליון את תוכן הפנייה או מסמכים רגישים.

  • הקשר: סוג המשימה, רמת המורכבות, התפקיד, רמת הניסיון, מועד הביצוע והאם נעשה שימוש ב-AI.
  • זמן: הכנה, עבודה ראשונית, בדיקה, תיקון וטיפול נוסף לאחר מסירה. סכמו אותם לזמן הכולל עד לתוצר שאושר.
  • איכות: תוצאת בדיקה לפי קריטריונים שנקבעו מראש, כגון דיוק, שלמות והתאמה לדרישות המשימה.
  • עבודה חוזרת: סבבי תיקון, פתיחה מחדש של משימה והזמן שעובדים אחרים השקיעו בתיקון.
  • טעויות וסיכון: טעויות שהתגלו לפני מסירה ואחריה, הזנת מידע שלא הותר להשתמש בו ותקריות שהועברו לטיפול לפי נוהל הארגון.

המדד המרכזי לזמן הוא הזמן הכולל לתוצר מאושר, ולא הזמן עד לטיוטה הראשונה. לצדו הציגו את שיעור התוצרים שאושרו בבדיקה הראשונה ואת שיעור המשימות שחזרו לטיפול. אם נוצרו יותר טיוטות באותו פרק זמן אך הצטברו גם יותר תיקונים, מספר הטיוטות לבדו אינו מתאר שיפור בתפוקה שהושלמה.

בדקו איכות וסיכון בנפרד מתחושת המשתמש

קבעו מראש מי יבדוק את התוצרים ובאילו קריטריונים. כשהדבר אפשרי, תנו לבודק לראות את התוצר בלי לדעת אם הוכן בעזרת AI; כך הציפיות שלו מהכלי משפיעות פחות על ההערכה. בדיקה מעמיקה של מדגם משימות יכולה לחשוף סוגי שגיאות שספירה כללית של ״אושר״ ו״נדחה״ מסתירה. שביעות רצון העובדים חשובה להבנת השימוש בכלי, אך אינה מחליפה בדיקת דיוק ושלמות.

גם תחושת חיסכון בזמן עלולה להטעות. ב מחקר METR, שבו הוקצו באקראי משימות עם גישה לכלי AI ובלעדיה בקרב 16 מפתחי קוד פתוח מנוסים, זמן השלמת המשימות עם גישה לכלי היה ארוך ב-19%, אף שלאחר הניסוי המשתתפים העריכו שהכלי קיצר אותו ב-20%. זהו ממצא על עבודת פיתוח מסוימת ועל הכלים שנבדקו בה, אך הפער בין הערכה אישית למדידה מסביר מדוע צריך לתעד זמן בפועל.

הגדירו דרך אחידה לתיעוד תקריות: מה קרה, האם מידע יצא מגבולות השימוש המותרים ומה נדרש כדי לטפל במקרה. תקרית חמורה אינה מתקזזת מול דקות שנחסכו. טיוטת מסגרת TEVV של NIST מציעה הערכה מותאמת בארבעה שלבים לבחינת השפעות ותוצאות של מערכות AI בעולם האמיתי תוך צמצום השפעות שליליות. בפיילוט ארגוני, פירוש הדבר הוא בחירת מדדי תוצאה וסיכון שמתאימים לשימוש המסוים.

פלחו את התוצאות וקבעו מה להרחיב

הציגו תוצאות בנפרד לפי תפקיד, סוג משימה ורמת ניסיון, ובדקו אם הפער בזמן נשמר גם לאחר שסופרים איכות ועבודה חוזרת. סקירת Microsoft Research מאגדת יותר מתריסר מחקרים על AI במקומות עבודה, ובהם ניסוי אקראי מבוקר רחב היקף, ומתארת שונות בהשפעה על פרודוקטיביות לפי תפקיד, פונקציה ארגונית, ארגון ואופן השימוש. לכן תוצאה טובה במשימה אחת מצדיקה לכל היותר החלטה לגבי שימוש דומה, ולא פריסה אוטומטית לכל התפקידים.

לפני פתיחת הפיילוט קבעו כללי החלטה. הרחבה צריכה לדרוש שיפור בזמן הכולל או בתפוקה המאושרת, בלי ירידה באיכות ובלי חריגה מסף הסיכון שהארגון הגדיר. אם התוצאה מעורבת, אפשר לשנות את המשימה, ההכשרה או שלב הבדיקה ולמדוד שוב את השימוש שהשתנה. אם איכות התוצר נפגעת או מתגלה שימוש אסור במידע, עצרו את אותו שימוש גם כשהעובדים מדווחים שהוא מהיר ונוח.

שיתוף:

הירשמו לניוזלטר שלנו

קבלו את החדשות האחרונות על Web3, ‏AI וקריפטו ישירות לתיבת הדואר.

0