דלג לתוכן הראשי
אוטומציות AI - לוגו
  • דף הבית
  • בלוג
  • חדשות
  • אודות
  • צור קשר
03-7630715קבעו ייעוץ חינם
אוטומציות AI - פתרונות אוטומציה וסוכני AI לעסקים בישראל

בונים סוכני AI ואוטומציות לעסקים בישראל: וואטסאפ, CRM, לידים, תורים, חשבוניות, דשבורדים וחיבור מערכות.

IL03-7630715USA(646) 760-4854info@automaziot.ai
אחד העם 9, תל אביב. מגדל שלום

קישורים מהירים

  • דף הבית
  • בלוג
  • חדשות
  • אודות
  • צור קשר
  • סיפורי הצלחה
  • מילון מונחים

הפתרונות שלנו

  • ניהול לידים אוטומטי
  • סוכן חכם לוואטסאפ
  • חיבור מערכות ודשבורדים
  • ניהול לקוחות חכם
  • קביעת תורים אוטומטית
  • מכירות ושירות לקוחות
  • אוטומציה לאיקומרס
  • סוכני AI
  • ייעוץ אוטומציה

הישארו מעודכנים

הירשמו לניוזלטר וקבלו עדכונים על חידושים בעולם האוטומציה וה-AI

FacebookInstagramLinkedIn

אתר זה משתמש ב-Google Analytics ו-Vercel Analytics לשיפור השירות. למידע מלא ראה מדיניות פרטיות

© 2026 אוטומציות AI. כל הזכויות שמורות.

מדיניות פרטיותתנאי שימושהצהרת נגישותמדיניות עריכה
מדד FACTS של גוגל: תקרת דיוק 70% ב-AI
תקרת הדיוק 70%: מדד FACTS של גוגל מזהיר את עולם ה-AI
ביתחדשותתקרת הדיוק 70%: מדד FACTS של גוגל מזהיר את עולם ה-AI
מחקר

תקרת הדיוק 70%: מדד FACTS של גוגל מזהיר את עולם ה-AI

צוות FACTS של גוגל ו-Kaggle משיקים חבילת בדיקות חדשה שחושפת כשלים בדיוק מודלי AI – אף מודל לא עובר 70%

צוות אוטומציות AIצוות אוטומציות AI
11 בדצמבר 2025
4 דקות קריאה

תגיות

GoogleFACTSKaggleGemini 3 ProGPT-5Claude 4.5 OpusGemini 2.5 Pro

נושאים קשורים

#בינה מלאכותית#בנצ'מרקים#דיוק מודלים#RAG#מודלים רב-מודליים#עובדתיות AI
מבוסס על כתבה שלVentureBeat ↗·תרגום, סיכום והקשר עסקי על-ידי המערכתאיך אנחנו עובדים

✨תקציר מנהלים

נקודות עיקריות

  • Gemini 3 Pro מוביל במדד FACTS עם 68.8%, אך אף מודל לא חצה 70%.

  • פער גדול בין חיפוש (עד 83%) לרב-מודלי (<50%) – אל תסמכו על זיכרון פנימי.

  • חיבור ל-RAG חובה להגברת דיוק בייצור.

  • רב-מודלי אינו מוכן להפקה אוטונומית ללא פיקוח.

  • מדד FACTS: סטנדרט חדש לבחירת מודלי AI ארגוניים.

תקרת הדיוק 70%: מדד FACTS של גוגל מזהיר את עולם ה-AI

  • Gemini 3 Pro מוביל במדד FACTS עם 68.8%, אך אף מודל לא חצה 70%.
  • פער גדול בין חיפוש (עד 83%) לרב-מודלי (<50%) – אל תסמכו על זיכרון פנימי.
  • חיבור ל-RAG חובה להגברת דיוק בייצור.
  • רב-מודלי אינו מוכן להפקה אוטונומית ללא פיקוח.
  • מדד FACTS: סטנדרט חדש לבחירת מודלי AI ארגוניים.

בעידן שבו בינה מלאכותית מניעה החלטות עסקיות קריטיות בתחומי משפט, פיננסים ורפואה, חסר כלי סטנדרטי לבדיקת דיוק התשובות. רוב הבנצ'מרקים בודקים יכולות כמו כתיבת קוד או שימוש בכלים, אך מתעלמים משאלות עובדתיות – במיוחד כשמדובר בתמונות או גרפים. היום זה משתנה: צוות FACTS של גוגל יחד עם Kaggle השיקו את חבילת מדד FACTS, מסגרת מקיפה לבדיקת 'עובדתיות'.

המחקר החדש מגדיר עובדתיות בשני מישורים: 'עובדתיות הקשרית' – הצמדה לנתונים נתונים, ו'עובדתיות ידע עולמי' – שחזור מידע מזיכרון או רשת. תוצאות ראשוניות מראות כי אף מודל, כולל Gemini 3 Pro המוביל, GPT-5 או Claude 4.5 Opus, לא חצה את רף 70%. Gemini 3 Pro מוביל עם 68.8%, בעוד אחרים נמוכים יותר. זה סימן ברור למנהלי טכנולוגיה: עידן 'סמוך אך בדוק' רחוק מלהסתיים.

חבילת FACTS כוללת ארבעה מבחנים המדמים כשלים אמיתיים: מבחן פרמטרי (ידע פנימי) – שאלות טריוויה מזיכרון האימון; מבחן חיפוש (שימוש בכלי) – סינתזה ממידע חי מהרשת; מבחן רב-מודלי (ראייה) – פרשנות גרפים ותמונות ללא הזיות; ומבחן עיגון v2 (הקשר) – היצמדות לטקסט נתון. גוגל פרסמה 3,513 דוגמאות ציבוריות, ו-Kaggle מחזיקה סט פרטי נגד זיהום נתונים.

בלוח הניצחון, Gemini 3 Pro מוביל עם 68.8% ממוצע, כולל 83.8% בחיפוש ו-46.1% ברב-מודלי. Gemini 2.5 Pro שני עם 62.1%, GPT-5 שלישי ב-61.8%. הפער הבולט הוא בין ידע פנימי (פרמטרי) לבין חיפוש: Gemini 3 Pro מצטיין בחיפוש (83.8%) אך נמוך יותר בפרמטרי (76.4%). זה מאמת את הארכיטקטורה הארגונית הנוכחית: אל תסמוך על זיכרון המודל לעובדות קריטיות.

במיוחד מדאיגים תוצאות הרב-מודלי: אף מודל לא עבר 50%, כולל 46.9% ל-Gemini 2.5 Pro המוביל. המבחנים כללו קריאת גרפים, דיאגרמות וזיהוי עצמים. זה אזהרה למנהלי מוצר: AI רב-מודלי אינו מוכן עדיין להפקת נתונים אוטונומית, כמו סריקת חשבוניות או ניתוח גרפים פיננסיים ללא פיקוח אנושי.

למפתחי RAG (Retrieval-Augmented Generation), מדד החיפוש קריטי. התוצאות מוכיחות כי חיבור לכלי חיפוש או מסד נתונים וקטורי הוא חובה להגעה לרמות דיוק ייצור. בעת רכש מודלים, בדקו תת-מדדים ספציפיים: grounding לקוחות תמיכה (Gemini 2.5 Pro עדיף כאן), חיפוש לעוזרי מחקר, ורב-מודלי – בזהירות יתרה.

מדד FACTS צפוי להפוך לסטנדרט רכש ארגוני. צוות FACTS מציין כי כל המודלים נמוכים מ-70%, מה שמשאיר מקום להתקדמות. כרגע, תכננו מערכות בהנחה ששליש מהפעמים המודל עלול לטעות.

מה המשמעות לעסקים ישראליים? חברות כמו וויקס או צ'ק פוינט יכולות להשתמש במדד זה לבחירת כלים מדויקים יותר. האם הגיע הזמן לשדרג את אסטרטגיית ה-AI שלכם? קראו את המחקר המלא והתחילו לבדוק.

שאלות ותשובות

שאלות נפוצות

רוצים ליישם את זה בעסק שלכם?

באוטומציות AI אנחנו בונים סוכני AI ואוטומציות לעסקים בישראל. ראו את השירותים הרלוונטיים:

  • אוטומציה לעסקיםחיבור מערכות, חשבוניות ודשבורדים
  • בוט וואטסאפ לעסקWhatsApp Business API בישראל
  • סוכני AI לעסקיםסוכנים שמטפלים בלידים, שיחות ו-CRM
  • ניהול לידים אוטומטימענה מיידי, ניקוד וסינון אוטומטי

הכתבה הוכנה על-ידי המערכת בליווי בינה מלאכותית: תרגום, סיכום והוספת הקשר עסקי ישראלי מתוך פרסום מקורי של VentureBeat. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

אהבתם את הכתבה?

הירשמו לניוזלטר שלנו וקבלו עדכונים חמים מעולם ה-AI ישירות למייל

עוד מ־VentureBeat

כל הכתבות מ־VentureBeat
Railway גייסה 100 מיליון דולר לאתגר את AWS בתשתית ענן AI
חדשות
22 בינואר 2026
4 דקות
·מ־VentureBeat

Railway גייסה 100 מיליון דולר לאתגר את AWS בתשתית ענן AI

Railway גייסה 100 מיליון דולר לפלטפורמת ענן AI מהירה שמאתגרת את AWS. פריסות בשנייה, חיסכון 65% ו-2 מיליון משתמשים. קראו עכשיו על המהפכה!

RailwayJake CooperTQ Ventures
קרא עוד
Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי
חדשות
16 בינואר 2026
4 דקות
·מ־VentureBeat

Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי

אלפרד וולפורס מ-Listen Labs השתמש בלוח מודעות ויראלי כדי לגייס כישרונות, וכעת החברה גייסה 69 מיליון דולר. הפלטפורמה מבצעת ראיונות לקוחות AI מהירים ומדויקים, פותרת בעיות הונאה ומשמשת מיקרוסופט ועוד. קראו עכשיו על השינוי במחקר שוק!

Listen LabsAlfred WahlforssRibbit Capital
קרא עוד
סיילספורס משיקה סלאקבוט חדש: סוכן AI עוצמתי לעבודה
מוצר חדש
13 בינואר 2026
4 דקות
·מ־VentureBeat

סיילספורס משיקה סלאקבוט חדש: סוכן AI עוצמתי לעבודה

סיילספורס השיקה סלאקבוט חדש כסוכן AI שמשנה את חוקי המשחק בעבודה. הוא מחפש נתונים, כותב מסמכים ומבצע פעולות – זמין ללא עלות נוספת. קראו עכשיו על הביצועים המרשימים בבדיקות.

SalesforceSlackSlackbot
קרא עוד
אנטרופיק משיקה Cowork: סוכן AI לשולחן העבודה ללא קוד
מוצר חדש
13 בינואר 2026
4 דקות
·מ־VentureBeat

אנטרופיק משיקה Cowork: סוכן AI לשולחן העבודה ללא קוד

אנטרופיק משיקה Cowork, סוכן AI חדש שמאפשר למשתמשים רגילים לבצע משימות על קבצים במחשב ללא קוד. הכלי נבנה תוך שבועיים בעזרת Claude Code ומבטיח פרודוקטיביות גבוהה יותר. קראו את המאמר המלא עכשיו!

AnthropicClaudeCowork
קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
פרצות אבטחה במערכות בינה מלאכותית: איומי האוטומציה החדשים
מחקר
לפני 2 ימים
5 דקות
·מ־Wired

פרצות אבטחה במערכות בינה מלאכותית: איומי האוטומציה החדשים

המעבר המהיר לאוטומציה ושילוב בינה מלאכותית חושף עסקים לפרצות אבטחה חסרות תקדים. דוח אבטחה מקיף של מגזין WIRED חושף כיצד האקרים ניצלו את מערכת התמיכה המבוססת AI של Meta להשתלטות על חשבונות ידוענים, וכיצד כלי ה-AI העוצמתי של Anthropic, המכונה Mythos, משמש את ה-NSA למטרות תקיפה. הדו"ח מדגיש את הסיכון שביישומי בינה מלאכותית ומזהיר את המגזר העסקי מפני הסתמכות עיוורת על כלים אוטונומיים ללא מנגנוני אימות קפדניים.

MetaChainalysisAnthropic
קרא עוד
גוגל חושפת את טכנולוגיית Agentic RAG לעסקים: דיוק חסר תקדים ל-AI
מחקר
לפני 2 ימים
4 דקות
·מ־Google Research

גוגל חושפת את טכנולוגיית Agentic RAG לעסקים: דיוק חסר תקדים ל-AI

גוגל מציגה את Agentic RAG, ארכיטקטורת רב-סוכנים חדשה המשולבת בפלטפורמת Gemini Enterprise. בניגוד למערכות RAG מסורתיות המחזירות תשובות חלקיות כאשר המידע מבוזר, המנגנון החדש פועל בצורה איטרטיבית. המערכת מחלקת את השאילתה בין סוכנים מומחים (כמו סוכן תכנון וסוכן ניסוח מחדש) ומשתמשת ב'סוכן הקשר מספק' המבצע בקרת איכות קפדנית על תוצאות החיפוש. בבדיקות של גוגל על מאגר המידע FramesQA, המערכת הגיעה ל-90.1% דיוק בחיפושים מורכבים חוצי-מאגרים, תוך שמירה על מהירות מענה כמעט זהה (פגיעה של 3% בלבד בלייטנסי). הטכנולוגיה, הזמינה כעת בגרסת תצוגה מקדימה, פותחת עידן חדש של אמינות ודיוק עבור סוכני AI בארגונים.

Google CloudGemini Enterprise Agent PlatformFramesQA
קרא עוד
אלגוריתם הליבה של המוח: המרוץ של ג'ף בזוס וחברת Flourish
מחקר
לפני 4 ימים
5 דקות
·מ־Wired

אלגוריתם הליבה של המוח: המרוץ של ג'ף בזוס וחברת Flourish

חברת הסטארט-אפ האמריקאית Flourish, בגיבוי של 500 מיליון דולר ומשקיעים בולטים ובראשם ג'ף בזוס, מנסה לפצח את אלגוריתם הליבה של המוח כדי לפתח מערכת בינה סינתטית חסכונית באנרגיה ולומדת ברציפות. המטרה היא ליצור מודלים שרצים על פחות מ-50 ואט ומסוגלים להתאים את עצמם לסביבה בזמן אמת, בדומה לרשתות העצביות הביולוגיות, ללא צורך באימון מחדש יקר בחוות שרתים ענקיות. פריצת דרך זו עשויה לייתר את חוות השרתים העצומות המשמשות כיום למודלי ה-LLMs הגדולים ולהעביר את כוח העיבוד למכשירי קצה מקומיים ומאובטחים.

FlourishJeff BezosThomas Reardon
קרא עוד
מודל בינה מלאכותית לחיזוי שיטפונות: גוגל משחררת את קוד המקור
מחקר
לפני 5 ימים
5 דקות
·מ־Google Research

מודל בינה מלאכותית לחיזוי שיטפונות: גוגל משחררת את קוד המקור

חוקרי Google Research שחררו רשמית את מודל ההידרולוגיה של החברה כקוד פתוח תחת רישיון Apache 2.0. המערכת, המבוססת על ספריית PyTorch ורשתות ME-LSTM, מניעה את חיזויי הזמן האמת של פלטפורמת Flood Hub הגלובלית. המהלך מאפשר לרשויות מטרולוגיות, חברות מים וגופי תשתית להריץ ולעבד נתוני אקלים ומשקעים מקומיים באופן עצמאי ומאובטח על שרתי הארגון. שילוב המודל, שנבחן בשיתוף פעולה עם המכון ההידרומטאורולוגי הצ'כי, מאפשר להאריך את טווח התחזית האמינה בעד שישה ימים באגנים מנוטרים, ומציע לעסקים ולרשויות בישראל כלי רב-עוצמה לניהול סיכוני מזג אוויר ושיפור ההיערכות לאירועי קיצון.

GoogleGitHubPyTorch
קרא עוד