ಮುಖ್ಯ ವಿಷಯಕ್ಕೆ ನೇರವಾಗಿ ಹೋಗಿ
OpenAI

ಸೆಪ್ಟೆಂಬರ್ 5, 2025

ಸಂಶೋಧನೆಪ್ರಕಟಣೆ

ಭಾಷಾ ಮಾಡೆಲ್‌ಗಳು ಯಾಕೆ ಭ್ರಮಿಸುತ್ತವೆ

ಟೀಲ್, ನೀಲಿ ಮತ್ತು ಲಾವೆಂಡರ್ ಬಣ್ಣಗಳ ಹರಡುವ ಗ್ರೇಡಿಯಂಟ್‌ಗಳಿಂದ ಕೂಡಿದ ಸಾರಾಂಶದ ಚಿತ್ರ, ಅದು ಚೌಕಟ್ಟಿನಲ್ಲಿ ತಿರಚಾಗಿ ಮೃದುವಾದ ಹರಿವ ಹಾದಿಗಳಾಗಿ ಬೆರೆಯುತ್ತದೆ.
ಲೋಡ್ ಆಗುತ್ತಿದೆ…

OpenAI ಯಲ್ಲಿ, ನಾವು AI ವ್ಯವಸ್ಥೆಗಳನ್ನು ಹೆಚ್ಚು ಉಪಯುಕ್ತ ಮತ್ತು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿಸಲು ಶ್ರಮಿಸುತ್ತಿದ್ದೇವೆ. ಭಾಷಾ ಮಾಡೆಲ್‌ಗಳು ಹೆಚ್ಚು ಸಾಮರ್ಥ್ಯ ಹೊಂದಿದರೂ, ಒಂದು ಸವಾಲು ಇನ್ನೂ ಕಠಿಣವಾಗಿದೆ: ಭ್ರಮೆಗಳು. ಇದರ ಅರ್ಥ, ಮಾಡೆಲ್ ಆತ್ಮವಿಶ್ವಾಸದಿಂದ ತಪ್ಪಾದ ಉತ್ತರವನ್ನು ನೀಡುವ ಸಂದರ್ಭಗಳು. ನಮ್ಮ ಹೊಸ ಸಂಶೋಧನಾ ಪತ್ರಿಕೆ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಭಾಷಾ ಮಾಡೆಲ್‌ಗಳು ಭ್ರಮಿಸುತ್ತವೆ ಎಂದು ವಾದಿಸುತ್ತದೆ, ಏಕೆಂದರೆ ಪ್ರಮಾಣಿತ ಟ್ರೈನಿಂಗ್ ಮತ್ತು ಮೌಲ್ಯಮಾಪನ ವಿಧಾನಗಳು ಅನಿಶ್ಚಿತತೆಯನ್ನು ಒಪ್ಪಿಕೊಳ್ಳುವ ಬದಲು ಊಹೆಯನ್ನು ಉತ್ತೇಜಿಸುತ್ತವೆ.

ChatGPT ಕೂಡ ಭ್ರಮಿಸುತ್ತದೆ. GPT‑5 ವಿಶೇಷವಾಗಿ ತಾರ್ಕಿಕ ಯೋಚನೆಯಾಗ ಗಮನಾರ್ಹವಾಗಿ ಕಡಿಮೆ ಭ್ರಮೆಗಳನ್ನು ಹೊಂದಿದೆ, ಆದರೆ ಅವು ಇನ್ನೂ ಸಂಭವಿಸುತ್ತವೆ. ಭ್ರಮೆಗಳು ಎಲ್ಲ ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳಿಗೆ ಮೂಲಭೂತ ಸವಾಲಾಗಿವೆ, ಆದರೆ ಅವನ್ನು ಕಡಿಮೆ ಮಾಡಲು ನಾವು ಶ್ರಮಿಸುತ್ತಿದ್ದೇವೆ.

ಭ್ರಮೆಗಳು ಎಂದರೇನು?

ಭ್ರಮೆಗಳು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಕಾಣುವ ಆದರೆ ತಪ್ಪಾದ ಹೇಳಿಕೆಗಳು, ಭಾಷಾ ಮಾಡೆಲ್‌ಗಳಿಂದ ರಚಿತವಾಗುವವು. ಅವು ಅಚ್ಚರಿಯ ರೀತಿಯಲ್ಲಿ ಕಾಣಿಸಬಹುದು, ಸರಳವಾದ ಪ್ರಶ್ನೆಗಳಿಗೆ ಸಹ. ಉದಾಹರಣೆಗೆ, ನಾವು Adam Tauman Kalai (ಈ ಪ್ರಬಂಧದ ಲೇಖಕರಲ್ಲಿ ಒಬ್ಬರು) ಅವರ ಪಿಎಚ್‌ಡಿ ಪ್ರಬಂಧದ ಶೀರ್ಷಿಕೆ ಕೇಳಿದಾಗ, ಜನಪ್ರಿಯ ಚಾಟ್‌ಬಾಟ್ ಆತ್ಮವಿಶ್ವಾಸದಿಂದ ಮೂರು ಉತ್ತರಗಳನ್ನು ನೀಡಿತು—ಆದರೆ ಯಾವುದೂ ಸರಿಯಾಗಿರಲಿಲ್ಲ. ನಾವು ಅವರ ಹುಟ್ಟುಹಬ್ಬವನ್ನು ಕೇಳಿದಾಗ, ಅದು ಮೂರು ವಿಭಿನ್ನ ದಿನಾಂಕಗಳನ್ನು ನೀಡಿತು, ಮತ್ತೆ ಎಲ್ಲವೂ ತಪ್ಪಾಗಿತ್ತು. 

ಪರೀಕ್ಷೆಗೆ ಕಲಿಸುವುದು

ಇಂದಿನ ಮೌಲ್ಯಮಾಪನ ವಿಧಾನಗಳು ತಪ್ಪು ಪ್ರೋತ್ಸಾಹ ನೀಡುವುದರಿಂದ ಭ್ರಮೆಗಳು ಮುಂದುವರಿಯುತ್ತವೆ. ಮೌಲ್ಯಮಾಪನೆಗಳು ನೇರವಾಗಿ ಭ್ರಮೆಗಳನ್ನು ಉಂಟುಮಾಡುವುದಿಲ್ಲ, ಆದರೆ ಹೆಚ್ಚಿನ ಮೌಲ್ಯಮಾಪನೆಗಳು ಮಾದರಿಯ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಅನುಮಾನವನ್ನು ಒಪ್ಪಿಕೊಳ್ಳುವುದಕ್ಕಿಂತ ಊಹೆ ಮಾಡಲು ಪ್ರೇರೇಪಿಸುವ ರೀತಿಯಲ್ಲಿ ಅಳೆಯುತ್ತವೆ.

ಇದನ್ನು ಬಹು ಆಯ್ಕೆ ಪರೀಕ್ಷೆಯಂತೆ ಕಲ್ಪಿಸಿಕೊಳ್ಳಿ. ಉತ್ತರ ತಿಳಿದಿರದಿದ್ದರೂ ಊಹೆ ಮಾಡಿದರೆ, ಅದೃಷ್ಟವಶಾತ್ ಸರಿಯಾಗಬಹುದು. ಖಾಲಿ ಬಿಟ್ಟರೆ ಶೂನ್ಯ ಅಂಕ ಖಚಿತ. ಅದೇ ರೀತಿ, ಮಾಡೆಲ್ಗಳನ್ನು ಕೇವಲ ಶುದ್ಧತೆಯ ಮೇಲೆ, ಅಂದರೆ ಅವರು ನಿಖರವಾಗಿ ಸರಿಯಾಗಿ ಉತ್ತರಿಸುವ ಪ್ರಶ್ನೆಗಳ ಶೇಕಡಾವಾರಿನ ಮೇಲೆ ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದಾಗ, ಅವು “ತಿಳಿದಿಲ್ಲ” ಎಂದು ಹೇಳುವುದಕ್ಕಿಂತ ಊಹೆ ಮಾಡಲು ಪ್ರೋತ್ಸಾಹಿತವಾಗುತ್ತವೆ.

ಮತ್ತೊಂದು ಉದಾಹರಣೆಗೆ, ಭಾಷಾ ಮಾಡೆಲ್‌ಗಳಿಂದ ಯಾರಾದರೂ ಜನ್ಮದಿನ ಕೇಳಿದರೆ ಮತ್ತು ಅದಕ್ಕೆ ತಿಳಿದಿಲ್ಲ ಎಂದುಕೊಳ್ಳಿ. ಅದು “ಸೆಪ್ಟೆಂಬರ್ 10” ಎಂದು ಊಹಿಸಿದರೆ, 365ರಲ್ಲಿ 1 ಅವಕಾಶ ಸರಿಯಾಗಿರಬಹುದು. “ತಿಳಿದಿಲ್ಲ” ಎನ್ನುವುದರಿಂದ ಶೂನ್ಯ ಅಂಕ ಖಚಿತ. ಸಾವಿರಾರು ಪರೀಕ್ಷಾ ಪ್ರಶ್ನೆಗಳಲ್ಲಿ, ಅನುಮಾನ ಒಪ್ಪಿಕೊಳ್ಳುವ ಎಚ್ಚರಿಕೆಯ ಮಾಡೆಲ್ ಗಿಂತ ಊಹಿಸುವ ಮಾಡೆಲ್ ಅಂಕಪಟ್ಟಿಯಲ್ಲಿ ಉತ್ತಮವಾಗಿ ಕಾಣುತ್ತದೆ.

ಒಂದೇ “ಸರಿಯಾದ ಉತ್ತರ” ಇರುವ ಪ್ರಶ್ನೆಗಳಿಗೆ, ಮೂರು ರೀತಿಯ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಪರಿಗಣಿಸಬಹುದು: ಸರಿಯಾದ ಉತ್ತರಗಳು, ತಪ್ಪುಗಳು ಮತ್ತು ಊಹೆ ಮಾಡದ ತಟಸ್ಥತೆ. ತೊರೆಯುವುದು ನಮ್ರತೆಯ ಭಾಗವಾಗಿದೆ, ಇದು OpenAI ನ ಪ್ರಮುಖ ಮೌಲ್ಯಗಳಲ್ಲಿ ಒಂದಾಗಿದೆ. ಹೆಚ್ಚಿನ ಅಂಕಪಟ್ಟಿಗಳು ನಿಖರತೆಯ ಆಧಾರದ ಮೇಲೆ ಮಾಡೆಲ್ಗಳನ್ನು ಶ್ರೇಯಾಂಕಿಸುತ್ತವೆ, ಆದರೆ ತಪ್ಪುಗಳು ತಟಸ್ಥತೆಗಿಂತ ಕೆಟ್ಟವು. ನಮ್ಮ ಮಾಡೆಲ್ ಸ್ಪೆಕ್(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ತಪ್ಪಾಗಿರಬಹುದಾದ ವಿಶ್ವಾಸದ ಮಾಹಿತಿಯನ್ನು ಒದಗಿಸುವುದಕ್ಕಿಂತ ಅನಿಶ್ಚಿತತೆಯನ್ನು ಸೂಚಿಸುವುದು ಅಥವಾ ಸ್ಪಷ್ಟೀಕರಣವನ್ನು ಕೇಳುವುದು ಉತ್ತಮ ಎಂದು ಹೇಳುತ್ತದೆ. 

ಒಂದು ನಿರ್ದಿಷ್ಟ ಉದಾಹರಣೆಗಾಗಿ,GPT5 ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್‌ನಿಂದ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಸಿಂಪಲ್‌ಕ್ಯೂಎ ಇವಾಲ್ ಅನ್ನು ಉದಾಹರಣೆಯಾಗಿ ಪರಿಗಣಿಸಿ.

ಮೆಟ್ರಿಕ್

gpt-5-thinking-mini

OpenAI o4-mini

ಉತ್ತರ ನೀಡದ ಪ್ರಮಾಣ
(ಯಾವುದೇ ನಿರ್ದಿಷ್ಟ ಉತ್ತರವನ್ನು ನೀಡಲಾಗಿಲ್ಲ) 

52%

1%

ನಿಖರತೆ ದರ
(ಸರಿಯಾದ ಉತ್ತರ, ಹೆಚ್ಚಿನದು ಉತ್ತಮ)

22%

24%

ದೋಷ ಪ್ರಮಾಣ
(ತಪ್ಪು ಉತ್ತರ, ಕಡಿಮೆ ಇದ್ದರೆ ಉತ್ತಮ)

26%

75%

ಒಟ್ಟು

100%

100%

ನಿಖರತೆಯ ದೃಷ್ಟಿಯಿಂದ, ಹಳೆಯ OpenAI o4-mini ಮಾಡೆಲ್ ಸ್ವಲ್ಪ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಆದರೆ, ಅದರ ತಪ್ಪು ದರ (ಅಂದರೆ ಭ್ರಮೆಗಳ ಪ್ರಮಾಣ) ಬಹಳ ಹೆಚ್ಚಾಗಿದೆ. ಅನಿಶ್ಚಿತತೆಯ ಸಂದರ್ಭದಲ್ಲಿ ಕಾರ್ಯತಂತ್ರದೊಂದಿಗೆ ಊಹಿಸುವುದು ನಿಖರತೆಯನ್ನು ಸುಧಾರಿಸುತ್ತದೆ, ಆದರೆ ದೋಷಗಳು ಮತ್ತು ಭ್ರಮೆಗಳನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. 

ಅನೇಕ ಮೌಲ್ಯಮಾಪನಗಳ ಫಲಿತಾಂಶಗಳನ್ನು ಸರಾಸರಿ ಮಾಡಿದಾಗ, ಹೆಚ್ಚಿನ ಮಾನದಂಡಗಳು ನಿಖರತೆಯನ್ನು ಮಾತ್ರ ಪರಿಗಣಿಸುತ್ತವೆ, ಆದರೆ ಇದು ಸರಿ-ತಪ್ಪು ಎಂಬ ತಪ್ಪು ದ್ವಂದ್ವವನ್ನು ತರುತ್ತದೆ. ಸಿಂಪಲ್‌QA ನಂತಹ ಸರಳೀಕೃತ ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿ, ಕೆಲವು ಮಾಡೆಲ್ ಗಳು ಸುಮಾರು 100% ನಿಖರತೆಯನ್ನು ಸಾಧಿಸುತ್ತವೆ ಮತ್ತು ಆ ಮೂಲಕ ಭ್ರಮೆಗಳನ್ನು ನಿವಾರಿಸುತ್ತವೆ. ಆದರೆ, ಹೆಚ್ಚು ಸವಾಲಿನ ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿ ಮತ್ತು ನೈಜ ಬಳಕೆಯಲ್ಲಿ, ಕೆಲವು ಪ್ರಶ್ನೆಗಳ ಉತ್ತರವನ್ನು ವಿವಿಧ ಕಾರಣಗಳಿಂದ ನಿರ್ಧರಿಸಲಾಗದಿರುವುದರಿಂದ ಶುದ್ಧತೆ 100% ಕ್ಕಿಂತ ಕೆಳಗೆ ಮಿತಿಗೊಳಿಸಲಾಗಿದೆ. ಇವುಗಳಲ್ಲಿ ಮಾಹಿತಿ ಲಭ್ಯವಿಲ್ಲದಿರುವುದು, ಸಣ್ಣ ಮಾಡೆಲ್ ಗಳ ಸೀಮಿತ ಚಿಂತನಾ ಸಾಮರ್ಥ್ಯ ಅಥವಾ ಸ್ಪಷ್ಟತೆ ಅಗತ್ಯವಿರುವ ಅನಿಶ್ಚಿತತೆಗಳು ಸೇರಿವೆ.

ಆದರೂ, ನಿಖರತೆಯ ಆಧಾರಿತ ಅಂಕಪಟ್ಟಿಗಳು ಲೀಡರ್‌ಬೋರ್ಡ್‌ಗಳು ಮತ್ತು ಮಾಡೆಲ್ ಕಾರ್ಡ್‌ಗಳಲ್ಲಿ ಪ್ರಾಬಲ್ಯ ಹೊಂದಿವೆ, ಇದರಿಂದ ಡೆವಲಪರ್‌ಗಳು ತಡೆಹಿಡಿಯುವ ಬದಲು ಊಹಿಸುವ ಮಾಡೆಲ್ಗಳನ್ನು ನಿರ್ಮಿಸಲು ಪ್ರೇರೇಪಿತರಾಗುತ್ತಾರೆ. ಅದಕ್ಕಾಗಿಯೇ, ಮಾಡೆಲ್ಗಳು ಹೆಚ್ಚು ಅಭಿವೃದ್ಧಿಯಾದರೂ ಸಹ, ಅವು ಇನ್ನೂ ಭ್ರಮೆಗಳನ್ನು ತೋರಿಸುತ್ತವೆ — ಅನುಮಾನವನ್ನು ಒಪ್ಪಿಕೊಳ್ಳುವ ಬದಲು ಆತ್ಮವಿಶ್ವಾಸದಿಂದ ತಪ್ಪು ಉತ್ತರಗಳನ್ನು ನೀಡುತ್ತವೆ.

ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ಶ್ರೇಣೀಕರಿಸಲು ಉತ್ತಮ ವಿಧಾನ

ಇದಕ್ಕೆ ಸರಳ ಪರಿಹಾರವಿದೆ. ಅನುಮಾನವನ್ನು ದಂಡಿಸುವುದಕ್ಕಿಂತ ಆತ್ಮವಿಶ್ವಾಸದ ತಪ್ಪುಗಳನ್ನು ಹೆಚ್ಚು ದಂಡಿಸಿ, ಅನುಮಾನವನ್ನು ಸರಿಯಾಗಿ ವ್ಯಕ್ತಪಡಿಸಿದರೆ ಭಾಗಶಃ ಅಂಕ ನೀಡಿ. ಈ ಆಲೋಚನೆ ಹೊಸದಲ್ಲ. ಕೆಲವು ಮಾನಕೃತ ಪರೀಕ್ಷೆಗಳು ತಪ್ಪು ಉತ್ತರಗಳಿಗೆ ನೆಗೆಟಿವ್ ಅಂಕ ನೀಡುವುದು ಅಥವಾ ಪ್ರಶ್ನೆಗಳನ್ನು ಖಾಲಿ ಬಿಟ್ಟರೆ ಭಾಗಶಃ ಅಂಕ ನೀಡುವುದು ಎಂಬ ವಿಧಾನವನ್ನು ಅಂಧ ಊಹೆ ತಪ್ಪಿಸಲು ದೀರ್ಘಕಾಲದಿಂದ ಬಳಸುತ್ತಿವೆ. ಅನೇಕ ಸಂಶೋಧನಾ ತಂಡಗಳು ಅನುಮಾನ ಮತ್ತು ಕ್ಯಾಲಿಬ್ರೇಷನ್ ಪರಿಗಣಿಸುವ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ಕೂಡ ಪರಿಶೀಲಿಸಿವೆ.

ನಮ್ಮ ಅಂಶ ಬೇರೆ. ಕೆಲವು ಹೊಸ ಅನುಮಾನ-ಸಚೇತ ಪರೀಕ್ಷೆಗಳನ್ನು ಸೇರಿಸುವುದಷ್ಟೇ ಸಾಕಾಗುವುದಿಲ್ಲ. ವ್ಯಾಪಕವಾಗಿ ಬಳಸುವ ಶುದ್ಧತೆಯ ಆಧಾರಿತ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ನವೀಕರಿಸಬೇಕು, ಹೀಗೆ ಅವುಗಳ ಅಂಕ ನೀಡುವ ವಿಧಾನ ಊಹೆಯನ್ನು ತಡೆಯಬೇಕು. ಮುಖ್ಯ ಅಂಕಪಟ್ಟಿಗಳು ಅದೃಷ್ಟದ ಊಹೆಗಳನ್ನು ಬಹುಮಾನಿಸುತ್ತಿದ್ದರೆ, ಮಾಡೆಲ್ ಗಳು ಊಹಿಸಲು ಕಲಿಯುತ್ತವೆ. ಅಂಕಪಟ್ಟಿಗಳನ್ನು ಸರಿಪಡಿಸುವುದು, ಹೊಸದಾಗಿ ಅಭಿವೃದ್ಧಿಯಾದ ಮತ್ತು ಹಿಂದಿನ ಸಂಶೋಧನೆಯ ಭ್ರಮೆ-ಕಡಿತ ತಂತ್ರಗಳನ್ನು ಹೆಚ್ಚು ಅಳವಡಿಸಿಕೊಳ್ಳಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.

ಮುಂದಿನ ಪದ ಊಹಿಸುವಿಕೆಯಿಂದ ಭ್ರಮೆಗಳು ಹೇಗೆ ಹುಟ್ಟುತ್ತವೆ

ಭ್ರಮೆಗಳನ್ನು ನಿವಾರಿಸಲು ಏಕೆ ಕಷ್ಟ ಎಂಬುದನ್ನು ನಾವು ಚರ್ಚಿಸಿದ್ದೇವೆ, ಆದರೆ ಈ ವಿಶೇಷವಾದ ವಾಸ್ತವ ದೋಷಗಳು ಮೊದಲು ಎಲ್ಲಿ ಹುಟ್ಟುತ್ತವೆ? ಅಂತೆಯೇ, ದೊಡ್ಡ ಪ್ರೀಟ್ರೈನ್ಡ್ ಮಾಡೆಲ್ ಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಅಕ್ಷರದ ತಪ್ಪುಗಳು ಅಥವಾ ಹೊಂದಿಕೆಯಾಗದ ವಕ್ರಕೋಶಗಳನ್ನು ತೋರಿಸುವುದಿಲ್ಲ. ವ್ಯತ್ಯಾಸವು ಡೇಟಾದಲ್ಲಿರುವ ಮಾದರಿಗಳ ಪ್ರಕಾರವಿದೆ.

ಭಾಷಾ ಮಾಡೆಲ್‌ಗಳು ಮೊದಲಿಗೆ ಪ್ರೀಟ್ರೈನಿಂಗ್ ಮೂಲಕ ಕಲಿಯುತ್ತವೆ, ಇದು ಬೃಹತ್ ಪ್ರಮಾಣದ ಪಠ್ಯದಲ್ಲಿ ಮುಂದಿನ ಪದವನ್ನು ಊಹಿಸುವ ಪ್ರಕ್ರಿಯೆ. ಸಾಂಪ್ರದಾಯಿಕ ಮೆಷಿನ್ ಲರ್ನಿಂಗ್ ಸಮಸ್ಯೆಗಳಿಗಿಂತ ವಿಭಿನ್ನವಾಗಿ, ಪ್ರತಿಯೊಂದು ಹೇಳಿಕೆಗೆ “ಸತ್ಯ/ಅಸತ್ಯ” ಲೇಬಲ್‌ಗಳು ಜೋಡಿಸಲ್ಪಟ್ಟಿಲ್ಲ. ಮಾಡೆಲ್ ನಿರರ್ಗಳ ಭಾಷೆಯ ಧನಾತ್ಮಕ ಉದಾಹರಣೆಗಳನ್ನು ಮಾತ್ರ ನೋಡುತ್ತದೆ ಮತ್ತು ಒಟ್ಟಾರೆ ವಿತರಣೆಯನ್ನು ಅಂದಾಜು ಮಾಡಬೇಕು. 

ಅಮಾನ್ಯವೆಂದು ಗುರುತಿಸಲಾದ ಉದಾಹರಣೆಗಳಿಲ್ಲದಿದ್ದಾಗ, ಮಾನ್ಯ ಹೇಳಿಕೆಗಳನ್ನು ಅಮಾನ್ಯ ಹೇಳಿಕೆಗಳಿಂದ ಬೇರ್ಪಡಿಸುವುದು ದ್ವಿಗುಣ ಕಷ್ಟವಾಗುತ್ತದೆ. ಆದರೆ ಲೇಬಲ್‌ಗಳಿದ್ದರೂ, ಕೆಲವು ತಪ್ಪುಗಳು ಅನಿವಾರ್ಯ. ಅದು ಏಕೆ ಎನ್ನುವುದನ್ನು ನೋಡಲು, ಸರಳವಾದ ಹೋಲಿಕೆಯನ್ನು ಪರಿಗಣಿಸಿ. ಚಿತ್ರ ಗುರುತಿಸುವಿಕೆಯಲ್ಲಿ, ಲಕ್ಷಾಂತರ ಬೆಕ್ಕು ಮತ್ತು ನಾಯಿ ಫೋಟೋಗಳನ್ನು “ಬೆಕ್ಕು” ಅಥವಾ “ನಾಯಿ” ಎಂದು ಲೇಬಲ್ ಮಾಡಿದರೆ, ಆಲ್ಗರಿದಮ್‌ಗಳು ಅವುಗಳನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ವರ್ಗೀಕರಿಸಲು ಕಲಿಯುತ್ತವೆ. ಆದರೆ ಪ್ರತಿಯೊಂದು ಪಶು ಫೋಟೋವನ್ನು ಅದರ ಹುಟ್ಟುಹಬ್ಬದ ಪ್ರಕಾರ ಲೇಬಲ್ ಮಾಡುವುದನ್ನು ಕಲ್ಪಿಸಿ. ಹುಟ್ಟುಹಬ್ಬಗಳು ಮೂಲತಃ ಯಾದೃಚ್ಛಿಕವಾದುದರಿಂದ, ಆಲ್ಗರಿದಮ್ ಎಷ್ಟು ಅಭಿವೃದ್ಧಿಯಾಗಿದ್ದರೂ ಈ ಕಾರ್ಯ ತಪ್ಪುಗಳನ್ನು ಯಾವಾಗಲೂ ತರುತ್ತದೆ.

ಇದೇ ತತ್ವವು ಪ್ರೀಟ್ರೇನಿಂಗ್‌ನಲ್ಲಿ ಅನ್ವಯಿಸುತ್ತದೆ. ಅಕ್ಷರದ ತಪ್ಪುಗಳು ಮತ್ತು ವಕ್ರಕೋಶಗಳು ಸತತ ಮಾದರಿಯನ್ನು ಅನುಸರಿಸುತ್ತವೆ, ಆದ್ದರಿಂದ ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ಅವುಗಳ ತಪ್ಪುಗಳು ಅಳಿದುಹೋಗುತ್ತವೆ. ಆದರೆ ಯಾದೃಚ್ಛಿಕ ಕಡಿಮೆ-ಆವರ್ತನೆಯ ವಾಸ್ತವಾಂಶಗಳು, ಉದಾಹರಣೆಗೆ ಪಾಶುವಿನ ಹುಟ್ಟುಹಬ್ಬ, ಮಾದರಿಗಳಿಂದ ಮಾತ್ರ ಊಹಿಸಲಾಗುವುದಿಲ್ಲ ಮತ್ತು ಆದ್ದರಿಂದ ಭ್ರಮೆಗಳಿಗೆ ಕಾರಣವಾಗುತ್ತವೆ. ನಮ್ಮ ವಿಶ್ಲೇಷಣೆ ಮುಂದಿನ ಪದ ಊಹಿಸುವಿಕೆಯಿಂದ ಯಾವ ವಿಧದ ಭ್ರಮೆಗಳು ಹುಟ್ಟುತ್ತವೆ ಎಂಬುದನ್ನು ವಿವರಿಸುತ್ತದೆ. ಆದರ್ಶವಾಗಿ, ಪೂರ್ವಭಾವಿ ಟ್ರೈನಿಂಗ್ ನಂತರದ ಹಂತಗಳು ಅವುಗಳನ್ನು ತೆಗೆದುಹಾಕಬೇಕು, ಆದರೆ ಹಿಂದಿನ ವಿಭಾಗದಲ್ಲಿ ವಿವರಿಸಿದ ತಾರ್ಕಿಕತೆಗಳಿಗಾಗಿ ಇದು ಸಂಪೂರ್ಣವಾಗಿ ಯಶಸ್ವಿಯಾಗುವುದಿಲ್ಲ. 

ತೀರ್ಮಾನಗಳು

ನಮ್ಮ ಪ್ರಬಂಧದಲ್ಲಿನ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ದೃಷ್ಟಿಕೋನವು ಭ್ರಮೆಗಳ ಸ್ವರೂಪವನ್ನು ಸ್ಪಷ್ಟಪಡಿಸಿ, ಸಾಮಾನ್ಯ ತಪ್ಪು ಕಲ್ಪನೆಗಳನ್ನು ತಳ್ಳಿ ಹಾಕುತ್ತದೆ ಎಂದು ನಾವು ನಿರೀಕ್ಷಿಸುತ್ತೇವೆ:

  • ದಾವೆ: 100% ನಿಖರವಾದ ಮಾಡೆಲ್ ಎಂದಿಗೂ ಭ್ರಮೆಗೊಳ್ಳುವುದಿಲ್ಲವಾದ್ದರಿಂದ ನಿಖರತೆಯನ್ನು ಸುಧಾರಿಸುವ ಮೂಲಕ ಭ್ರಮೆಗಳನ್ನು ತೆಗೆದುಹಾಕಬಹುದು.
    ನಿರ್ಣಯ:
    ನಿಖರತೆ ಎಂದಿಗೂ 100% ತಲುಪುವುದಿಲ್ಲ ಏಕೆಂದರೆ, ಮಾಡೆಲ್ ಗಾತ್ರ, ಹುಡುಕಾಟ ಮತ್ತು ತಾರ್ಕಿಕ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಲೆಕ್ಕಿಸದೆ, ಕೆಲವು ನೈಜ ಜಗತ್ತಿನ ಪ್ರಶ್ನೆಗಳು ಸ್ವಾಭಾವಿಕವಾಗಿ ಉತ್ತರಿಸಲಾಗದವು. 
  • ದಾವೆ: ಭ್ರಮೆಗಳು ಅನಿವಾರ್ಯ.
    ನಿರ್ಣಯ:
    ಅವು ಅನಿವಾರ್ಯವಲ್ಲ, ಏಕೆಂದರೆ ಭಾಷಾ ಮಾಡೆಲ್‌ಗಳು ಅನಿಶ್ಚಿತವಾಗಿರುವಾಗ ದೂರವಿರಬಹುದು.
  • ದಾವೆ: ಭ್ರಮೆಗಳನ್ನು ತಪ್ಪಿಸಲು ದೊಡ್ಡ ಮಾಡೆಲ್‌ಗಳಿಂದ ಮಾತ್ರ ಸಾಧಿಸಬಹುದಾದ ಬುದ್ಧಿವಂತಿಕೆಯ ಮಟ್ಟ ಅಗತ್ಯವಿದೆ.
    ನಿರ್ಣಯ:
    ಸಣ್ಣ ಮಾಡೆಲ್ ತನ್ನ ಮಿತಿಗಳನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು ಸುಲಭವಾಗಬಹುದು. ಉದಾಹರಣೆಗೆ, Māori ಪ್ರಶ್ನೆಗೆ ಉತ್ತರ ನೀಡಲು ಕೇಳಿದಾಗ, Māori ಬಲ್ಲದೇ ಇರುವ ಸಣ್ಣ ಮಾಡೆಲ್ ಸರಳವಾಗಿ “ನನಗೆ ಗೊತ್ತಿಲ್ಲ” ಎಂದು ಹೇಳಬಹುದು, ಆದರೆ ಸ್ವಲ್ಪ Māori ಬಲ್ಲ ಮಾಡೆಲ್ ತನ್ನ ಆತ್ಮವಿಶ್ವಾಸವನ್ನು ನಿರ್ಧರಿಸಬೇಕಾಗುತ್ತದೆ. ಪ್ರಬಂಧದಲ್ಲಿ ಚರ್ಚಿಸಿದಂತೆ, “ಕ್ಯಾಲಿಬ್ರೇಟೆಡ್” ಆಗಿರುವುದಕ್ಕೆ ನಿಖರತೆಗಿಂತ ಬಹಳ ಕಡಿಮೆ ಗಣನೆ ಬೇಕಾಗುತ್ತದೆ.
  • ದಾವೆ: ಭ್ರಮೆಗಳು ಆಧುನಿಕ ಭಾಷಾ ಮಾಡೆಲ್‌ಗಳಲ್ಲಿ ಒಂದು ನಿಗೂಢ ದೋಷವಾಗಿದೆ.
    ಶೋಧನೆ:
    ಭ್ರಮೆಗಳು ಉದ್ಭವಿಸುವ ಮತ್ತು ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿ ಪ್ರತಿಫಲ ನೀಡುವ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಕಾರ್ಯವಿಧಾನಗಳನ್ನು ನಾವು ಅರ್ಥಮಾಡಿಕೊಂಡಿದ್ದೇವೆ.
  • ದಾವೆ: ಭ್ರಮೆಗಳನ್ನು ಅಳೆಯಲು, ನಮಗೆ ಉತ್ತಮ ಭ್ರಮೆ ಮೌಲ್ಯಮಾಪನದ ಅಗತ್ಯವಿದೆ.
    ನಿರ್ಣಯ:
    ಭ್ರಮೆ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ಪ್ರಕಟಿಸಲಾಗಿದೆ. ಆದರೆ, ಉತ್ತಮ ಭ್ರಮೆ ಈವಾಲ್ ನೂರಾರು ಶುದ್ಧತೆಯ ಆಧಾರಿತ ಈವಾಲ್‌ಗಳ ಎದುರು ಅಲ್ಪ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ, ಅವು ವಿನಯವನ್ನು ದಂಡಿಸಿ ಊಹೆಯನ್ನು ಬಹುಮಾನಿಸುತ್ತವೆ. ಬದಲಾಗಿ, ಎಲ್ಲಾ ಪ್ರಮುಖ ಈವಾಲ್ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಅನುಮಾನ ವ್ಯಕ್ತಪಡಿಸುವಿಕೆಯನ್ನು ಬಹುಮಾನಿಸುವಂತೆ ಮರುರಚಿಸಬೇಕಿದೆ.

ನಮ್ಮ ಇತ್ತೀಚಿನ ಮಾಡೆಲ್ ಗಳಲ್ಲಿ ಭ್ರಮೆಗಳ ಪ್ರಮಾಣ ಕಡಿಮೆ ಇದೆ ಮತ್ತು ಭಾಷಾ ಮಾಡೆಲ್ ಗಳು ನೀಡುವ ಆತ್ಮವಿಶ್ವಾಸದ ತಪ್ಪುಗಳನ್ನು ಇನ್ನಷ್ಟು ಕಡಿಮೆ ಮಾಡಲು ನಾವು ಶ್ರಮಿಸುತ್ತಿದ್ದೇವೆ.

ಪ್ರಕಟಣೆಗೆ ಕೊಡುದಗೆ ನೀಡಿದವರು

Adam Kalai, Santosh Vempala (Georgia Tech), Ofir Nachum, Eddie Zhang, David Robinson, Saachi Jain, Eric Mitchell, Alex Beutel, Johannes Heidecke