各問題に「AI解説」を付けています。解説は、Unityで作った生成ツールがGeminiに問い合わせて作り、スプレッドシート経由でアプリに配信しています。
発端
2級管工事の「FRP製浄化槽の施工」の問題に、まったく別の問題(処理対象人員の算定)の解説が付いていました。古い版のデータを比べると、AIが解説を作ったあとで、スプレッドシートの問題文だけが正しい問題に差し替えられ、解説が古いまま残っていたことが分かりました。
全試験の点検
約4万5千件の解説を、問題の内容と照らし合わせました。(AIでないとできません…)最初は手元のキャッシュ(古いデータ)を見てしまい、すでに直っていた行まで「誤り」と報告していました。配信中のデータで点検し直すと、残っていたのは次のようなものでした。
看護師・作業療法士:ある日にまとめて作った解説が、1問ずつずれていた
登録販売者:別ブロックの問題の解説が付いていた
保育士:正解が「B」のように英字で表示され、本文の数字が化けていた
保育士の原因は、選択肢の先頭にある見出し「A B C D E」を、選択肢の記号と取り違えていたことでした。
収録率の低い5試験
司法書士・エックス線作業主任者・測量士補・社会保険労務士・運行管理者(旅客)は、収録率が80%未満でした。いちばん大きな原因は、AIが考えることに出力の上限を使い切り、回答が途中で切れていたことです。上限を上げると、その下に隠れていた取りこぼしが次々に出てきました。
・「アドレナリン」の「ア」を記述の記号と見なすなど、問題の形式の誤判定
・正解が複数ある問題で、AIに正解の数を伝えていなかった
・全角の「D」や、「違反しているもの」「間違っているもの」という言い方を認識できなかった
・サーバーの一時エラーで、再試行していなかった
どれも、AIは正しく答えているのに、ツールの側が不合格にしていたものです。1つ直して流し直すたびに、ログから次の原因が見つかる、という繰り返しでした。
結果
5試験の収録率は、作り直し後に約82〜95%になる見込みです。残っているのは、主にAIの答えそのものが正解と違う問題です。これらは検証で止めているので、誤った解説は配信されません。