出来事の日付:2026年6月29日。 HackerRankのオープンソース採用エージェントをテストしたエンジニアが、変更していない履歴書に付けられるスコアが大幅に変動したと報告し、生成モデルを採用活動の門番として使うことに疑問を投げかけた。Dan Unparsedが公開した報告は、このソフトウェアをローカル環境で繰り返し実行した結果を説明し、一貫した挙動を示した評価項目と、より主観的な判断を要した項目を区別している。
この採用エージェントは履歴書を解析し、候補者のGitHubプロフィールから情報を取得したうえで、複数の側面を評価するよう言語モデルに求める。著者のテストでは、デフォルトのGemma 3 4Bモデルを温度設定0.1で100回実行した。採用基準点を例として85に設定すると、同じ履歴書が実行の65%で基準を下回ったと著者は述べた。
すべての構成要素が同じ程度に変動したわけではない。技術スキルのスコアはほぼ一定で、98回の実行で10点満点中8点だった。著者は、この安定性をチェックリストのような評価の結果だと解釈した。明記されたスキルは比較的容易に特定できるためだ。対照的に、プロジェクトのスコアは、モデルが同じ成果物について異なる定性的解釈を行き来するにつれて大きく変化した。報告によると、温度をゼロに下げても変動はなくならなかった。
Geminiを使った比較では、幅は48~64と狭まったものの、依然として重大な影響をもたらし得るものだった。仮に基準点を60とすると、同一の応募の28%が不合格になった。後にClaude Opus 4.8で行った試験でも、全体の範囲は48~64から49~63へとわずかに縮まっただけとされ、プロジェクト項目は引き続き変動した。これは1人の執筆者が1通の履歴書について行ったテストであり、実運用されている採用システムの広範な監査ではないため、結果はその限界を踏まえて読むべきである。
この批評では、評価ツールの重み付けも検証した。テストされた設定では、オープンソースでの活動とプロジェクトが合わせてスコアの65%を占めており、職務上の成果が非公開だったりGitHubに掲載されていなかったりする経験豊富なエンジニアが不利になる可能性がある。著者はまた、評価基準の一部に、ジュニアとシニアの経験を区別するための明確な基準点がないことも見いだした。
基盤となるリポジトリは、新たにオープンソース化されたとするソーシャルメディア投稿とは異なり、2025年10月から公開されていたとみられる。したがって、中心的な懸念は公開日ではなく、確率的な判断によって人間による審査を受けられるかどうかを安全に決められるのかという点にある。この実験が裏付けるのは、より限定的な結論だ。自動解析と事実情報の抽出は有用かもしれないが、人間が確認しない数値ランキングは、雇用主が一貫性を期待する場面に偶然性を持ち込み得る。この報告は、HackerRankが雇用判断を行うために、まさにこのスコアリング設定を導入したとは述べていない。評価対象は、執筆者が設定した公開エージェントであるため、実運用上の方針、モデルの選択、人間による審査、候補者保護策は異なる可能性がある。現実の不採用率を推定するには、そうした詳細が必要となる。



