TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月30日
KLIP: 拡散モデルの事前分布を用いたKL発散による逆問題での局所的分布シフト検出拡散モデルを活用した異常検知技術の新展開が報告された。研究チームは、KL発散に基づく新しい検出メトリクス「KLIP」を開発し、画像に含まれる分布シフトを高精度で識別できることを実証した。 従来の異常検知手法では、事前に大量のキャリブレーションデータが必要とされていた。これに対してKLIPは、そうした準備過程を省略しながら、医療画像などで微妙な異常を捉えることが可能だという。 研究では、健康なCTスキャン画像と腫瘍を含む画像との間に生じる分布の違いを効果的に検出できることが確認された。重要な点として、異常が画像全体に影響する場合だけでなく、限定的な領域に局所化した異常パッチも識別できる。医療診断の精度向上が期待される一方で、この技術は製造業における品質管理など、様々な産業応用の可能性を秘めている。 引用元:arXiv cs.LG
arXiv cs.LG
2026年6月1日
大規模言語モデルの不確実性における人間的整合性、キャリブレーション、活性化パターンarXiv:2605.30675v1 不確実性定量化は大規模言語モデルの行動分析における大規模で成長するサブフィールドである。主にハルシネーション認識および対策のため、このフィールドは不確実性判断のタスク有効性への精度であるキャリブレーションの測定と改善に主に焦点を当ててきた。本研究では、
arXiv cs.CL
2026年6月1日
キャリブレーション済み選好学習:ラベルランキングの場合キャリブレーション(予測確率と真の結果頻度の整合)は信頼できる意思決定に不可欠である。分類と回帰で広く研究されている一方、確率的ラベルランキングにおけるキャリブレーションはまだ正式に取り組まれていない。ここで目標は分布を予測することである。
arXiv cs.LG
2026年6月8日
SafeGene: 転送可能な安全性アライメントのための再利用可能なアダプターオープンウェイトLLMは、カスタマイズされたアシスタントへのファインチューニングが増加していますが、下流のファインチューニングにより安全性アライメントが弱まり、訓練データが意図的に有害でない場合でも、モデルが悪質なプロンプトに対して脆弱になる可能性があります。ターゲットモデルが新しいタスクデータやユーザーインタラクションで繰り返し更新されるため、反復的な安全性回復の問題が生じます。本論文では、各アーキテクチャ互換モデルファミリー内での横断的再利用のために設計された再利用可能な安全性アダプターモジュール「SafeGene」を提案します。安全性回復をモデル固有の修復ステップとして扱う代わりに、SafeGeneは安全性能力をタスク固有の更新から分離された独立した再利用可能なアダプター表現として扱います。この表現は、アラインされた-劣化したモデルの差分から取得され、データに対応したレイヤー選択を通じてタスク転送可能な安全性ベクトルに精密化され、各下流タスク適応モデルで少数ショットレイヤー単位の係数再キャリブレーションを通じて表現されます。
arXiv cs.AI
2026年6月8日
テラヘルツ双櫛分光法を用いたポリマー分類のための多スケール特徴注意ネットワークリサイクルプラスチックの品質と安全性を確保するためのポリマー識別は重要だが、従来の分別および分光技術は堅牢な判別をもたらすのに苦労している。テラヘルツ双櫛分光法(THz-DCS)は、迅速で高解像度かつ非破壊測定を提供する有望な代替手段となる。本研究では、THz-DCSを利用して純粋なポリマー、多層フィルム、商用ブレンド、およびバイオポリマーを含む12種類のポリマーを分類する。これらのスペクトル信号の複雑性に対処するため、THz-DCSデータ向けに設計された新しいディープラーニングアーキテクチャである多スケール特徴注意ネットワーク(MSFAN)を提案する。このフレームワークは信号再キャリブレーション用の特徴ゲーティングと多様な周波数パターンを捉えるための多スケール並列畳み込みを統合している。これらの特徴は交差特徴注意と注意プーリングを通じてさらに洗練され、モデルが最も有用なテラヘルツ領域を本質的に強調することを可能にする。MSFANは最先端モデルを一貫して上回り、85.2%の分類精度に達する。
arXiv cs.LG
2026年6月10日
勾配ブースティングと分布フリーカバレッジを用いた非アルコール性脂肪性肝疾患のリスク予測arXiv:2606.09860v1 発表タイプ: new 概要: 非アルコール性脂肪性肝疾患(NAFLD)は世界中の成人の約25%に影響を与え、肝臓および心血管系に重大なリスクをもたらします。しかし、集団レベルでのスクリーニングツールは依然として不十分です。我々は、勾配ブースト決定木とコンフォーマル予測を組み合わせたNAFLDリスク予測のための機械学習フレームワークであるMethodを提案します。これにより、個々のリスク推定値に対して、キャリブレーションされた、分布フリーのカバレッジ保証が得られます。Methodは、相互情報量に基づく安定性選択手順を統合し、ブートストラップリサンプリングを通じて、コンパクトで臨床的に解釈可能な特徴サブセットを特定します。これにより、ユーザー指定の信頼水準を証明可能に超える周辺カバレッジを持つ予測セットを構築します。我々は、広州、中国の多施設コホート(主解析n=2,187、外部検証n=412)で、人口統計、代謝バイオマーカー、ライフスタイル要因にわたる78の候補特徴量を使用してMethodを評価しました。
arXiv cs.LG
2026年6月16日
CoRA:信頼性の高い思考連鎖推論のための信頼度と根拠の整合性思考連鎖(CoT)推論はLLMのパフォーマンスを向上させることができますが、CoTの根拠がもっともらしくても不完全または十分に裏付けられていない場合、高い回答信頼度は誤解を招く可能性があります。本研究では、モデルがコミットした回答に対する信頼度が、生成された根拠によって正当化されるかどうか、すなわち信頼度と根拠の整合性について調査します。回答の正しさ、コミットされた回答の確率、およびルーブリック(評価基準)に基づく根拠のサポートを共同で評価するGRPOベースの強化学習フレームワークを導入しました。このルーブリックは、正解を明かさずに、根拠のグラウンディング(根拠付け)、一貫性、タスクへの適合性、および選択された回答との関連性を評価します。MedQA、MathQA、OpenBookQAの3つのオープンウェイトLLMを用いた実験では、本手法は、チューニングされていないチェックポイント、SFT、および正しさのみを重視するGRPOと比較して、信頼度と根拠の整合性エラーを最大26.51%削減し、競争力のある精度を維持しつつ、しばしばキャリブレーション(校正)を改善しました。
arXiv cs.CL
2026年6月17日
薬物警戒における因果推論におけるモデル選択の重要性:InferBERTフレームワーク内での分類モデルの比較分析因果関係のある有害薬物事象(ADE)を偽相関から区別することは、薬物警戒における中心的な課題です。InferBERTフレームワークは、TransformerモデルとDo-calculusを統合していますが、その成功は基盤となる分類モデルに依存します。本研究では、InferBERTにおけるモデル選択の影響を評価し、単純なモデルで十分か、ドメイン固有の事前学習が役立つか、LLMへのスケーリングが因果検出を改善するか、事後キャリブレーションの効果を検証します。分析対象は、Analgesics-induced Acute Liver Failure (AILF) と Tramadol-related Mortalities (TRAM) の2つのベンチマークです。XGBoost(ベースライン)、ALBERT(元のInferBERT)、BioBERT(生物医学Transformer)、Med-LLaMA(医療LLM)の4つのモデルを、20回の繰り返しで5分割交差検証を用いて評価しました。
arXiv cs.LG
2026年6月19日
分布シフト下におけるキャリブレーションされた混合エキスパートモデルに向けて新しい研究が、混合エキスパート(MoE)モデルがデータ分布の変化、いわゆる分布シフトの状況下でどのように機能するかを詳細に分析しました。この研究は、特にモデルが情報をどのように振り分けるか(ルーティングメカニズム)と、個々の専門家(エキスパート)の出力がどれほど正確に確率を表現しているか(キャリブレーション)の相互作用に焦点を当てています。 分析の結果、MoEモデルにおいて、特定のルーティング方法(ハードルーティング)が用いられている場合、広範囲な分布シフトがあっても個々のエキスパートが適切にキャリブレーションされていれば、モデル全体のキャリブレーションも保たれることが示されました。しかし、別のルーティング方法(ソフトルーティング)の場合には、個々のエキスパートのキャリブレーションだけでは不十分であることが明らかになりました。 この課題に対応するため、研究者たちは「敵対的再重み付け」という手法を提案しています。これは、分布シフトが生じた際に、ルーティングされた情報の集約におけるキャリブレーション誤差に対してペナルティを課すことで、モデル全体の信頼性を向上させることを目指しています。 引用元: arXiv cs.AI
arXiv cs.AI
2026年6月19日
最適な決定論的多重キャリブレーションと全予測新しい研究により、機械学習における予測器の信頼性に関する長年の課題が解決されました。arXiv cs.LGに掲載された本研究は、決定論的な多重キャリブレーションアルゴリズムを提案し、そのアルゴリズムが最小最大最適性を達成することを実証しています。 これまで決定論的予測器は、そのサンプル複雑性において確率的予測器に大きく劣ると考えられていました。しかし、今回の研究で提示された新しいアルゴリズムは、決定論的予測器が確率的予測器と同等の最適性を実現できることを示しました。これは、信頼性の高い機械学習モデルの構築において重要な進展となります。 この成果は、予測の精度だけでなく、その予測がどれほど信頼できるかという「キャリブレーション」の分野における画期的な発見です。特に、AIの意思決定が社会に与える影響が大きくなる中で、その予測がどの程度信頼できるかを明確にすることは極めて重要です。本研究は、この信頼性向上に大きく貢献するものと期待されます。 引用元: arXiv cs.LG
arXiv cs.LG
2026年6月19日
因果帰属によるプルーニングで大規模言語モデルの推論性能を維持大規模言語モデル(LLM)は多段階推論に優れているが、推論コストが大きい。本研究では、因果帰属プルーニング(CAP)を提案する。これは、推論タスクに対する因果的影響を測定することで重要なアテンションヘッドを特定し、これらのヘッドレベルのスコアを用いてきめ細やかな重みプルーニングをガイドする、トレーニング不要な手法である。CAPは、各アテンションヘッドについて、少数の推論問題のキャリブレーションセットでのフォワードパス中にヘッドをマスクした場合の期待される性能低下を推定する。これらの因果スコアは、対応する射影行列の重みレベルの重要度値に変換される。マグニチュードのみまたは活性化ベースの基準とは異なり、CAPの介入的測定は各ヘッドの機能的貢献を直接捉え、20%のスパース性でARC-ChallengeにおいてWandaと比較して最大61%の相対的な精度向上をもたらす。Llama-3-8B-InstructおよびMistral-7B-Instructを使用し、10%、20%、50%のスパース性でGSM8K、StrategyQA、ARC-ChallengeでCAPを評価した。
arXiv cs.CL
2026年6月19日
INNOCN、5万円台で買える27型4Kクリエイター向けモニターINNOCNは6月18日、Delta E 2未満の工場出荷時キャリブレーションに対応したクリエイターおよびビジネス向け27型4Kモニター「CB27U1」を発売した。
PC Watch
2026年6月22日
[ITmedia PC USER] カラーマネジメントツール「Datacolor Spyder」がタイムセールで15%オフの2万7879円にAmazon.co.jpで、ディスプレイの色精度を向上させるカラーマネジメントツールのタイムセールが実施されている。わずか90秒で正確なキャリブレーションが行え、写真や映像の編集作業に適したアイテムだ。
ITmedia 全カテゴリ
2026年6月24日
物理制約付きMCMCと化学情報付きガウス過程のシナジーによる反応ネットワーク発見離散的な反応トポロジーと連続的な速度論的パラメータが密接に結合しているため、スパースでノイズの多い化学時系列データから解釈可能な支配方程式を抽出することは依然として困難です。本稿では、スパイクアンドスラブトポロジーサンプリング、ハード保存および熱力学スクリーニング、そしてパラメータキャリブレーションおよび実験設計のための化学情報付きガウス過程(CIGP)残差モデルを組み合わせた、再現可能なグレイボックスワークフローであるPC-MCMC-CIGPを提案します。方法論的な貢献は、単独の新しいMCMCまたはGPファミリではなく、むしろこれらのコンポーネントを明示的な不確実性認識型取得選択を備えた物理制約付きワークフローに統合することです。H2 + Br2ベンチマークでは、制約付きサンプラーは実験において、欺瞞的な現象論的適合から素ラジカル経路を区別します。スチレンのエポキシ化では、CIGP最適化ループは報告されたGP-BOベースラインと比較して最終収率を12.5%向上させます。
arXiv cs.LG
2026年6月29日
MER-R1:Slow-Fast思考のシナジーによるマルチモーダル感情推論明示的な推論は、予測の解釈可能性を高めるものの、必ずしもマルチモーダル感情認識(MER)の精度向上に結びつかないことがわかりました。具体的には、推論ベースのMLLMにおいて、熟慮的な推論後の「遅い思考」よりも、直接的な回答をトリガーする「速い思考」の方がしばしば優れた性能を発揮します。経験的な分析により、「速い思考」はより広範で自信のある予測によりリコールを改善する一方、「遅い思考」は不正確なカテゴリの保守的なフィルタリングを通じて精度を優先することが示されました。これらの洞察に基づき、我々はSlow-Fastの相補性を明示的な最適化に転換する強化学習フレームワークMER-R1を提案します。デュアルオブジェクトの分離により、リコールと精度を2つの最適化信号に分離し、互いにトレードオフされるのではなく、共同で最適化できるようにします。Slow-Fastの信頼度キャリブレーションは、最終的な「遅い思考」の回答を「速い思考」の直感にさらに一致させ、正しい感情を強化しながら不正確な感情を抑制します。
arXiv cs.AI
2026年6月30日
間違った理由での正しいコーディング? 理論的構成概念の測定器としてのLLMの妥当性検証人間のアノテーターのようにテキスト内の構成概念をコーディングする大規模言語モデル(LLM)が、信頼できるコーダーとなるのは、その一致によってです。しかし、信頼性は構成概念妥当性には影響しません。その測定器は理論に疎く、構成概念の理論が要求するものを何も満たさない相関関係を通じてコードに到達する可能性があり、現在のどの方法でもそれを真の測定から区別できません。私たちは、そのギャップを埋める方法として、グレインキャリブレーションを提案します。これは、構成概念を節レベルのコンポーネントに分解し、抽出証拠を用いて各コンポーネントをテキストに対してテストし、明示的な理論導出ルールを通じて結果を組み合わせます。ルールは不透明な1回のパスに格納されるのではなく明記されるため、その構造は出力ではなくプロセスに関する証拠となります。どのコンポーネントがコードを決定したか、そしてコードが間違っていた場合には、コンポーネントが見落とされたのか、それとも隣接する構成概念が誤って識別されたのかを示します。
arXiv cs.CL
2026年7月1日
キャリブレーションランキングが逆転する時:LLMの公平な比較のための精度制御評価キャリブレーションは、モデルの信頼度が経験的な精度と一致しているかどうかを評価します。既存の研究では、期待キャリブレーション誤差やブライアースコアなどのグローバルキャリブレーションメトリクスを用いて、異なる大規模言語モデル(LLM)のキャリブレーションを比較することがよくあります。本稿では、理論的および経験的に、このような比較がモデル精度の違いによって混乱されることを示します。より公平なクロスモデル比較のために、3つの補完的な視点、すなわちインスタンスアライン、分布アライン、および候補アラインキャリブレーションを備えた精度制御評価フレームワークであるACEを提案します。複数のベンチマーク、モデルファミリー、および信頼度引き出し方法にわたって、ACEを使用して、小規模モデル対大規模モデル、思考モデル対非思考モデルという2つの実用的に重要な比較軸を研究します。生のグローバルメトリクス下で以前に報告された多くのキャリブレーション上の利点は、精度制御後には大幅に弱まることがわかります。また、ランキングの逆転が頻繁に発生することもわかります。
arXiv cs.CL
2026年7月2日
検証可能な報酬によるキャリブレーションされた確率的予測検証可能な報酬を持つ強化学習は、原則として、真の確率によって期待値が最小化され、結果のみから計算されるブライアースコアのような適切なスコアリングルールであるため、キャリブレーションされた確率的予測器を訓練できます。実際には、キャリブレーションは低下し、既存の解決策は、モデルの信頼度が検証可能な正誤を伴う不確実性に対処します。ここでは、予測自体が出力であり、ラベルが1つの確率的結果であるアレアトリー予測を研究し、NFLの試合中の勝率をベッティング市場を参照としてテストベッドとして使用します。実現したプレーごとの結果に報酬を与えることは失敗します。単一の結果はノイズの多いターゲットであり、ポリシー勾配は思考の連鎖を破損するためです。過去の結果から推定された、ラベルのない検証可能な報酬である状態条件付き経験的勝率を導入し、ラベルノイズを削除します。また、直接予測または勾配マスクによって、破損できないように勾配を推論から除外します。
arXiv cs.LG
2026年7月7日
固定カメラから自由カメラへ:キャリブレーション不要の視点頑健なビジョン・言語・アクションモデルロボットの現実世界での展開では、カメラの設置場所が変更されることがよくある。既存の視点頑健なVLAポリシーは、カメラの外観情報が明示的に提供されないと、このようなカメラの変動に対応できない。本研究では、カメラ中心VLA(CamVLA)を提案する。これは、カメラ中心のエンドエフェクターアクションと、カメラとロボットベースの関係を示すハンドアイ行列を予測することで、操作制御とカメラジオメトリを分離する。
arXiv cs.AI
2026年7月9日
大規模行動モデル:小売顧客のプロンプタブル・デジタルツイン顧客行動モデリングは、レコメンデーション、マーケティング、意思決定支援の基盤となりますが、既存のアプローチは、決定を説明せずに予測精度を最適化するか、実際の行動データに根拠を持たせずにユーザーをシミュレーションするかのいずれかです。本稿では、大規模な小売取引データから、統合された「人物・環境」フォーミュレーションを通じて、顧客の意思決定を直接学習する大規模行動モデル(LBM)を提案します。顧客の状態は、過去の購入履歴から導き出される行動プロファイルによって表現され、製品コンテキストは、検索拡張生成(Retrieval-Augmented Generation)によって組み込まれます。このモデルは、言語化された行動データに対する継続的な事前学習、意思決定生成のための教師ありファインチューニング、そして証拠に基づくキャリブレーションのための検証可能な報酬を用いた強化学習によって訓練されます。提案されたフレームワークを、購入予測、ハードネガティブ識別、バスケット補完、プロモーション反応、ドメイン間バウチャー交換の各タスクで評価します。
arXiv cs.AI
2026年7月14日
KVキャッシュ圧縮のためのアブレーション、統計的推論、および検証本研究は、Turbo-QuantとSpectralQuantのKVキャッシュ圧縮を体系的に比較し、統計的検証手法を用いて、WHT回転(Beta Lloyd-MaxおよびQJLと併用)を含む非支配的なスキームを評価する。この手法は、体系的なコーデックの違いと実装のばらつきを分離する。主な発見として、固有基底ベースの方法は共分散の不安定性によりヘビーテイルデータでは失敗するが、構造化された領域では優れており、実効意味次元(d_eff)は真のデータランクではなく、キャリブレーション予算に適応することが明らかになった。(これはアブストラクトのアブストラクトです。ありがとうございます)
arXiv cs.LG
2026年7月14日
デバイス上リアルタイム字幕翻訳のためのワークロード駆動型最適化本レポートは、台湾を対象としたオンデバイスでの英語から繁体字中国語への字幕翻訳について、短い入力、短い出力、バッチサイズ1の推論、低遅延、プライバシーの制約下での研究を行います。これらの条件は、長文コンテキストまたは高スループットの言語モデルサービング用に設計された最適化の価値を制限します。LMT-60-0.6Bから始めると、予備的なプロファイリングにより、GGUF量子化がTransformerブロックの相対コストを削減した後、語彙投影がデコード時のコストとしてより重要になることが示唆されます。元の151kトークンの語彙を64kトークンの字幕ドメイン・トークナイザーに置き換え、埋め込み空間を移行し、埋め込みキャリブレーションとそれに続く完全な教師ありファインチューニングによってモデルを適応させます。OpenSubtitles2024テストセットの固定500例のサブセットで、LocalSubsはGPT-4oペアワイズ評価においてGoogle Translateに対して59.2%の引き分け除外勝率を達成しました。パフォーマンスは短いキューで最も強く、キュー長が増加するにつれて低下します。
arXiv cs.CL
2026年8月7日
CalibForge:学習可能な最終タスクのスケーリングのための敵対的ソルバーキャリブレーション学習可能なタスクを効率的に生成する新しいシステム「CalibForge」が開発されました。このシステムは、AIエージェントのトレーニングに不可欠な、解くだけでなく学習に適した難易度のタスクを自律的に作り出すことを目指しています。 CalibForgeの最大の特徴は、検証済みのソルバー(問題を解くプログラム)の動作を分析し、候補となるタスクを改良する点にあります。具体的には、複数の異なるソルバー間で発生する食い違いや、特定の強さのタスクには対応できるが弱いタスクには失敗する、といった関係性をターゲットにします。これにより、タスクの解きやすさをソルバーごとに調整し、AIが学習しやすい「学習可能ゾーン」を維持しながら、実証された解可能性を確保します。このアプローチにより、より効果的なAIトレーニングが可能になると期待されています。 引用元: arXiv cs.LG
arXiv cs.LG
2026年8月14日
多ラベルジャカード測度に対する指数関数的凸キャリブレーション次元多ラベル分類や二値セグメンテーションの評価指標として広く用いられているジャカードスコア(IoU)について、その性質をより深く理解するための新たな研究成果が発表されました。この研究では、ジャカードスコアを計算する際の「損失行列」に非特異性とアフィン次元が存在することを数学的に証明しました。 さらに、Möbius反転という数理的手法とMinHashグラム表現というデータ構造を組み合わせることで、ジャカードスコアの「キャリブレーション次元」が取りうる範囲を特定することに成功しました。このキャリブレーション次元は、モデルの性能をより正確に評価・調整する上で重要な概念です。 今回の発見は、多ラベル分類やセグメンテーションタスクにおけるモデルの性能評価や改善に新たな視点をもたらす可能性があり、今後の研究開発に貢献することが期待されます。(arXiv cs.LG)
arXiv cs.LG